763 миллиарда параметров под MIT: веса DeepSeek V4.1 Flash уже на Hugging Face
DeepSeek открыла веса V4.1 Flash: MoE на 763 млрд параметров, контекст 1 млн токенов, нативное зрение и рекорды на агентных бенчмарках. Разбираем архитектуру CED.

Вчера мы писали про тестовый API-эндпоинт V4.1 Flash с говорящим суффиксом expires-on-0910 — и предполагали, что за ним последует официальный релиз. Он оказался щедрее ожиданий: DeepSeek не просто открыла модель в API, а выложила полные веса на Hugging Face под лицензией MIT. 763 миллиарда параметров в safetensors, технический отчёт в PDF и референсная реализация инференса — забирайте и запускайте. Тред на r/LocalLLaMA собрал 550+ апвоутов и 239 комментариев за несколько часов и стал самым обсуждаемым постом дня.
Что внутри
Формально V4.1 Flash — мультимодальная MoE-модель с 552 млрд параметров в основной сети (плюс 196 млрд в условной памяти Engram, которая подключается разреженно, через token-based lookup) и контекстом до миллиона токенов. Зрение здесь нативное: энкодер DeepSeek-ViT обучался с нуля вместе с языковой частью на мультимодальном корпусе в 45 трлн токенов, а не пристыковывался после.
Самое интересное — архитектура. DeepSeek использует схему Causal Encoder-Decoder: 40-слойный трансформер разбит на 20-слойный каузальный энкодер и 20-слойный декодер, причём глобальный KV-кеш декодера проецируется из финальных состояний энкодера. На практике это означает, что на prefill модель активирует всего 8 млрд параметров на токен, на декодировании — 16 млрд. Для агентных нагрузок, где вход огромный, а выход сравнительно короткий, это прямая экономия денег.
Вторая находка — Compressed Sparse Attention 2 в связке с FP4-кешем: суммарно глобальный KV-кеш ужат до 890 байт на токен. Это примерно вчетверо меньше, чем у V4 Flash, и в 437 раз меньше, чем у первого DeepSeek. Подзаголовок технического отчёта — «Pushing the Limits of KV Cache Compression» — здесь не маркетинг, а точное описание.
Ключевые характеристики:
- Архитектура: MoE, 552B backbone + 196B Engram (763B суммарно)
- Активные параметры: 8B (prefill) / 16B (decode)
- Контекст: до 1 млн токенов
- KV-кеш: 890 байт/токен (FP4, формат E2M1)
- Обучение: 45 трлн токенов, мультимодальный корпус
- Усилие рассуждения: плавная настройка от 1 до 100
- Лицензия: MIT
Бенчмарки: агентный профиль
На классических знаниевых тестах модель ожидаемо уступает гигантам, но DeepSeek целилась не туда. Профиль V4.1 Flash — агентные задачи, и там она местами обходит фронтир, стоящий на порядки дороже.
| Бенчмарк | V4.1 Flash | Opus 5.0 | GPT-5.6 Sol |
|---|---|---|---|
| Terminal-Bench 2.1 (Pass@1) | 90.6 | 89.1 | 88.8 |
| DeepSWE v1.1 (Resolved) | 74.2 | 74.0 | 73.0 |
| Agent's Last Exam (Pass@1) | 31.8 | 28.6 | 26.7 |
| AutomationBench (Pass@1) | 54.8 | 50.3 | 45.8 |
| GPQA Diamond (Pass@1) | 90.9 | 93.4 | 94.1 |
| Terminal-Bench 4.0 (Pass@1) | 31.2 | 51.8 | 39.9 |
Источник: карточка модели на Hugging Face
Цифры — из карточки модели, замеры самой DeepSeek при максимальном усилии рассуждения. К самоотчётам стоит относиться с обычной осторожностью, но картина складывается последовательная: на «рабочих» агентных задачах (терминал, реальные issues из репозиториев, автоматизация) модель играет на уровне Opus 5 и GPT-5.6 Sol, а на самых свежих и тяжёлых версиях бенчмарков вроде Terminal-Bench 4.0 фронтир пока заметно впереди. В Reddit-треде релиз окрестили «98% Astra за 1,4% цены» — формула из соседнего поста про API, и к весам она применима ещё буквальнее.
Почему это важно
Для локального запуска 763 млрд параметров — уже не фантастика: BF16-веса требуют серьёзного железа, но комьюнити оперативно взялось за дело — на Hugging Face спустя сутки лежит 15 квантизаций под llama.cpp, LM Studio, Jan и Ollama. С активными 8–16 млрд параметров и рекордно компактным KV-кешем V4.1 Flash выглядит одной из самых практичных больших моделей для самостоятельного хостинга: именно KV-кеш обычно съедает память при длинных контекстах и множестве параллельных сессий.
Стратегически это продолжение линии, которую мы наблюдаем весь год: китайские лаборатории делают открытость оружием в ценовой войне. Кимi K3 показала, что открытые веса могут играть во фронтире; DeepSeek добавляет к этому агрессивную экономику инференса. Для западных закрытых моделей это неприятный клин: за агентные пайплайны, где важна цена за токен, а не последние проценты качества, теперь конкурирует модель, которую можно вообще не покупать — а развернуть у себя.
Что дальше
Официального анонса V4.1 Pro пока нет, но нумерация версий и история релизов DeepSeek подсказывают, что флагман на подходе. Тестовый эндпоинт в API уже сменился постоянным, сниженные с 10 сентября цены на Flash-линейку действуют. Если вы собирали агентов на V4 Flash — миграция выглядит почти бесплатным апгрейдом: быстрее, дешевле по памяти и с нативным зрением в комплекте.


