GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
deepseekopen-sourceвесаmoeагенты

763 миллиарда параметров под MIT: веса DeepSeek V4.1 Flash уже на Hugging Face

DeepSeek открыла веса V4.1 Flash: MoE на 763 млрд параметров, контекст 1 млн токенов, нативное зрение и рекорды на агентных бенчмарках. Разбираем архитектуру CED.

Влад МакаровВлад Макаровпроверил и опубликовал
6 мин чтения
763 миллиарда параметров под MIT: веса DeepSeek V4.1 Flash уже на Hugging Face

Вчера мы писали про тестовый API-эндпоинт V4.1 Flash с говорящим суффиксом expires-on-0910 — и предполагали, что за ним последует официальный релиз. Он оказался щедрее ожиданий: DeepSeek не просто открыла модель в API, а выложила полные веса на Hugging Face под лицензией MIT. 763 миллиарда параметров в safetensors, технический отчёт в PDF и референсная реализация инференса — забирайте и запускайте. Тред на r/LocalLLaMA собрал 550+ апвоутов и 239 комментариев за несколько часов и стал самым обсуждаемым постом дня.

Что внутри

Формально V4.1 Flash — мультимодальная MoE-модель с 552 млрд параметров в основной сети (плюс 196 млрд в условной памяти Engram, которая подключается разреженно, через token-based lookup) и контекстом до миллиона токенов. Зрение здесь нативное: энкодер DeepSeek-ViT обучался с нуля вместе с языковой частью на мультимодальном корпусе в 45 трлн токенов, а не пристыковывался после.

Самое интересное — архитектура. DeepSeek использует схему Causal Encoder-Decoder: 40-слойный трансформер разбит на 20-слойный каузальный энкодер и 20-слойный декодер, причём глобальный KV-кеш декодера проецируется из финальных состояний энкодера. На практике это означает, что на prefill модель активирует всего 8 млрд параметров на токен, на декодировании — 16 млрд. Для агентных нагрузок, где вход огромный, а выход сравнительно короткий, это прямая экономия денег.

Вторая находка — Compressed Sparse Attention 2 в связке с FP4-кешем: суммарно глобальный KV-кеш ужат до 890 байт на токен. Это примерно вчетверо меньше, чем у V4 Flash, и в 437 раз меньше, чем у первого DeepSeek. Подзаголовок технического отчёта — «Pushing the Limits of KV Cache Compression» — здесь не маркетинг, а точное описание.

Ключевые характеристики:

  • Архитектура: MoE, 552B backbone + 196B Engram (763B суммарно)
  • Активные параметры: 8B (prefill) / 16B (decode)
  • Контекст: до 1 млн токенов
  • KV-кеш: 890 байт/токен (FP4, формат E2M1)
  • Обучение: 45 трлн токенов, мультимодальный корпус
  • Усилие рассуждения: плавная настройка от 1 до 100
  • Лицензия: MIT

Бенчмарки: агентный профиль

На классических знаниевых тестах модель ожидаемо уступает гигантам, но DeepSeek целилась не туда. Профиль V4.1 Flash — агентные задачи, и там она местами обходит фронтир, стоящий на порядки дороже.

БенчмаркV4.1 FlashOpus 5.0GPT-5.6 Sol
Terminal-Bench 2.1 (Pass@1)90.689.188.8
DeepSWE v1.1 (Resolved)74.274.073.0
Agent's Last Exam (Pass@1)31.828.626.7
AutomationBench (Pass@1)54.850.345.8
GPQA Diamond (Pass@1)90.993.494.1
Terminal-Bench 4.0 (Pass@1)31.251.839.9

Сравнение DeepSeek V4.1 Flash с Kimi K3, GLM-5.3, Opus 5 и GPT-5.6 Sol на агентных бенчмарках Источник: карточка модели на Hugging Face

Цифры — из карточки модели, замеры самой DeepSeek при максимальном усилии рассуждения. К самоотчётам стоит относиться с обычной осторожностью, но картина складывается последовательная: на «рабочих» агентных задачах (терминал, реальные issues из репозиториев, автоматизация) модель играет на уровне Opus 5 и GPT-5.6 Sol, а на самых свежих и тяжёлых версиях бенчмарков вроде Terminal-Bench 4.0 фронтир пока заметно впереди. В Reddit-треде релиз окрестили «98% Astra за 1,4% цены» — формула из соседнего поста про API, и к весам она применима ещё буквальнее.

Почему это важно

Для локального запуска 763 млрд параметров — уже не фантастика: BF16-веса требуют серьёзного железа, но комьюнити оперативно взялось за дело — на Hugging Face спустя сутки лежит 15 квантизаций под llama.cpp, LM Studio, Jan и Ollama. С активными 8–16 млрд параметров и рекордно компактным KV-кешем V4.1 Flash выглядит одной из самых практичных больших моделей для самостоятельного хостинга: именно KV-кеш обычно съедает память при длинных контекстах и множестве параллельных сессий.

Стратегически это продолжение линии, которую мы наблюдаем весь год: китайские лаборатории делают открытость оружием в ценовой войне. Кимi K3 показала, что открытые веса могут играть во фронтире; DeepSeek добавляет к этому агрессивную экономику инференса. Для западных закрытых моделей это неприятный клин: за агентные пайплайны, где важна цена за токен, а не последние проценты качества, теперь конкурирует модель, которую можно вообще не покупать — а развернуть у себя.

Что дальше

Официального анонса V4.1 Pro пока нет, но нумерация версий и история релизов DeepSeek подсказывают, что флагман на подходе. Тестовый эндпоинт в API уже сменился постоянным, сниженные с 10 сентября цены на Flash-линейку действуют. Если вы собирали агентов на V4 Flash — миграция выглядит почти бесплатным апгрейдом: быстрее, дешевле по памяти и с нативным зрением в комплекте.

Похожие новости

Листайте вниз

для загрузки следующей статьи