Открытая DeepSeek обошла GPT-6 Astra на новом бенчмарке Artificial Analysis
DeepSeek V4.1 Flash на 4-битных весах обошла флагман OpenAI на агентном бенчмарке AA: 92% успеха задач и инференс на 37% быстрее. Акции SK Hynix упали.

Открытая модель на 4-битных весах, запущенная на потребительских GPU, обошла флагман OpenAI на новом агентном бенчмарке Artificial Analysis. DeepSeek V4.1 Flash показала 92% успешно выполненных задач при инференсе на 37% быстрее, чем у GPT-6 Astra. Тред на r/LocalLLaMA — 634 апвоута, флер откровенно злорадный: помечен тегом Funny.
Что произошло
AA-Bench — свежая серия агентных замеров Artificial Analysis: не вопросы с вариантами ответов, а сквозные задачи с инструментами, структурированным JSON-выводом и таймером. Как формулируют в треде, высокий балл здесь означает не заученную эрудицию, а умение довести задачу до конца. И первым в таблице стоит не флагман за $10/$50 за миллион токенов, а модель, веса которой лежат на Hugging Face под MIT — причём в прогоне на 4-битной квантизации, которая помещается в потребительские видеокарты.
Сенсация при этом не абсолютная, а накопленная: Artificial Analysis ещё на прошлой неделе фиксировала первое место V4.1 Flash на AutomationBench-AA — 69% наравне с Astra и выше Grok 4.6 (67%). Новый замер добавил то, чего той таблице не хватало: скорость. При равном качестве агент на DeepSeek просто заканчивает работу заметно раньше — а в агентных пайплайнах, где задача состоит из десятков шагов, латентность конвертируется в деньги напрямую.
Ключевые цифры:
- AA-Bench: 92% task success, инференс на 37% быстрее Astra
- AutomationBench-AA: 69% — первое место, наравне с GPT-6 Astra
- Веса: INT4, работает на потребительских GPU
- Лицензия: MIT, цена self-hosted — стоимость электричества
Почему это важно
В треде сформулировали за нас: «98% Astra за 1,4% цены» перестало быть мемом и стало строчкой в независимом бенчмарке. Для OpenAI это болезненно вдвойне на фоне сентябрьских споров о тихом нерфе Astra: пока закрытая модель, по ощущениям пользователей, теряла проценты, открытая — догнала и перегнала.
Отреагировали даже биржи, причём неожиданным образом: просели акции SK Hynix и Samsung. Логика инвесторов прямолинейна — если фронтирное качество достижимо на 4-битных весах и потребительских картах, спрос на дорогую HBM-память для гигантских инференс-кластеров может расти медленнее, чем закладывали прогнозы. Вероятно, паника преждевременная, но сам рефлекс показателен: рынок начал прайсить эффективность открытых моделей как угрозу железному суперциклу.
Что дальше
DeepSeek традиционно молчит, но нумерация подсказывает: где-то за Flash идёт V4.1 Pro. Для OpenAI вопрос теперь не в процентах на очередной таблице, а в ответе на неудобный вопрос корпоративных клиентов: за что именно платить, если агентные задачи открытая модель решает так же — только быстрее и у вас в серверной.


