GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
deepseekopenaiбенчмаркиopen-source

Открытая DeepSeek обошла GPT-6 Astra на новом бенчмарке Artificial Analysis

DeepSeek V4.1 Flash на 4-битных весах обошла флагман OpenAI на агентном бенчмарке AA: 92% успеха задач и инференс на 37% быстрее. Акции SK Hynix упали.

Влад МакаровВлад Макаровпроверил и опубликовал
3 мин чтения
Открытая DeepSeek обошла GPT-6 Astra на новом бенчмарке Artificial Analysis

Открытая модель на 4-битных весах, запущенная на потребительских GPU, обошла флагман OpenAI на новом агентном бенчмарке Artificial Analysis. DeepSeek V4.1 Flash показала 92% успешно выполненных задач при инференсе на 37% быстрее, чем у GPT-6 Astra. Тред на r/LocalLLaMA — 634 апвоута, флер откровенно злорадный: помечен тегом Funny.

Что произошло

AA-Bench — свежая серия агентных замеров Artificial Analysis: не вопросы с вариантами ответов, а сквозные задачи с инструментами, структурированным JSON-выводом и таймером. Как формулируют в треде, высокий балл здесь означает не заученную эрудицию, а умение довести задачу до конца. И первым в таблице стоит не флагман за $10/$50 за миллион токенов, а модель, веса которой лежат на Hugging Face под MIT — причём в прогоне на 4-битной квантизации, которая помещается в потребительские видеокарты.

Сенсация при этом не абсолютная, а накопленная: Artificial Analysis ещё на прошлой неделе фиксировала первое место V4.1 Flash на AutomationBench-AA — 69% наравне с Astra и выше Grok 4.6 (67%). Новый замер добавил то, чего той таблице не хватало: скорость. При равном качестве агент на DeepSeek просто заканчивает работу заметно раньше — а в агентных пайплайнах, где задача состоит из десятков шагов, латентность конвертируется в деньги напрямую.

Ключевые цифры:

  • AA-Bench: 92% task success, инференс на 37% быстрее Astra
  • AutomationBench-AA: 69% — первое место, наравне с GPT-6 Astra
  • Веса: INT4, работает на потребительских GPU
  • Лицензия: MIT, цена self-hosted — стоимость электричества

Почему это важно

В треде сформулировали за нас: «98% Astra за 1,4% цены» перестало быть мемом и стало строчкой в независимом бенчмарке. Для OpenAI это болезненно вдвойне на фоне сентябрьских споров о тихом нерфе Astra: пока закрытая модель, по ощущениям пользователей, теряла проценты, открытая — догнала и перегнала.

Отреагировали даже биржи, причём неожиданным образом: просели акции SK Hynix и Samsung. Логика инвесторов прямолинейна — если фронтирное качество достижимо на 4-битных весах и потребительских картах, спрос на дорогую HBM-память для гигантских инференс-кластеров может расти медленнее, чем закладывали прогнозы. Вероятно, паника преждевременная, но сам рефлекс показателен: рынок начал прайсить эффективность открытых моделей как угрозу железному суперциклу.

Что дальше

DeepSeek традиционно молчит, но нумерация подсказывает: где-то за Flash идёт V4.1 Pro. Для OpenAI вопрос теперь не в процентах на очередной таблице, а в ответе на неудобный вопрос корпоративных клиентов: за что именно платить, если агентные задачи открытая модель решает так же — только быстрее и у вас в серверной.

Похожие новости

Листайте вниз

для загрузки следующей статьи