GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
googlegeminiрелизбенчмаркиdeepmind

Gemini 4 Argon: Google вернулась на фронтир — но попробовать нельзя

Google показала Gemini 4 Argon: лидерство в 12 из 18 бенчмарков, миллион токенов вывода и 15% галлюцинаций. Доступ — только кибер-защитникам Fairwind.

Влад МакаровВлад Макаровпроверил и опубликовал
8 мин чтения
Gemini 4 Argon: Google вернулась на фронтир — но попробовать нельзя

Семь месяцев Google отвечала на каждый чужой релиз только ускоренными Flash-версиями, а обещанную ещё в июле Gemini 3.5 Pro так и не выпустила. Вечером 30 сентября стало понятно почему: компания пропустила поколение. Gemini 4 Argon — первый флагман со времён февральской Gemini 3.1 Pro, первая Gemini с кодовым именем вместо индекса Pro/Flash и, судя по первым независимым замерам, возвращение Google в тройку сильнейших лабораторий. В r/singularity анонс собрал три поста в топе суток — такого единодушного внимания к Google сообщество не проявляло с прошлого года.

Что показала Google

Анонс писал Корай Кавукчуоглу, SVP Google DeepMind и главный ИИ-архитектор компании. Argon позиционируется как модель для «глубокого рассуждения в длинных сложных процессах» с четырьмя целевыми областями: программирование, корпоративная интеллектуальная работа, кибер-оборона и творческое письмо.

Самая необычная характеристика — лимит вывода в 1 миллион токенов против 64 тысяч у прошлых Gemini и 128 тысяч у GPT-6 Astra. Для чата это бессмысленно, но для агентов, которые часами мигрируют кодовую базу или пишут длинный юридический документ, это снимает потолок, обрезавший работу на середине. В API появился механизм Long Decode Continuation: сверхдлинный ответ ставится на паузу и продолжается в следующих вызовах, не упираясь в таймаут.

По бенчмаркам из собственной таблицы Google Argon лидирует в 12 из 18 опубликованных тестов (подсчёт VentureBeat). Сильнее всего отрыв не в кодинге, а в профессиональной офисной работе:

БенчмаркGemini 4 ArgonClaude Opus 5.5GPT-6 Astra
DeepSWE v1.1 (длинные софт-задачи)77,9%74,2%74,1%
Vals Index (финансы, право, код)68,9%67,0%63,1%
AutomationBench (бизнес-процессы)51,3%42,5%41,4%
Harvey Legal Agent19,6%3,8%5,4%
GraphWalks (длинный контекст)84,2%66,8%71,8%
LVBench (длинное видео)91,7%83,7%87,5%
Terminal-Bench 4.0 (агентный кодинг)57,4%66,4%58,2%
FrontierSWE v255,0%62,3%65,5%

Таблица честная в обе стороны: Google не скрывает, что в терминальном кодинге Opus 5.5 впереди на девять пунктов, а на FrontierSWE v2 Astra выигрывает десять. На юридическом бенчмарке Harvey разрыв обратный и неприличный — 19,6% против считаных процентов у конкурентов.

Пятнадцать процентов галлюцинаций

Независимые замеры подоспели в первые же часы. Artificial Analysis поставила Argon 53 балла по Intelligence Index — вровень с GPT-6 Astra и Claude Fable 5.1, ниже Opus 5.5 с его 58 и Sonnet 5.5 с 56. Для сравнения: Gemini 3.1 Pro набирала 30. На Vals Index Argon занял первое место из 41 модели, в слепой арене LMArena — первое место в Text Arena с 1525 очками.

Но главной темой обсуждений стала не интеллектуальная планка, а показатель AA-Omniscience: Argon галлюцинирует в 15% случаев — это минимум среди всех сильных моделей. У GPT-6 Astra — 51%, у GPT-6.1 Sol — 54%. Пост «Gemini 4 Argon решила проблему галлюцинаций» собрал в r/singularity 1055 апвоутов, и топ-комментарий точно сформулировал общее настроение: «решила» при 15% — это натяжка, но прогресс по сравнению с остальным фронтиром огромный.

Есть и обратная сторона, которую легко пропустить: Argon правильно отвечает лишь на 50% фактических вопросов — на 13 пунктов меньше Astra. Модель, которая чаще говорит «не знаю», реже ошибается, но и реже отвечает. Google фактически выбрала калибровку вместо охвата — для медицины, права и финансов это правильный размен, но называть его «решением галлюцинаций» преждевременно.

Кому это всё доступно: почти никому

Самая спорная часть релиза — доступ. В день запуска Argon получили только проверенные кибер-защитники из программы Fairwind: правительства, операторы критической инфраструктуры, технологические платформы и академические лаборатории — больше 650 партнёров. Им модель выдаётся без кибер-ограничителей, то есть без фильтров, блокирующих запросы, похожие на взлом. Платные API-клиенты и подписчики Google AI Ultra идут следующими, дата не названа.

Схема до деталей повторяет Project Glasswing от Anthropic и Daybreak от OpenAI — фронтир-модели с серьёзными кибер-способностями теперь по умолчанию выходят сначала для «защитников» и только потом для всех. Неделей раньше похожая логика превратила отчёт Anthropic о GLM-5.3 в её лучшую рекламу — сообщество этот жанр уже выучило и встречает со скепсисом.

Цена при этом агрессивная: на старте $2 за миллион входных и $10 за миллион выходных токенов — вдвое ниже постоянной цены $4/$20, которая совпадает с Opus 5.5. По подсчёту Artificial Analysis задача обходится в $1,99 против $3,26 у Astra, но дешевизна достигается ценами, а не экономностью: Argon тратит в среднем 62 тысячи выходных токенов на задачу против 27 тысяч у Astra. Когда скидка кончится, преимущество почти исчезнет.

Сомнения изнутри

В день запуска Bloomberg сообщила о скепсисе внутри самой Google: сотрудники с прямым доступом говорят, что модель блестяще выглядит в бенчмарках, но слабее в их реальных задачах, особенно во фронтенде — коде, который определяет внешний вид приложений. Google отчёт оспорила, а один из сотрудников возразил, что внутри компании «широкий консенсус» о фронтирном уровне модели.

Публичные данные поддерживают обе стороны: восьмое место в Code Arena WebDev подтверждает жалобу на фронтенд, отставание на Terminal-Bench — на агентный кодинг. Зато Сундар Пичаи перечисляет внутренние применения, ради которых миллион токенов вывода и затевался: агенты на Argon переводят C++-код ядра Zircon из Fuchsia на Rust (больше 800 тысяч строк), переписали 32 тысячи строк SIMD-кода в декодере libgav1 и ускорили его в 2,7 раза, освободили больше 300 ТиБ памяти в дата-центрах по результатам самостоятельного анализа профилирования. Проверить эти цифры извне пока невозможно — как и всё остальное в Argon, пока модель не доедет до обычных подписчиков.

Похожие новости

Листайте вниз

для загрузки следующей статьи