Gemini 4 Argon: Google вернулась на фронтир — но попробовать нельзя
Google показала Gemini 4 Argon: лидерство в 12 из 18 бенчмарков, миллион токенов вывода и 15% галлюцинаций. Доступ — только кибер-защитникам Fairwind.

Семь месяцев Google отвечала на каждый чужой релиз только ускоренными Flash-версиями, а обещанную ещё в июле Gemini 3.5 Pro так и не выпустила. Вечером 30 сентября стало понятно почему: компания пропустила поколение. Gemini 4 Argon — первый флагман со времён февральской Gemini 3.1 Pro, первая Gemini с кодовым именем вместо индекса Pro/Flash и, судя по первым независимым замерам, возвращение Google в тройку сильнейших лабораторий. В r/singularity анонс собрал три поста в топе суток — такого единодушного внимания к Google сообщество не проявляло с прошлого года.
Что показала Google
Анонс писал Корай Кавукчуоглу, SVP Google DeepMind и главный ИИ-архитектор компании. Argon позиционируется как модель для «глубокого рассуждения в длинных сложных процессах» с четырьмя целевыми областями: программирование, корпоративная интеллектуальная работа, кибер-оборона и творческое письмо.
Самая необычная характеристика — лимит вывода в 1 миллион токенов против 64 тысяч у прошлых Gemini и 128 тысяч у GPT-6 Astra. Для чата это бессмысленно, но для агентов, которые часами мигрируют кодовую базу или пишут длинный юридический документ, это снимает потолок, обрезавший работу на середине. В API появился механизм Long Decode Continuation: сверхдлинный ответ ставится на паузу и продолжается в следующих вызовах, не упираясь в таймаут.
По бенчмаркам из собственной таблицы Google Argon лидирует в 12 из 18 опубликованных тестов (подсчёт VentureBeat). Сильнее всего отрыв не в кодинге, а в профессиональной офисной работе:
| Бенчмарк | Gemini 4 Argon | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|---|
| DeepSWE v1.1 (длинные софт-задачи) | 77,9% | 74,2% | 74,1% |
| Vals Index (финансы, право, код) | 68,9% | 67,0% | 63,1% |
| AutomationBench (бизнес-процессы) | 51,3% | 42,5% | 41,4% |
| Harvey Legal Agent | 19,6% | 3,8% | 5,4% |
| GraphWalks (длинный контекст) | 84,2% | 66,8% | 71,8% |
| LVBench (длинное видео) | 91,7% | 83,7% | 87,5% |
| Terminal-Bench 4.0 (агентный кодинг) | 57,4% | 66,4% | 58,2% |
| FrontierSWE v2 | 55,0% | 62,3% | 65,5% |
Таблица честная в обе стороны: Google не скрывает, что в терминальном кодинге Opus 5.5 впереди на девять пунктов, а на FrontierSWE v2 Astra выигрывает десять. На юридическом бенчмарке Harvey разрыв обратный и неприличный — 19,6% против считаных процентов у конкурентов.
Пятнадцать процентов галлюцинаций
Независимые замеры подоспели в первые же часы. Artificial Analysis поставила Argon 53 балла по Intelligence Index — вровень с GPT-6 Astra и Claude Fable 5.1, ниже Opus 5.5 с его 58 и Sonnet 5.5 с 56. Для сравнения: Gemini 3.1 Pro набирала 30. На Vals Index Argon занял первое место из 41 модели, в слепой арене LMArena — первое место в Text Arena с 1525 очками.
Но главной темой обсуждений стала не интеллектуальная планка, а показатель AA-Omniscience: Argon галлюцинирует в 15% случаев — это минимум среди всех сильных моделей. У GPT-6 Astra — 51%, у GPT-6.1 Sol — 54%. Пост «Gemini 4 Argon решила проблему галлюцинаций» собрал в r/singularity 1055 апвоутов, и топ-комментарий точно сформулировал общее настроение: «решила» при 15% — это натяжка, но прогресс по сравнению с остальным фронтиром огромный.
Есть и обратная сторона, которую легко пропустить: Argon правильно отвечает лишь на 50% фактических вопросов — на 13 пунктов меньше Astra. Модель, которая чаще говорит «не знаю», реже ошибается, но и реже отвечает. Google фактически выбрала калибровку вместо охвата — для медицины, права и финансов это правильный размен, но называть его «решением галлюцинаций» преждевременно.
Кому это всё доступно: почти никому
Самая спорная часть релиза — доступ. В день запуска Argon получили только проверенные кибер-защитники из программы Fairwind: правительства, операторы критической инфраструктуры, технологические платформы и академические лаборатории — больше 650 партнёров. Им модель выдаётся без кибер-ограничителей, то есть без фильтров, блокирующих запросы, похожие на взлом. Платные API-клиенты и подписчики Google AI Ultra идут следующими, дата не названа.
Схема до деталей повторяет Project Glasswing от Anthropic и Daybreak от OpenAI — фронтир-модели с серьёзными кибер-способностями теперь по умолчанию выходят сначала для «защитников» и только потом для всех. Неделей раньше похожая логика превратила отчёт Anthropic о GLM-5.3 в её лучшую рекламу — сообщество этот жанр уже выучило и встречает со скепсисом.
Цена при этом агрессивная: на старте $2 за миллион входных и $10 за миллион выходных токенов — вдвое ниже постоянной цены $4/$20, которая совпадает с Opus 5.5. По подсчёту Artificial Analysis задача обходится в $1,99 против $3,26 у Astra, но дешевизна достигается ценами, а не экономностью: Argon тратит в среднем 62 тысячи выходных токенов на задачу против 27 тысяч у Astra. Когда скидка кончится, преимущество почти исчезнет.
Сомнения изнутри
В день запуска Bloomberg сообщила о скепсисе внутри самой Google: сотрудники с прямым доступом говорят, что модель блестяще выглядит в бенчмарках, но слабее в их реальных задачах, особенно во фронтенде — коде, который определяет внешний вид приложений. Google отчёт оспорила, а один из сотрудников возразил, что внутри компании «широкий консенсус» о фронтирном уровне модели.
Публичные данные поддерживают обе стороны: восьмое место в Code Arena WebDev подтверждает жалобу на фронтенд, отставание на Terminal-Bench — на агентный кодинг. Зато Сундар Пичаи перечисляет внутренние применения, ради которых миллион токенов вывода и затевался: агенты на Argon переводят C++-код ядра Zircon из Fuchsia на Rust (больше 800 тысяч строк), переписали 32 тысячи строк SIMD-кода в декодере libgav1 и ускорили его в 2,7 раза, освободили больше 300 ТиБ памяти в дата-центрах по результатам самостоятельного анализа профилирования. Проверить эти цифры извне пока невозможно — как и всё остальное в Argon, пока модель не доедет до обычных подписчиков.


