Рекорд Opus 5 на ARC-AGI-3: прорыв или зубрёжка бенчмарка?
Claude Opus 5 набрал на ARC-AGI-3 втрое больше ближайшего конкурента. Разбираем, почему сообщество спорит о «бенчмаксинге» и что не так с самим тестом.

В марте 2026 года ни одна модель мира не могла набрать на ARC-AGI-3 даже один процент. Люди решали все задачи с первой попытки, лучшие ИИ — 0,37% в пике. Прошло четыре месяца, и свежевышедший Claude Opus 5 показал около 30% — втрое больше ближайшего преследователя. Казалось бы, повод для триумфа Anthropic. Вместо этого сообщество разделилось на два лагеря: одни называют это скачком в способности рассуждать, другие — образцовым случаем «бенчмаксинга», когда модель натаскали на конкретный тест.
Что произошло
Claude Opus 5 вышел 24 июля, и среди опубликованных результатов особенно выделялся один: ARC-AGI-3, интерактивный бенчмарк на способность обучаться на лету. По данным из анонса, оценка Opus 5 примерно втрое выше, чем у лучшего из конкурентов — GPT-5.6 не дотягивает и до 10%.
Реакция не заставила себя ждать. Psyho — легенда спортивного программирования, в прошлом обыгравший модель OpenAI в финале AtCoder — написал в X, что «этот бенчмарк был по сути решён (на уровне человека) в первый же день, и он практически бесполезен». Пост собрал сотни репостов и стал точкой сборки для скептиков.
Ему тут же возразили. «Может, ты имеешь в виду ARC-AGI первой версии? — ответил разработчик Давиде Нитти. — ARC-AGI-3 довольно сложен, и если GPT-5.6 ниже 10%, а Opus 5 на 30%, значит, тест никак не решён». Спор, начавшийся с одного твита, быстро превратился в дискуссию о том, можно ли вообще доверять бенчмаркам в 2026 году.
Что такое ARC-AGI-3 и почему он особенный
ARC Prize Foundation Франсуа Шолле запустила третью версию своего теста в марте 2026 года. В отличие от классических вопросов с вариантами ответов, ARC-AGI-3 — это 135 интерактивных игровых сред, которых модель никогда не видела. Никаких инструкций: агент должен сам понять правила, адаптироваться и решить задачу. Ровно то, что человек делает естественно — 100% тестировщиков-людей прошли все среды с первой попытки.
Стартовые результаты моделей выглядели разгромно:
| Модель | ARC-AGI-3 (март 2026) | ARC-AGI-3 (июль 2026) |
|---|---|---|
| Claude Opus 5 | — | ~30% |
| GPT-5.6 | — | менее 10% |
| Gemini 3.1 Pro | 0,37% | — |
| GPT-5.4 | 0,26% | — |
| Claude Opus 4.6 | 0,25% | — |
| Grok 4.2 | 0% | — |
Аргумент Шолле всегда был один: сегодняшние модели хорошо работают только тогда, когда люди строят вокруг них строительные леса. Настоящий общий интеллект должен обходиться без человека в контуре. Под этот тезис фонд развернул и соревнование на Kaggle с призовым фондом в $2 млн.
При этом методология с самого начала вызывала вопросы. Оценка использует квадратичный штраф за неэффективность, который, по мнению критиков, спроектирован так, чтобы занижать цифры. Модели с расширенным режимом размышления из тестирования исключались. Иными словами, у скептиков были претензии к тесту задолго до того, как Opus 5 его «взломал».
Почему сообщество сомневается в рекорде
Самый содержательный аргумент против рекорда привёл Жан-Франсуа Пюже, грандмастер Kaggle из NVIDIA. Он напомнил, что обсуждаемые цифры во многом опираются на публичные игровые среды — а «степень переобучения на них ничем не ограничена». Официальный результат Opus 5, по его данным, получен на полуприватном наборе из 55 игр, который используется и в соревновании Kaggle.
История здесь не на стороне оптимистов. На ARC-AGI-1 и ARC-AGI-2 уже был длинный список громких заявлений, которые не подтверждались на полуприватных данных: красивые цифры на публичном наборе рассыпались, как только модель встречала по-настоящему незнакомые задачи. Пюже допускает, что с ARC-AGI-3 может повториться та же картина.
Слово «benchmaxxed» — натасканный на бенчмарк — в обсуждениях звучит постоянно, но важно понимать его границы. Никто не предъявил доказательств, что Anthropic обучала модель на тестовых заданиях. Претензия тоньше: если лаборатория оптимизирует модель под публично доступные среды теста — даже честно, через генерацию похожих задач, — итоговая цифра меряет уже не общий интеллект, а качество подготовки к экзамену.
Кризис доверия, который начался не вчера
Спор вокруг Opus 5 лёг на уже подготовленную почву. Ещё в июне независимые оценщики жаловались, что не могут полноценно протестировать Claude Fable 5: защитные классификаторы Anthropic отклоняли часть промптов или перенаправляли их на менее мощную модель. ARC Prize Foundation тогда вовсе отказалась проводить верифицированную оценку — фонд не захотел передавать свой приватный набор задач под 30-дневную политику хранения данных Anthropic.
Параллельно индустрия ищет способы борьбы с загрязнением тестов. Создатели бенчмарка Agents' Last Exam, где GPT-5.5 недавно обошёл Claude Fable 5, прямо формулируют проблему: как только модель запомнила бенчмарк, он перестаёт что-либо измерять. Интерактивный формат ARC-AGI-3 задумывался как ответ именно на это — и ирония в том, что теперь под подозрением оказался он сам.
Для Anthropic ставки высоки ещё и потому, что Opus 5 позиционируется как рабочая лошадка: интеллект, близкий к Fable 5, за половину цены. Рекорд на «тесте на AGI» — сильный маркетинговый козырь. Но именно поэтому к нему приковано столько скепсиса: слишком удобная цифра в слишком удачный момент.
Что дальше
Разрешить спор может только одно — независимая проверка на полностью приватном наборе. ARC Prize Foundation проводит верифицированные оценки на скрытых средах, и если результат Opus 5 подтвердится там, разговоры о зубрёжке утихнут сами собой. Если же 30% превратятся в привычные единицы процентов, это станет самым громким случаем расхождения публичных и приватных результатов в истории теста.
Пока же стоит помнить простое правило, которое июльская дискуссия сформулировала лучше любых регламентов: цифра на лидерборде — это не свойство модели, а свойство пары «модель плюс процедура измерения». Меняется процедура — меняется и цифра. Для практических задач надёжнее собственные тесты на собственных данных: они хотя бы точно не попали в обучающую выборку.


