GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
openaigpt-6.1бенчмаркиматематикаfrontiermath

Первые 100%: GPT-6.1 Sol закрыла самый сложный математический бенчмарк

GPT-6.1 Sol (max) набрала 100% на FrontierMath Tier 4 — бенчмарке исследовательских задач, где год назад лучшие модели решали 5%. Разбираем, что это значит и в чём подвох.

Влад МакаровВлад Макаровпроверил и опубликовал
8 мин чтения
Первые 100%: GPT-6.1 Sol закрыла самый сложный математический бенчмарк

Сто процентов. На лидерборде Epoch AI, где ещё прошлой осенью лучшие модели мира ковырялись в однозначных цифрах, впервые появился идеальный результат: GPT-6.1 Sol на максимальном усилии рассуждения решила все задачи FrontierMath Tier 4 — набора исследовательских математических проблем, на каждую из которых профессиональный математик тратит от нескольких часов до нескольких дней. Пикантность в том, что рекорд поставила не флагманская Astra, а «бюджетная» модель, которую OpenAI продаёт в пять раз дешевле.

Бенчмарк, который должен был продержаться годы

FrontierMath — детище Epoch AI: сотни оригинальных задач, составленных и выверенных профессиональными математиками, от вычислительно тяжёлой теории чисел до абстрактной алгебраической геометрии. Tier 4 — его верхний этаж, экспансия из 43 «исключительно трудных» задач исследовательского уровня. В июне Epoch выпустила версию v2, исправив ошибки в значительной части условий, — именно на ней и поставлен рекорд.

Методология не прощает подгонки под ответ: модель получает задачу, может рассуждать и исполнять Python-код, но в конце обязана сдать функцию answer(), возвращающую точный ответ, — и уложиться в лимит миллиона токенов. Либо ответ верен, либо ноль очков.

Как выглядит сегодняшний лидерборд Epoch:

МодельРезультат
GPT-6.1 Sol (max)100%
GPT-6 Astra (high/max)97,6% ±2,4%
Claude Opus 5.5 (max)95,0% ±4,1%
Claude Fable 5 (max)90,2% ±4,6%
GPT-6 Sol (max)90,0% ±5,2%
Claude Sonnet 5.5 (max)80,5% ±6,3%
AI co-mathematician (DeepMind)75,6% ±6,7%

Для масштаба: Claude Opus 4.5, флагман конца 2025 года, брал на этом наборе 4,9%. За одно поколение моделей бенчмарк прошёл путь от «почти нерешаемого» до исчерпанного.

Что смущает в идеальном результате

Начнём с арифметики. У Astra результат 97,6% с доверительным интервалом ±2,4 — то есть статистически её верхняя граница упирается в те же 100%. На наборе из четырёх десятков задач разница между «решила все» и «решила все, кроме одной» — это одна задача. Рекорд красив, но говорить о «разгроме» флагмана некорректно: на вершине лидерборда модели OpenAI фактически идут вровень.

Дальше — конфликт интересов, о котором Epoch пишет прямо на странице бенчмарка: FrontierMath разработан на деньги OpenAI, и компания имеет эксклюзивный доступ к части набора задач. Epoch проводит замеры независимо, однако осадок остаётся — особенно после сентябрьского скандала с Навье — Стоксом, где OpenAI уже обвиняли в слишком вольном обращении с математическими приоритетами.

Сообщество реагирует соответственно. В треде r/singularity рядом с восторгами — усталый скепсис: один из топовых комментаторов описал повторяющийся паттерн «bait-and-switch», когда модель блистает в бенчмарках первые две недели после релиза, а затем деградирует в реальных задачах. Проверить это невозможно, но само существование такого мема — симптом: цифрам на лидербордах верят всё меньше, даже когда они честные.

Дешёвый интеллект берёт верх

Самая важная деталь этой истории — не сами 100%, а то, какая модель их набрала. GPT-6.1 Sol вышла на DevDay 30 сентября с позиционированием «интеллект уровня Astra за пятую часть цены». Тогда это звучало как маркетинг. Спустя четыре дня «бюджетник» стоит на вершине самого престижного математического бенчмарка — выше собственного флагмана компании.

Для пользователей это отличная новость: цена доступа к frontier-математике упала впятеро за месяц. Для индустрии бенчмарков — почти некролог. FrontierMath Tier 4 был последним общепризнанным математическим тестом с запасом сложности, и теперь он исчерпан — как до него MMLU, GPQA и FrontierMath первых трёх уровней. Открытое письмо математиков с требованием независимой верификации ИИ-доказательств выглядит после этого ещё актуальнее: следующий «бенчмарк» — уже не набор задач с известными ответами, а живая математика, где проверять результат некому, кроме людей.

Epoch, вероятно, соберёт Tier 5. Вопрос лишь в том, сколько месяцев он продержится.

Похожие новости

Листайте вниз

для загрузки следующей статьи