GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
openaigpt-6-astraбенчмаркипрозрачность

Минус 15% за ночь: тихий нерф GPT-6 Astra взбесил пользователей

Качество многошаговых рассуждений GPT-6 Astra упало на 15% за одну ночь без анонса. Подозрение — троттлинг компьюта. Сообщество требует независимых бенчмарков.

Влад МакаровВлад Макаровпроверил и опубликовал
6 мин чтения
Минус 15% за ночь: тихий нерф GPT-6 Astra взбесил пользователей

Пятнадцать процентов. Столько, по замерам пользователей, GPT-6 Astra потеряла за одну ночь в задачах многошагового рассуждения — без анонса, без записи в чейнджлоге, без смены версии модели в API. Утром подписчики получили ту же модель с тем же именем, которая стала заметно глупее. Тред об этом набрал 716 апвоутов на r/singularity, а его заголовок формулирует главный вывод недели: «нам действительно нужны бенчмарки получше».

Что заметили пользователи

Началось всё, как обычно, с ощущений: с вечера модель «перестала тянуть» длинные цепочки рассуждений, стала терять контекст в середине сложных задач и чаще срезать путь к поверхностному ответу. Ощущения — материя ненадёжная, ими сообщество кормится после каждого обновления. Но на этот раз за ночь подъехали цифры: энтузиасты прогнали собственные наборы задач на многошаговый вывод и получили падение порядка 15% относительно результатов той же модели неделей раньше.

Важная деталь: деградация затронула именно multi-hop reasoning — задачи, где ответ требует нескольких зависимых шагов. Короткие запросы, генерация текста и код по ощущениям пользователей почти не пострадали. Это похоже не на случайную регрессию, а на прицельную оптимизацию самого дорогого режима работы модели.

Версия: экономия компьюта

OpenAI не комментирует ситуацию, но у сообщества есть рабочая гипотеза, и она неприятная. Косвенные признаки в логах указывают на троттлинг: в часы пиковой нагрузки модель, судя по всему, получает урезанный вычислительный бюджет на рассуждения. Меньше внутренних шагов — быстрее и дешевле ответ, и тем заметнее просадка именно в многошаговых задачах.

Мотив у компании имеется. Всю неделю OpenAI жгла компьют по всем фронтам: рой из 10 000 агентов, продуктовый залп с Agents API и голосовой GPT-Live-1, бета-тесты дронов. Инференс-бюджет не резиновый, и подписчики Astra — самая удобная статья экономии: они уже заплатили, а деградацию ещё надо суметь доказать.

Знакомый сценарий

«Тихие нерфы» — жанр с историей. Пользователи годами подозревали лаборатории в незаметном урезании моделей: жалобы на «отупевший» GPT-5, бунт подписчиков Claude Max из-за лимитов токенов. Отличие нынешнего случая — в масштабе и измеримости: раньше споры упирались в «вам показалось», теперь есть воспроизводимые замеры с конкретной цифрой.

В сообществе для этого уже придумали термин — «ползучесть подписочной модели» (subscription-model creep). Суть: вы подписываетесь на одну модель, а получаете спектр её состояний, зависящий от нагрузки, дня недели и невидимых решений провайдера. Название модели превращается из технического идентификатора в бренд, под которым может скрываться что угодно.

Нужны независимые замеры

Отсюда главное требование треда: прозрачное версионирование и независимые непрерывные бенчмарки. Разовые лидерборды, на которые индустрия молилась годами, для этой задачи бесполезны — они фиксируют парадный результат в день релиза, а не то, что модель выдаёт под нагрузкой в четверг вечером. Нужен мониторинг, который гоняет одни и те же наборы задач ежедневно и бьёт тревогу при просадках, — что-то вроде аптайм-мониторинга, только для интеллекта.

Технически это несложно, и прецеденты появляются: свежий FactorioBench показал, как сообщество может строить живые бенчмарки без участия лабораторий. Проблема в экономике: ежедневный прогон серьёзных наборов задач через дорогие API стоит десятки тысяч долларов в месяц, и пока непонятно, кто готов за это платить — энтузиасты, конкуренты или регуляторы.

Выводы

Сама по себе просадка на 15% — не катастрофа: вычислительные бюджеты плавают, инфраструктура живая, а OpenAI, вероятно, вернёт мощность, когда спадёт пиковая нагрузка. Катастрофа — в асимметрии: провайдер знает о модели всё и молчит, пользователь не знает ничего и платит. Пока изменения происходят без анонсов, любой контракт с закрытой моделью — это контракт с чёрным ящиком, у которого нет даже спидометра.

История с Astra почти наверняка станет поворотной точкой не из-за самой цифры, а из-за того, что цифру впервые удалось поймать за руку. Спрос на независимую инфраструктуру измерений сформировался на глазах — осталось дождаться тех, кто её построит. До тех пор совет пользователям один: гоняйте собственные регрессионные тесты на критичных для вас задачах. Провайдеры имена моделей не меняют — меняют их содержимое.

Похожие новости

Листайте вниз

для загрузки следующей статьи