GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
openaigpt-5.6inferenceсамоулучшениеcodex

GPT-5.6 Sol переписала код, на котором сама работает

OpenAI поручила GPT-5.6 Sol оптимизацию собственных GPU-ядер: минус 20% к стоимости инференса, плюс 15% к скорости генерации. Разбираем, что это значит.

Влад МакаровВлад Макаровпроверил и опубликовал
6 мин чтения
GPT-5.6 Sol переписала код, на котором сама работает

Двадцать процентов. Столько OpenAI сэкономила на обслуживании GPT-5.6 Sol после того, как отдала модели её собственный производственный код. Не в демо и не в бенчмарке — в боевой инфраструктуре, через которую проходит реальный трафик ChatGPT и API.

Что именно сделала модель

После выхода GPT-5.6 в общий доступ OpenAI запустила Sol внутри Codex и поставила задачу: оптимизировать GPU-ядра, на которых крутится инференс самой модели. Ядра написаны на Triton и Gluon — открытых языках GPU-программирования, которые OpenAI развивает уже несколько лет. Модель специально дообучали писать и оптимизировать код на них, и, как сообщает Gigazine со ссылкой на OpenAI, переписанные ядра снизили сквозную стоимость обслуживания на те самые 20%.

Вторая часть работы касалась спекулятивного декодирования — техники, при которой маленькая черновая модель предсказывает несколько токенов вперёд, а большая лишь проверяет их. Sol перепроектировала собственную черновую модель через сотни автономных экспериментов и подняла эффективность генерации токенов больше чем на 15%.

Третье направление менее эффектное, но показательное: модель анализировала реальный производственный трафик OpenAI и находила дисбаланс нагрузки между машинами и сервисными узлами — работу, которую обычно делают инженеры по инфраструктуре с дашбордами и профилировщиками.

Кто заплатил за скидку

У этой истории есть прямое продолжение в прайс-листе. На этой неделе OpenAI срезала цену младшей модели Luna на 80%, и, как пишет TechTimes, именно экономия от переписанного Sol инференс-стека профинансировала это снижение. Логика прозрачная: чем дешевле обходится каждый токен, тем агрессивнее можно демпинговать в ценовой войне с Google и китайскими лабораториями, которые давят на рынок бесплатными и почти бесплатными моделями.

Это, пожалуй, самый убедительный аргумент в пользу того, что оптимизации настоящие. Компания может приукрасить блог-пост, но не станет резать цену на 80%, если экономика не сошлась.

Сингулярность откладывается

Тред на r/singularity про эту новость собрал за сутки девятьсот апвоутов, и половина комментариев — вариации на тему «вот оно, рекурсивное самоулучшение». Здесь стоит притормозить.

То, что произошло, — не RSI из футурологических сценариев. GPT-5.6 не обучает следующую версию GPT и не меняет собственные веса. Она оптимизирует среду, в которой работает: ядра, планировщик, черновую модель для декодирования. Как аккуратно формулирует 36Kr, модель перестала быть просто инструментом, который разворачивают инженеры, и стала инженером, который дорабатывает систему вокруг себя, — но до автоматического обучения следующего поколения отсюда ещё очень далеко.

Важна, впрочем, не терминология, а траектория. Ещё в июле Anthropic публиковала предупреждение о рисках рекурсивного самоулучшения и обещала не подпускать модели к собственному обучающему коду без внешнего аудита. OpenAI выбрала другой путь: показала, что уже подпустила — пусть пока только к инференсу — и заработала на этом. Спор о том, где проходит граница между «модель ускоряет свой сервер» и «модель улучшает себя», перестал быть теоретическим: теперь у него есть строчка в отчёте о расходах.

Похожие новости

Листайте вниз

для загрузки следующей статьи