Sonnet 5.5 неожиданно обошла GPT-6 Sol: 96.2 на MMLU
Средняя модель Anthropic Sonnet 5.5 обогнала флагман OpenAI GPT-6 Sol: MMLU 96.2 против 94.8 и на 40% меньше галлюцинаций. Разбираем бенчмарки и механику.

Средняя модель побила чужой флагман. Sonnet 5.5 от Anthropic — рабочая лошадка линейки, а не топовый Opus — обошла GPT-6 Sol, флагманскую модель OpenAI, вышедшую всего неделю назад. Обсуждение результатов в r/singularity собрало 395 апвоутов, и главный вопрос в комментариях звучит неудобно для OpenAI: если «средний» Sonnet делает Sol на общих знаниях и коде, что происходит с методологией оценки у самой OpenAI?
Цифры
| Бенчмарк | Sonnet 5.5 | GPT-6 Sol |
|---|---|---|
| MMLU | 96.2 | 94.8 |
| HumanEval | 75.3% | ниже |
| Галлюцинации | −40% к прошлому поколению | — |
Полтора пункта на MMLU в 2026 году — это не статистический шум. На уровне выше 94 каждая десятая доля процента даётся тяжелее предыдущей: остаются вопросы, где ошибаются даже эксперты. Прибавка Sonnet 5.5 на этом участке шкалы означает реальный отрыв, а не удачный сид.
Отдельная история — галлюцинации. Anthropic заявляет снижение на 40%, и это та метрика, которая для рабочих сценариев важнее любого MMLU: модель, которая реже выдумывает, экономит время на проверку каждого ответа.
Как Anthropic это сделала
Главный механизм — «конституционные циклы обратной связи» (constitutional feedback loops). Если классический Constitutional AI применял принципы на этапе обучения, то здесь выравнивание корректируется динамически прямо во время инференса: модель на лету сверяет собственные промежуточные выводы с набором правил и переписывает их до выдачи ответа.
Против галлюцинаций работают каскады фактического поиска в реальном времени — перед утверждением фактов модель прогоняет их через внутренние циклы проверки. По сути, Anthropic встроила в модель то, что разработчики годами собирали вручную из RAG-пайплайнов и самопроверок.
Подход перекликается с тем, что компания показала в Opus 5.5 на прошлой неделе, — но Sonnet традиционно был компромиссом «быстро и дёшево, но попроще». Теперь компромисс исчез: средняя модель конкурирует с чужими флагманами.
Контекст: у OpenAI неудачная неделя
Тайминг для OpenAI болезненный. GPT-6 Sol вышел 22 сентября с ценой вдвое ниже GPT-5.6 и позиционировался как новый стандарт качества. Неделю спустя его обходит модель среднего класса конкурента, а сама OpenAI признаёт, что 80–90% ресёрча уже переброшено на GPT-7. Складывается впечатление, что поколение GPT-6 для компании — уже отработанный материал, и Anthropic этим пользуется.
В комментариях на Reddit звучит и скепсис: результаты пока «supposedly» — из материалов Anthropic, без независимой верификации. История знает случаи, когда лабораторные цифры таяли при внешнем тестировании. Но у Anthropic в этом году репутация обратная: Opus 5.5 при независимых проверках показал себя даже лучше заявленного.
Итог
Кому это важно: тем, кто выбирает модель для продакшена по соотношению цена/качество. Sonnet 5.5 — модель среднего ценового сегмента с флагманскими метриками и на 40% меньшим уровнем галлюцинаций.
Стоит ли переключаться: если ваши задачи — общие знания, код и работа с фактами, тестировать однозначно стоит. Дождитесь независимых бенчмарков для критичных сценариев: цифры пока подтверждены только самой Anthropic.

