GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
anthropicclaudeopusрелизбенчмаркицены

Claude Opus 5.5: уровень Fable за 40% меньших денег

Anthropic выпустила Claude Opus 5.5 — первую модель линейки 5.5: $4/$20 за миллион токенов, 66.4% на Terminal-Bench 4.0 и первое место в AA Intelligence Index.

Влад МакаровВлад Макаровпроверил и опубликовал
7 мин чтения
Claude Opus 5.5: уровень Fable за 40% меньших денег

Вчера мы разбирали SVG-мультик, который Opus 5.5 нарисовал с первой попытки, — сегодня пора поговорить о самом релизе, потому что он оказался важнее любого демо. 22 сентября Anthropic представила Claude Opus 5.5 — первую модель новой линейки 5.5 и первый релиз компании после манифеста Дарио Амодеи о «замедлении фронтира». Формула релиза укладывается в одну фразу: качество флагманского Fable 5.1 на большинстве задач — за 40% меньших денег.

Reddit отреагировал соответствующе: четыре поста об Opus 5.5 в горячем r/singularity за сутки собрали в сумме около 3200 апвоутов — тред с бенчмарками (1082 апвоута), анонс релиза (847), демо «Opus 5.5 built this» (741) и новость о первом месте в интеллект-индексе Artificial Analysis (515).

Цены: главная цифра релиза

Opus 5.5 стоит $4 за миллион входных и $20 за миллион выходных токенов — на 20% меньше, чем Opus 5. Но настоящая экономия глубже: чтение кеша подешевело сразу на 60%, с $0.50 до $0.20 за миллион, а именно кеш составляет львиную долю расходов в агентных и кодинговых сценариях. Прибавьте к этому то, что модель тратит меньше токенов на ту же задачу, — и получите заявленные Anthropic 40% экономии на типичных нагрузках.

Цена за 1M токеновOpus 5.5Opus 5
Вход$4$5
Выход$20$25
Чтение кеша$0.20$0.50
Запись кеша$5$6.25

Есть и fast mode — вдвое дороже ($8/$40), но с выводом до 2.5 раз быстрее. Впрочем, и обычный режим генерирует на 30% быстрее Opus 5. Контекст — миллион токенов, а режим «мышления» теперь не отключается вовсе: модель всегда работает с адаптивным рассуждением, сама решая, сколько думать над задачей.

Бенчмарки: впереди Astra за 40% цены

На Terminal-Bench 4.0 — главном сегодня бенчмарке агентного кодинга — Opus 5.5 набирает 66.4%. Для сравнения: GPT-6 Astra показывает 57.9%, Fable 5.1 — 55.8%, а Opus 5 — 52.3%. VentureBeat отдельно подчёркивает пикантность ситуации: модель за $4/$20 обходит собственный флагман компании, доступ к которому стоит заметно дороже.

БенчмаркOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.066.4%55.8%52.3%57.9%
FrontierCode v1.154.4%50.3%48.0%53.3%
CursorBench 4.057.8%51.8%46.6%
GDPval-AA v2.1 (Elo)1846173517081542
Humanity's Last Exam67.7%65.6%63.6%57.2%
Terminal-Bench-Science58.7%52.6%29.0%64.6%

Не всё однозначно: в агентной науке (Terminal-Bench-Science) Astra остаётся впереди с 64.6%. Зато независимый индекс Artificial Analysis впервые поставил модель Anthropic на первое место: 58 баллов в AA Intelligence Index — выше всех, включая Astra. Сама Anthropic, что характерно, призывает не переоценивать разрывы: «на этих уровнях возможностей бенчмарки стали менее надёжным ориентиром реальных различий».

Любопытнее сухих цифр — истории ранних тестеров. Один из них прогнал миграцию кода на 680 тысяч строк меньше чем за день — работу, на которую у команды инженеров ушли бы недели. В внутреннем тесте Anthropic Opus 5.5 и Fable 5.1 переписывали балансировщик HAProxy с C на Rust: оба справились, но Opus 5.5 закончил за 9.5 часа против 12 и обошёлся на 51% дешевле. Инженер Stripe рассказывает, как одна сессия Opus 5.5 дирижировала дюжиной других при ребейзе 40 стековых пулреквестов — к следующему дню все 40 прошли CI.

Самый безопасный релиз в истории компании

Opus 5.5 — первый релиз после эссе Амодеи «We Must Pace the Frontier», и Anthropic демонстративно играет по собственным новым правилам. Перед выпуском модель проверяли внешние оценщики — METR и Frontier Design. На автоматизированном поведенческом аудите — это почти 2000 симулированных сценариев — Opus 5.5 показала лучший результат среди всех моделей компании за всю историю измерений. В новом тесте на попытки выйти за границы песочницы модель предпринимала их на 85% реже, чем Opus 5, причём каждая попытка была низкой серьёзности и модель сама о ней сообщала.

Обратная сторона силы — жёсткие предохранители. Поскольку в биологии и кибербезопасности Opus 5.5 сравнима с закрытой Mythos 5.1, большинство кибер-задач будет прозрачно перенаправляться на Opus 4.8, а для полноценной работы в биологии нужна верификация через Life Sciences Verification Program. Плюс «preserved thinking» — защита от дистилляции, запрещающая редактировать прошлый контекст модели через API.

Отдельная приятность для подписчиков: лимиты на Pro, Max и Team подняли, а с учётом подешевевших токенов Anthropic обещает, что квоты растянутся примерно на 25% дальше. Sonnet 5.5 и Haiku 5.5 обещаны в ближайшие недели. Модель уже доступна везде — от Claude Platform (claude-opus-5-5) до AWS, Google Cloud и Azure.

Похожие новости

Листайте вниз

для загрузки следующей статьи