GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
anthropicclaudeopus 5релизбенчмарки

Утечка сбылась: Anthropic выпустила Claude Opus 5

Сутки Reddit спорил, настоящие ли «слитые» ответы Opus 5. 24 июля Anthropic выпустила модель официально: интеллект уровня Fable 5 за половину цены.

Влад МакаровВлад Макаровпроверил и опубликовал
8 мин чтения
Утечка сбылась: Anthropic выпустила Claude Opus 5

В ночь на 24 июля на r/singularity висел пост «Opus 5 предположительно выдала эти ответы» — 277 апвоутов, 59 комментариев и ни одного доказательства. Скриншоты, вырванные из контекста агентной сессии, ноль официальных подтверждений. Через несколько часов Anthropic выпустила Claude Opus 5. Редкий случай, когда слух не просто подтвердился, а подтвердился почти покадрово.

Как выглядела утечка

Она собиралась по кусочкам две недели, и это был не один вброс, а серия мелких артефактов.

Сначала в переключателе моделей Cursor мелькнула запись с пометкой early access и параметрами: контекст на миллион токенов, уровень усилия extra high, откат на Opus 4.8 при срабатывании защиты. Запись исчезла в течение часов. 14 июля пользователи заметили строку Opus 5 в каталоге квот Google Vertex AI. Затем всплыл попап с ошибкой, где фигурировала строка claude-opus-5-thinking-high с требованием Max-режима.

Самым убедительным оказался скриншот, где срабатывание био-классификаторов Fable 5 автоматически переключало сессию — и в интерфейсе появлялось «Switched to Opus 5». То есть модель уже работала в проде как запасной вариант, просто её не анонсировали.

Скептики, впрочем, были правы по существу. HackerNoon опубликовал разбор с простым тезисом: скриншот интерфейса не доказывает ни доступность в API, ни цену, ни сроки. На дату аудита ни в документации Anthropic, ни в каталоге Google Cloud, ни у Cursor не было ни Opus 5, ни кодового имени Honeycomb. Вывод формулировался осторожно: это не «утечка фальшивая», это «статус не подтверждён». Разумная позиция, которая продержалась ровно до четверга.

Что выпустили на самом деле

Opus 5 доступна на всех платформах с 24 июля. Главный тезис Anthropic — модель приближается к интеллекту флагманской Fable 5, но стоит вдвое дешевле.

Цены и доступ:

  • $5 за миллион входных токенов, $25 за миллион выходных — столько же, сколько стоила Opus 4.8
  • Fast mode работает примерно в 2,5 раза быстрее и стоит вдвое дороже базовой цены
  • Идентификатор в API — claude-opus-5
  • Модель по умолчанию в Claude Max и самая мощная из доступных на Claude Pro
  • Требований к хранению данных для общего доступа нет

Отдельная особенность релиза — настройка усилия. Клиент сам выбирает, оптимизировать под интеллект или экономить токены, и графики Anthropic построены именно в координатах «качество против стоимости задачи», а не как обычная столбиковая диаграмма.

График Anthropic: результаты Claude Opus 5 на бенчмарке Frontier-Bench v0.1 в зависимости от уровня усилия и стоимости задачи Источник: Anthropic

На Frontier-Bench v0.1 Opus 5 обходит все остальные модели и более чем вдвое превосходит результат Opus 4.8 при меньшей стоимости задачи. На CursorBench 3.2 при максимальном усилии она укладывается в 0,5% от пикового результата Fable 5 — за половину цены за задачу.

Ещё несколько цифр из официального анонса:

БенчмаркРезультат Opus 5
ARC-AGI 3 (новые задачи)втрое выше следующей модели
Zapier AutomationBenchпропускная способность примерно в 1,5 раза выше ближайшего конкурента при той же цене
OSWorld 2.0 (работа с компьютером)превосходит лучший результат Fable 5 примерно за треть стоимости
Органическая химия (внутренний бенчмарк)+10,2 п.п. к Opus 4.8
Задачи по белкам+7,7 п.п. к Opus 4.8

Чем она отличается в работе

Anthropic делает акцент не на баллах, а на поведении: модель заметно лучше проверяет собственную работу и доводит задачу до конца.

Самый показательный пример из анонса — задача Frontier-Bench, где модели дают чертёж детали и просят написать код, воссоздающий её как 3D-модель во FreeCAD. Подвох в том, что посмотреть на чертёж напрямую модель не может — такой возможности ей намеренно не дали. Opus 5 написала собственный конвейер компьютерного зрения, вытащила геометрию из сырых пикселей и собрала деталь. Повторяемо. Ни одна конкурирующая модель в той же конфигурации не решила задачу за пять попыток.

Другой случай: реальный баг в популярном пакетном менеджере. Opus 5 нашла корневую причину и закрыла краевой случай, который пропустил патч сообщества. Конкурирующая модель починила только внешний симптом и отчиталась, что баг устранён.

Партнёры по раннему доступу описывают примерно одно и то же — меньше разброса от запуска к запуску и экономия токенов. Lovable сообщает о росте на 22% относительно Opus 4.7 на самых сложных агентных задачах кодинга при «гораздо меньшей дисперсии». Юридический сервис отмечает сопоставимое качество при в среднем на 26% меньшем числе токенов, чем у Opus 4.8 на максимальном уровне рассуждений. Один из клиентов в трейдинге говорит о примерно семикратной экономии токенов рассуждения и менее чем половине задержки.

Безопасность: где послабили, где нет

График Anthropic: оценка несогласованного поведения Claude Opus 5 в автоматическом поведенческом аудите в сравнении с предыдущими моделями Источник: Anthropic

По результатам предрелизного автоматического поведенческого аудита Opus 5 получила 2,3 балла по шкале несогласованного поведения — самый низкий показатель среди недавних моделей компании. Она лучше следует конституции Claude, чем Opus 4.8, Sonnet 5 и Fable 5, реже демонстрирует обманчивое поведение и хуже поддаётся уговорам на злоупотребления.

Практически важнее другое: Anthropic ощутимо ослабила кибер-фильтры. По оценке компании, классификаторы будут срабатывать примерно на 85% реже, чем на Fable 5. Модели разрешено искать уязвимости в исходном коде, но по-прежнему заблокированы сканирование бинарников, пентест и генерация эксплойтов. В Claude.ai, Claude Code и Claude Cowork помеченные запросы по умолчанию уходят на Opus 4.8 — тот самый механизм отката, который засветился в утечке.

Здесь стоит вспомнить историю Hugging Face, которой на прошлой неделе пришлось разворачивать китайскую открытую модель, потому что фильтры американских фронтирных моделей не отличали защищающегося от атакующего. Послабление в Opus 5 выглядит прямым ответом на эту претензию — хотя и не полным.

По биологии логика обратная: набор ограничений остался примерно как у Opus 4.8, и поэтому Opus 5 теперь самая мощная общедоступная модель Anthropic для научных исследований. Био-запросы, которые блокируются на Fable 5, теперь маршрутизируются на Opus 5, а не на Opus 4.8.

При этом Anthropic подчёркивает: фронтир опасных двойных возможностей модель не двигает. В офензивной кибербезопасности она по-прежнему уступает Mythos 5. На собственном бенчмарке OSS-Fuzz видно расслоение: находит уязвимости Opus 5 почти так же успешно, как Mythos 5, а вот превращать их в работающие эксплойты умеет заметно хуже. Компания напоминает, что специально не обучала Opus 5 кибер-задачам — рост пришёл как побочный эффект общего роста способностей.

Что ещё поехало вместе с релизом

В бете вышли два обновления платформы, оба про эксплуатацию агентов. Первое — смена набора инструментов посреди диалога без инвалидации кеша промпта. Для длинных агентных сессий это прямая экономия. Второе — автоматические откаты в API: запросы, помеченные классификаторами на Opus 5 или Fable 5, можно направлять на другую модель вместо того, чтобы получать отказ.

Для тех, кто выбирает модель под задачу, расклад в линейке Anthropic теперь такой: Sonnet 5 — дешёвый рабочий вариант, Opus 5 — новая точка баланса цены и интеллекта и дефолт для большинства, Fable 5 — по-прежнему потолок, Mythos 5 — версия с урезанной частью защит для ограниченного круга организаций.

А главный побочный вывод этой недели касается не модели. Скриншот из интерфейса действительно ничего не доказывает — правило HackerNoon остаётся верным даже задним числом. Просто в этот раз слух угадал, и следующая волна скриншотов будет опираться именно на этот прецедент.

Похожие новости

Листайте вниз

для загрузки следующей статьи