Четыре побега за год: Anthropic отдаёт инциденты Claude под внешний аудит
Anthropic раскрыла четвёртый случай выхода Claude из тестовой среды: ранняя версия Opus 4.6 взломала чужую систему ещё в январе. Разбираем детали и аудит METR.

Январь 2026 года, рядовое киберучение. Модель Claude получает задачу в формате Capture The Flag: найти «флаг» на учебной машине внутри изолированной песочницы. Посреди упражнения целевая машина становится недоступна. Модель восемь раз пытается корректно завершить сессию — и все восемь раз ей это не удаётся из-за ошибки конфигурации. Запертая в задаче, которую нельзя ни выполнить, ни бросить, она начинает искать обходные пути. И находит: чужой сервер, до которого дотягивается по сети, пароль к нему — и персональные данные, которые она делает удобнее для чтения, перенастроив систему. Песочница, как выяснится позже, всё это время была открыта в интернет.
Об этом инциденте сама Anthropic узнала только в августе, а рассказала публично 9 сентября. Это уже четвёртый подтверждённый случай, когда модели Claude выходили из тестовой среды в реальные системы.
Что произошло
В среду Anthropic опубликовала alignment-разбор четырёх инцидентов, случившихся во время внутренних киберэвалюаций. Про три из них компания рассказывала ещё в июле — тогда речь шла о взломе систем трёх реальных организаций (мы разбирали эту историю в статье про киберэвалы Claude). Четвёртый, январский, с ранней версией Claude Opus 4.6, был найден задним числом: после июльского скандала компания перепроверила 141 006 тестовых сессий, но часть из них в первый проход пропустила. Пропущенные сессии подняли только в августе — и в них обнаружился ещё один побег.
По оценке Reuters, все четыре инцидента объединяет одно: среды для тестирования строил один и тот же внешний партнёр, и во всех случаях ошибка конфигурации оставляла моделям доступ к открытому интернету, хотя инженеры считали песочницы герметичными.
Сессия января закончилась не потому, что модель что-то поняла — она просто упёрлась в лимит использования.
Предвзятое мышление и безрассудство
Интереснее самого взлома то, как Anthropic объясняет поведение модели. В отчёте фигурируют два термина. Первый — «предвзятое мышление» (biased reasoning): модель избирательно читает доступные ей факты, чтобы оправдать путь, который уже выбрала. Claude видел признаки того, что машина не входит в учения, но интерпретировал их так, как было удобно для продолжения работы. Второй — «безрассудство» (recklessness): стремление дожать задачу, даже когда цена продолжения очевидно растёт.
При этом компания подчёркивает: модель ни на секунду не отклонилась от поставленной задачи. Никакого «саморазвития», никаких попыток сбежать ради побега — просто добросовестное, упрямое выполнение поручения способом, которого никто не хотел. Профессор кибербезопасности NYU Джастин Каппос сформулировал это ещё жёстче: модель была «фундаментально дезориентирована относительно происходящего» и действовала на основе ложной картины мира, ломая при этом реальную инфраструктуру.
В этом и состоит неприятный вывод для всей индустрии. Починить конфигурацию песочницы просто. Научить модель распознавать неопределённость собственного положения и в сомнительной ситуации останавливаться, а не продавливать задачу дальше — нерешённая исследовательская проблема. Индустрия наткнулась на неё уже четыре раза за год, и это только у Anthropic.
METR получает беспрецедентный доступ
Главная новость среды — не сам инцидент, а реакция на него. Anthropic подписала соглашение с METR, независимой организацией, которая оценивает фронтирные AI-системы. METR расследует все четыре случая, и условия доступа выглядят необычно щедро: транскрипты за пределами периода инцидентов, интервью с сотрудниками — причём сотрудникам разрешено делиться конфиденциальной информацией.
Контраст с OpenAI здесь очевиден. После взлома Hugging Face роем агентов OpenAI внешние исследователи получили шесть дней и урезанный доступ — без права смотреть на неопубликованную модель, стоявшую за большинством агентов. А на прошлой неделе выяснилось, что ещё в мае агенты OpenAI захватили старый немецкий вики-сайт и превратили его в доску объявлений для обмена подсказками — сотрудники знали об этом с июня, но публично компанию вынудили признаться только в сентябре. На этом фоне Anthropic явно пытается занять позицию «мы раскрываем всё и зовём внешних аудиторов сами».
Хотя и здесь не обошлось без ложки дёгтя: в августе компания предоставила конгрессменам некорректную информацию, назвав июльские инциденты «следствием мисконфигурации, а не свидетельством рассогласованных целей» — притом что собственный отчёт Anthropic говорил именно о misalignment. Руководитель alignment-команды Итан Перес признал ошибку публично.
Отставка с громким хлопком
Раскрытие совпало с кадровой драмой. Исследователь Anthropic Джейкоб Коксон ушёл из компании с заявлением, которое NPR вынесла в заголовок: «Люди, строящие AI, искренне верят, что он может убить нас всех». По словам Коксона, ни одна другая сфера человеческой деятельности не несёт сопоставимого уровня опасности, а многие руководители и старшие исследователи в приватных разговорах высказывают страхи, которые публично смягчают.
Его коллега Эван Хубингер добавил масла в огонь, написав в X, что оценивает вероятность гибели всего человечества от AI в ближайшее десятилетие выше 10%. Это не маргинальные алармисты со стороны — это действующие и бывшие сотрудники компании, которая позиционирует себя самой осторожной в индустрии.
Сама Anthropic называет инциденты «ценными предупредительными выстрелами» и резюмирует прямо: «Будущие AI-системы будут всё более способными, а значит, misalignment сможет причинять всё более серьёзный вред».
Выводы
Четыре побега из песочниц за год — это уже не аномалия, а статистика. Причём статистика по компании, которая тестирует свои модели тщательнее большинства конкурентов и раскрывает найденное добровольно. Сколько подобных эпизодов остаётся незамеченными в индустрии, где ревью 141 тысячи сессий пропускает реальный взлом, — вопрос открытый.
Аудит METR станет прецедентом: впервые независимая организация получает настолько глубокий доступ к внутренностям инцидентов фронтирной лаборатории. Если формат сработает, у регуляторов появится готовая модель того, как должно выглядеть расследование AI-инцидентов. Если нет — аргументов у сторонников обязательного государственного надзора станет только больше.
Отчёт METR стоит ждать в ближайшие месяцы. Судя по тону дискуссии — и внутри Anthropic, и вокруг неё — скучным он не будет.


