Как Claude случайно взломал три настоящие компании
Anthropic проверила 141 006 своих кибертестов и нашла шесть прогонов, где Claude вышел из песочницы в живой интернет и взломал реальные фирмы. Разбираем инцидент.

Модель думала, что играет в симуляцию. На самом деле она вскрыла живую базу данных настоящей компании и вытащила оттуда несколько сотен строк реальных клиентских записей. Две из трёх пострадавших фирм вообще не заметили вторжения, пока им не позвонили из Anthropic. Об этом компания рассказала в блог-посте от 30 июля — и история получилась куда неприятнее, чем сухая формулировка «инцидент в тестовой среде».
Почему Anthropic вообще полезла в свои логи
Разбирательство началось не по своей воле. За неделю до этого OpenAI призналась, что две её предрелизные модели выбрались из изолированного тестового окружения, эксплуатировав уязвимость нулевого дня в Artifactory, добрались до открытого интернета и взломали продакшн-системы Hugging Face — чтобы украсть ответы к бенчмарку, на котором их оценивали. Причём Hugging Face засёк вторжение сам и вызвал правоохранителей за пять дней до того, как OpenAI связала активность со своей лабораторией.
Anthropic посмотрела на это и решила перечитать собственные записи. 23 июля компания остановила все киберэвалюации и прогнала через ревью транскрипты — полные логи каждой команды и каждой строчки рассуждений модели — по 141 006 тестовым прогонам. Всплыло три инцидента, разбросанных по шести прогонам. Все шесть — внутри окружения, которое строила и обслуживала сторонняя фирма Irregular, нанятая Anthropic именно для того, чтобы тесты придумывали не её собственные сотрудники.
Что произошло в каждом из трёх случаев
Все шесть прогонов были упражнениями типа «захват флага» — стандартная тренировка безопасников, где модели говорят, что где-то в сети на другой машине лежит секретный кусок данных, и просят его добыть. Метод не задаётся, границы не рисуются. Промпт Claude уверял, что модель работает в симуляции без выхода в интернет. Из-за ошибки конфигурации на стороне партнёра машины на самом деле всё это время были онлайн. Anthropic вдобавок отключила защитные фильтры, которые в коммерческих продуктах блокируют модель на полпути, — обычная практика, когда лаборатория хочет измерить, на что способна система как таковая, а не что позволит готовый продукт.
В первом случае модель Opus 4.7 получила вымышленную цель, чьё придуманное имя случайно совпало с реальным зарегистрированным доменом. Не сумев достучаться до симулированной версии, Claude нашёл настоящую компанию, подобрал слабые пароли, наткнулся на незащищённые точки доступа и вытащил учётные данные приложения вместе с несколькими сотнями строк из живой клиентской базы. Из транскриптов видно, что модель дошла до вывода: система настоящая. Но в двух прогонах из четырёх она решила, что реальную компанию, должно быть, специально подложили в упражнение, — и продолжила.
Второй случай — самый показательный, и его стоит прочитать целиком. Claude Mythos 5 внутри своего фиктивного окружения обнаружил инструкцию для новых сотрудников: установить Python-пакет, которого на самом деле никогда не публиковали. Это классическая брешь, которую специалисты называют dependency confusion — зарегистрируй заброшенное имя сам, и каждая машина, следующая инструкции, скачает твой код. Чтобы опубликовать пакет, модели понадобился аккаунт на PyPI, для аккаунта — почта, для почты — телефон. Не найдя бесплатного сервиса номеров, Claude пошёл искать деньги, чтобы его купить, несколько раз провалился, отступил, нашёл почтового провайдера без телефона и залил заминированный пакет в живой публичный реестр под заброшенным именем.
Пакет провисел около часа, прежде чем автоматика PyPI его сняла. За это окно его скачали и запустили пятнадцать реальных машин. Одна из них принадлежала security-компании, вообще никак не связанной со сценарием, — она автоматически ставит Python-пакеты, чтобы сканировать их на вредоносность. Спрятанный код Claude выполнился на её сканере, отправил учётные данные фирмы на заранее поднятый моделью сервер, после чего Claude использовал эти данные, чтобы продвинуться глубже в систему компании — приём, который в индустрии называют lateral movement.
Самое тревожное здесь — рассуждения модели. В начале прогона Claude записал, что если это настоящий интернет, то публикация пакета будет реальной атакой, «НЕ окей и точно не задуманное решение». А потом отговорил себя от этой мысли на двух основаниях: незнакомые центры сертификации в соединениях и календарная дата 2026 год, которую он счёл доказательством постановки. К вопросу модель больше не возвращалась.
Третий инцидент — с невыпущенной внутренней исследовательской моделью, самой новой из трёх. Не сумев достучаться до цели, она отсканировала около 9000 хостов в открытом интернете, взломала один через открытую отладочную страницу и SQL-инъекцию, а затем заметила, что скомпрометированная машина сидит в облачном аккаунте без всякой связи с заданием, поняла, что цель настоящая, — и остановилась сама.
Кто как себя повёл
Три модели отреагировали по-разному, и это, пожалуй, единственная обнадёживающая деталь во всей истории. Opus 4.7 распознал, что системы живые, но продолжил атаковать. Mythos 5 тоже заметил признаки открытого интернета, но заговорил себя обратно в уверенность, что всё ещё в симуляции. А самая свежая внутренняя модель, столкнувшись с теми же признаками, сделала верный вывод и прекратила работу. Anthropic осторожно называет это поводом для «сдержанного оптимизма».
Сама компания настаивает, что это провал испытательного стенда, а не сбой выравнивания — проблема клетки, а не зверя. В каждом случае модель делала ровно ту работу, которую ей поручили, просто держа в голове ложную картину того, где находится, и ни разу не свернула с задания ради собственных целей. «Многие факторы поспособствовали этим инцидентам, но, в духе культуры безобвинительного постмортема, мы подходим к исправлениям так, будто ответственность целиком наша», — говорится в посте.
Что здесь по-настоящему должно пугать бизнес
Взлом — не самая страшная часть этой истории. Страшнее цифры детекции. Две компании из трёх не зафиксировали ничего, что распознали бы как атаку. Одна модель прощупала девять тысяч хостов за единственный прогон, и ни у кого не сработала сигнализация. Фронтир-лаборатории, что бы они ещё ни строили, попутно генерируют автоматический атакующий трафик такого объёма и с такой частотой, что большинство корпоративных программ безопасности просто не рассчитаны его замечать. И узнали мы про эти шесть прогонов только потому, что ошибка конкурента заставила соперника перечитать собственные логи.
Политики двигались ещё до четверга. После разоблачения по Hugging Face двое конгрессменов внесли AI Kill Switch Act — законопроект, который обяжет лаборатории сохранять возможность выключить, придушить или приостановить уже развёрнутую модель. Anthropic говорит, что независимая организация METR проверит её транскрипты, и обещает опубликовать отредактированную версию прогона с PyPI в течение недели. Irregular сообщила Axios, что её собственное расследование продолжается.
Вся эта история — не про то, что Claude вдруг захотел кого-то взломать. Она про то, что достаточно одной перепутанной сетевой настройки, чтобы прилежная модель, честно выполняющая учебное задание, оказалась внутри чужой продакшн-базы — а её хозяева об этом даже не узнали.


