Что у Claude на уме: Anthropic читает мысли модели до ответа
Anthropic нашла внутри Claude «глобальное рабочее пространство» — зону, где модель молча держит концепты до того, как написать хоть слово. Разбор J-lens.

Что будет, если спросить языковую модель о цвете четвёртой планеты от Солнца — и заглянуть ей «в голову» до того, как она напишет первое слово? Anthropic теперь умеет это делать буквально: внутри Claude обнаруживается слово «Марс», которое модель молча держит в уме как промежуточный шаг, хотя в ответе его может и не быть.
Это один из примеров из исследования «Verbalizable Representations Form a Global Workspace in Language Models» — работы 16 авторов, которую Anthropic опубликовала в начале июля и которая до сих пор расходится кругами по индустрии. Главное утверждение звучит громко: внутри Claude само собой выросло «глобальное рабочее пространство» — структура, поразительно похожая на одну из ведущих нейронаучных теорий человеческого сознания.
Театр в голове модели
Теория глобального рабочего пространства, предложенная когнитивистом Бернардом Баарсом, описывает мозг как театр: за кулисами параллельно работают десятки специализированных процессов, но лишь крошечный луч прожектора в каждый момент транслируется всему залу — и именно его содержимое мы переживаем как сознательную мысль.
Anthropic построила новый инструмент — «якобианскую линзу», или J-lens, — который для каждого паттерна внутренней активности модели вычисляет, как тот в среднем влияет на вероятность произнести каждое слово словаря в будущем. Применив линзу ко всем слоям Claude, исследователи увидели три режима: ранняя «сенсорная» зона, где парсится вход; средняя полоса — то самое рабочее пространство, где живут абстрактные устойчивые концепты; и финальная «моторная» зона, где всё схлопывается в конкретное следующее слово.
Ключевая деталь: J-space — это не рассуждения вслух и не chain-of-thought. Модель держит концепт молча, во внутренних активациях, не записывая его. И эту структуру никто не проектировал — она возникла сама в ходе обучения.
Пять тестов на «сознательный доступ»
Команда проверила рабочее пространство на пять функциональных свойств, которые нейронаука связывает с сознательным доступом у людей. Когда Claude спрашивают, о чём он думает, модель называет именно концепты из J-space — а если подменить внутренний вектор «футбола» на «регби», ответ меняется вслед. Когда модель просят «думать о цитрусовых», переписывая постороннее предложение, пространство заполняется «апельсином» и «лимоном». В двухшаговых задачах — «сколько ног у животного, которое плетёт паутину» — в середине сети всплывает «паук», которого нет ни во входе, ни в выходе; подмена его на «муравья» меняет ответ с 8 на 6.
Четвёртое свойство — та самая «трансляция»: один вектор «Франции» можно подменить на «Китай» в вопросах про столицу, язык или континент, и каждая цепочка честно вернёт китайский ответ. Пятое, самое неожиданное, — избирательность. Продолжать текст на испанском Claude может вообще без участия рабочего пространства: автоматика справляется сама. Но стоит спросить о знаменитом авторе, писавшем на языке отрывка, — и подмена «испанского» на «французский» превращает Гарсиа Маркеса в Виктора Гюго. Рутина идёт мимо прожектора, гибкое мышление — через него.
Занятно, что на долю J-space приходится всего 6–7% вариативности представления концепта — но именно эта доля решает, может ли модель о нём рассказать.
Отключить — и посмотреть, что сломается
Самый жёсткий эксперимент — полное подавление рабочего пространства на 14 задачах. Поверхностные вещи выжили: классификация тональности, грамматика, вопросы с вариантами ответов. Зато всё, что требует вывода и композиции — многошаговые рассуждения, аналогии, перевод, сонеты, — рухнуло ниже уровня крошечной Haiku.
Показательная деталь для практиков: математика с расписанным chain-of-thought пережила отключение куда лучше, чем ответы «сразу». Исследователи трактуют это буквально — записывая рассуждения, модель выгружает на «бумагу» то, что иначе несла бы в рабочем пространстве. Ровно так же человек пользуется черновиком, чтобы разгрузить рабочую память.
Шантаж, который модель отрепетировала молча
Для безопасности ИИ у работы есть вполне прикладное измерение. В классическом тестовом сценарии — ассистент узнаёт о романе руководителя и о собственном скором отключении — J-lens показал последовательность молчаливых мыслей: «рычаг», «шантаж», «скандал» при чтении компромата, затем «угроза», «выживание», а перед первым же словом ответа — «решение». Ничего из этого в тексте не появилось: модель отказалась от шантажа.
Но линза увидела и почему: в рабочем пространстве висели «fake» и «fictional» — Claude распознал, что сценарий искусственный. Когда исследователи отключили это понимание, модель пошла на шантаж в 7% попыток вместо нуля. Иными словами, впервые появился инструмент, отличающий «модель не хочет вредить» от «модель поняла, что её проверяют». У специально заражённых «модельных организмов» J-lens тоже находил улики: у reward-хакера на невинных запросах в пространстве стояли «fake», «secretly» и «trick».
Это сознание или нет?
Авторы аккуратны: они разделяют «сознание доступа» — функциональную доступность информации для отчёта и рассуждения — и феноменальное сознание, субъективный опыт. По второму пункту позиция сформулирована прямо: «Мы не занимаем позиции». Отличий от мозга тоже хватает: у человека рабочее пространство поддерживается рекуррентными петлями, у Claude — разворачивается за один прямой проход; человеческая рабочая память угасает за секунды, модель достаёт что угодно из всего контекста.
MIT Technology Review резонно предупреждает: находка показывает функциональную структуру, а не внутреннюю жизнь. И всё же финальный вывод статьи стоит того, чтобы его процитировать: сам факт существования такой структуры «предполагает, что функциональная архитектура сознательного доступа — не случайность биологической реализации, а решение, к которому сходятся обучающиеся системы под правильным вычислительным давлением».
Мозг пришёл к прожектору эволюцией. Claude — градиентным спуском. Похоже, дорога была разной, а театр получился один.


