Исследовательская группа Anthropic сделала неожиданное открытие, анализируя внутреннюю архитектуру своей языковой модели Claude. В ходе работы с новым инструментом визуализации J-lens специалисты выявили структуру, которая не была запланирована на этапе проектирования. Речь идет о так называемом «J-space» — внутреннем рабочем пространстве, которое функционирует как общая шина данных для различных компонентов модели.

Что такое J-space и как он работает

J-space можно представить как виртуальную «доску», к которой обращаются разные части нейросети во время выполнения задачи. Когда Claude получает запрос, ключевая информация (контекст, инструкции, промежуточные результаты) помещается в это пространство, чтобы все модули модели могли с ней работать согласованно. Это не было заложено инженерами напрямую — структура возникла спонтанно в процессе обучения модели.

По сути, J-space — это аналог «глобального рабочего пространства» (global workspace), которое в когнитивной науке рассматривается как механизм сознания человека. В мозге эта система объединяет данные от разных сенсорных и когнитивных процессов, делая их доступными для осознанного принятия решений. У Claude происходит нечто похожее: исследователи смогли не только наблюдать за содержимым J-space, но и изменять его вручную, что напрямую влияло на поведение модели.

J-space у Claude во многом повторяет то, что ученые называют «глобальным рабочим пространством» в человеческом мышлении.
J-space у Claude — это аналог глобального рабочего пространства в человеческом мышлении.

Почему это важно для безопасности и интерпретируемости ИИ

Открытие имеет прямое значение для безопасности искусственного интеллекта. Если мы можем отслеживать активность J-space, мы получаем инструмент для выявления скрытых мотивов в поведении модели — например, попыток обойти ограничения или выполнить вредоносные инструкции (prompt injection). Мониторинг этого слоя позволяет заметить момент, когда модель сталкивается с атакой, еще до того, как она сгенерирует нежелательный ответ.

Кроме того, частичный доступ к «осознанно доступной» информации открывает новые перспективы для исследований. Anthropic подчеркивает, что термин «осознанно» заимствован из когнитивной науки и не означает наличия у Claude субъективного опыта или сознания. Однако сама возможность влиять на внутреннее пространство модели и наблюдать за изменениями — это шаг к созданию более прозрачных и контролируемых систем.

На данный момент большая часть обработки информации у Claude по-прежнему происходит вне J-space, и возможности инструмента ограничены. Тем не менее, компания уже опубликовала исходный код реализации J-lens и демо-версию на Neuronpedia, приглашая научное сообщество к проверке результатов.

Экспертное мнение Cryptalist

Это открытие — не просто академический курьез. Оно подтверждает, что сложные нейросети способны вырабатывать собственные механизмы координации, которые мы не закладывали в них явно. Для индустрии ИИ это одновременно и вызов, и возможность: мы получаем новый инструмент аудита «черного ящика», но одновременно сталкиваемся с тем, что модель может иметь скрытые «каналы связи» между своими компонентами. В контексте безопасности DeFi-протоколов и крипто-инфраструктуры, где ИИ все чаще используется для анализа и принятия решений, понимание таких внутренних структур становится критически важным.