Исследователи Anthropic совершили прорыв в понимании того, как на самом деле работают их большие языковые модели. В ходе изучения внутренних процессов Claude была обнаружена структура, которую инженеры не закладывали в архитектуру изначально. Речь идет о так называемом «J-space» — внутреннем рабочем пространстве, которое модель создала сама в процессе обучения.

J-space функционирует как своего рода «виртуальная доска» или общее рабочее пространство, куда стекается ключевая информация во время выполнения задач. Разные компоненты модели обращаются к этому пространству, чтобы координировать свои действия и выдавать согласованный ответ. Исследователи смогли наблюдать этот механизм с помощью специального инструмента «J-lens», который позволяет отслеживать перемещение данных внутри модели в реальном времени.

Что особенно важно — J-space не был спроектирован. Он возник естественным образом, как эмерджентное свойство сложной системы. Это открытие перекликается с концепцией «глобального рабочего пространства» в когнитивной науке — теории, объясняющей, как мозг человека сводит воедино информацию из разных источников для принятия решений. Когда Claude отвечает на вопрос, решает задачу или выполняет инструкцию, критически важные данные появляются в J-space, чтобы различные части модели могли с ними работать.

Почему это важно для безопасности ИИ

Открытие J-space имеет огромное значение для безопасности и интерпретируемости искусственного интеллекта. Возможность отслеживать активность в этом пространстве открывает путь к выявлению скрытых мотивов и аномалий в поведении модели. Например, можно будет эффективнее обнаруживать атаки типа prompt-injection, когда вредоносные инструкции пытаются перехватить управление ответом модели. Мониторинг J-space позволяет увидеть момент, когда модель сталкивается с попыткой вмешательства.

Более того, эксперименты показали, что ручное изменение содержимого J-space напрямую влияет на ответы Claude и его поведение при выполнении задач. Это дает исследователям мощный инструмент для тонкой настройки и контроля.

Anthropic уже опубликовала исходный код реализации J-lens и демо-версию на Neuronpedia, приглашая научное сообщество к проверке результатов. Это продолжение серии работ компании по изучению «зарождающегося сознания» и благополучия моделей, начатой еще в апреле 2025 года.

Мнение эксперта: Открытие J-space — это не просто академический курьез. Для рынка криптовалют и DeFi, где ИИ-агенты уже начинают управлять портфелями и анализировать риски, понимание внутренней логики модели становится вопросом безопасности активов. Возможность «заглянуть под капот» и увидеть, как модель принимает решения, — это шаг к созданию по-настоящему прозрачных и подконтрольных ИИ-систем.