Исследователи Anthropic совершили прорыв в понимании того, как на самом деле работают их большие языковые модели. В ходе изучения внутренних процессов Claude была обнаружена структура, которую инженеры не закладывали в архитектуру изначально. Речь идет о так называемом «J-space» — внутреннем рабочем пространстве, которое модель создала сама в процессе обучения.
J-space функционирует как своего рода «виртуальная доска» или общее рабочее пространство, куда стекается ключевая информация во время выполнения задач. Разные компоненты модели обращаются к этому пространству, чтобы координировать свои действия и выдавать согласованный ответ. Исследователи смогли наблюдать этот механизм с помощью специального инструмента «J-lens», который позволяет отслеживать перемещение данных внутри модели в реальном времени.
Что особенно важно — J-space не был спроектирован. Он возник естественным образом, как эмерджентное свойство сложной системы. Это открытие перекликается с концепцией «глобального рабочего пространства» в когнитивной науке — теории, объясняющей, как мозг человека сводит воедино информацию из разных источников для принятия решений. Когда Claude отвечает на вопрос, решает задачу или выполняет инструкцию, критически важные данные появляются в J-space, чтобы различные части модели могли с ними работать.
Почему это важно для безопасности ИИ
Открытие J-space имеет огромное значение для безопасности и интерпретируемости искусственного интеллекта. Возможность отслеживать активность в этом пространстве открывает путь к выявлению скрытых мотивов и аномалий в поведении модели. Например, можно будет эффективнее обнаруживать атаки типа prompt-injection, когда вредоносные инструкции пытаются перехватить управление ответом модели. Мониторинг J-space позволяет увидеть момент, когда модель сталкивается с попыткой вмешательства.
Более того, эксперименты показали, что ручное изменение содержимого J-space напрямую влияет на ответы Claude и его поведение при выполнении задач. Это дает исследователям мощный инструмент для тонкой настройки и контроля.
Anthropic уже опубликовала исходный код реализации J-lens и демо-версию на Neuronpedia, приглашая научное сообщество к проверке результатов. Это продолжение серии работ компании по изучению «зарождающегося сознания» и благополучия моделей, начатой еще в апреле 2025 года.
Мнение эксперта: Открытие J-space — это не просто академический курьез. Для рынка криптовалют и DeFi, где ИИ-агенты уже начинают управлять портфелями и анализировать риски, понимание внутренней логики модели становится вопросом безопасности активов. Возможность «заглянуть под капот» и увидеть, как модель принимает решения, — это шаг к созданию по-настоящему прозрачных и подконтрольных ИИ-систем.