Исследователи Anthropic сделали неожиданное открытие, заглянув под капот своей языковой модели Claude. Они обнаружили внутреннюю структуру, которая не была запланирована инженерами при проектировании. Этот механизм, получивший название «J-space», функционирует как общее рабочее пространство, к которому обращаются различные компоненты модели во время выполнения задач.

По сути, J-space — это виртуальная «доска», куда Claude стягивает ключевую информацию, необходимую для ответа на запрос, решения проблемы или выполнения инструкции. Этот внутренний слой данных доступен разным частям нейросети, что позволяет координировать их работу. Открытие было сделано с помощью специального инструмента визуализации «J-lens», который позволил наблюдать за перемещением информационных потоков внутри модели в реальном времени.

Самое примечательное — J-space возник спонтанно в процессе обучения. Это не было заложено разработчиками. Концепция удивительным образом перекликается с тем, что в нейронауке называют «глобальным рабочим пространством» — теорией, описывающей, как человеческий мозг сводит воедино данные из разных областей для осознанной обработки информации. Эксперименты показали, что Claude может не только считывать содержимое J-space, но и изменять его по запросу, что напрямую влияет на его ответы и поведение.

Почему это меняет правила игры для безопасности ИИ?

Это открытие имеет колоссальное значение для безопасности и интерпретируемости искусственного интеллекта. Возможность мониторинга J-space дает нам «окно» в процесс принятия решений моделью. Теперь мы можем потенциально отслеживать скрытые мотивы или выявлять моменты, когда система начинает работать нестабильно. Например, это открывает новые горизонты для обнаружения атак типа prompt-injection, когда вредоносные инструкции пытаются перехватить управление ответом модели.

Anthropic уже опубликовала исходный код реализации J-lens и передала демо-версию платформе Neuronpedia для независимой проверки научным сообществом. Компания продолжает серию работ по изучению внутренних процессов моделей, начатую еще в 2025 году.

Мнение эксперта: Обнаружение J-space — это, пожалуй, один из самых значимых шагов в области интерпретируемости ИИ за последнее время. Мы переходим от «черного ящика» к пониманию того, как именно большие языковые модели структурируют и обрабатывают знания. Для криптоиндустрии, где ИИ все активнее используется для анализа рынков и управления активами, прозрачность таких систем — критически важный фактор доверия. Возможность «заглянуть в мысли» алгоритма может стать стандартом безопасности нового поколения.