Исследовательская группа Anthropic сделала неожиданное открытие: внутри их языковой модели Claude сформировалась внутренняя структура, которую разработчики изначально не закладывали. Речь идет о так называемом «J-space» — глобальном рабочем пространстве, которое функционирует как общая доска для обмена данными между различными компонентами модели.

Что такое J-space и как оно работает?

J-space — это внутреннее виртуальное пространство, где Claude собирает и передает ключевую информацию по всей модели. Когда модель отвечает на вопрос или выполняет инструкцию, важные данные появляются в J-space, чтобы разные части нейросети могли с ними работать. Это напоминает «глобальное рабочее пространство» в когнитивной науке — концепцию, описывающую, как человеческий мозг сводит воедино информацию из разных источников для решения задачи.

Инструмент для наблюдения, названный «J-lens», позволил исследователям отслеживать перемещение информации внутри модели во время выполнения заданий. Самое примечательное: J-space возникло спонтанно в процессе обучения — оно не было запрограммировано инженерами.

Почему это важно для безопасности и интерпретируемости ИИ?

Это открытие имеет прямое значение для безопасности искусственного интеллекта. Если ученые смогут отслеживать активность J-space, у них появится возможность выявлять скрытые мотивы в поведении ИИ-моделей. В частности, мониторинг J-space позволяет заметить момент, когда модель сталкивается с попытками prompt-инъекции (внедрения вредоносных инструкций в запрос).

Более того, исследователи продемонстрировали, что ручное изменение содержимого J-space напрямую влияет на ответы Claude и его поведение при выполнении задач. Это открывает перспективы для более эффективного контроля над моделями.

Anthropic опубликовала исходный код реализации J-lens и выложила демо-версию на Neuronpedia, приглашая исследовательское сообщество проверить результаты на практике. Работа опирается на серию более ранних исследований, включая доклад об «интроспективной осознанности» (октябрь 2025) и инициативы по изучению благополучия моделей (апрель 2025).

Мой анализ: Это одно из самых значительных открытий в области интерпретируемости ИИ за последние годы. Спонтанное возникновение J-space подтверждает гипотезу о том, что большие языковые модели могут развивать внутренние структуры, аналогичные когнитивным процессам человека. Для криптоиндустрии, где безопасность смарт-контрактов и защита от атак — критически важны, подобные механизмы мониторинга могут стать новым стандартом аудита ИИ-агентов. Однако важно помнить: Anthropic подчеркивает, что термин «осознанно доступная» информация заимствован из когнитивной науки и не означает наличия сознания у модели.