Исследователи Anthropic совершили прорыв в понимании внутренней работы своих моделей Claude. Они обнаружили структуру, которую инженеры не закладывали в архитектуру на этапе проектирования. Речь идет о так называемом «J-space» — внутреннем рабочем пространстве, которое модель создала самостоятельно в процессе обучения.
J-space функционирует как глобальная доска объявлений для данных. Когда Claude обрабатывает запрос, решает задачу или выполняет инструкцию, критически важная информация концентрируется в этом пространстве. Различные компоненты модели обращаются к J-space, чтобы обмениваться данными. Это напоминает концепцию «глобального рабочего пространства» в когнитивной нейронауке, где мозг сводит воедино информацию из разных областей для принятия решений.
Для обнаружения этой структуры команда Anthropic разработала инструмент под названием J-lens. С его помощью исследователи наблюдали, как информация перемещается внутри модели во время выполнения задания. Ключевой вывод: J-space не был запрограммирован — он возник спонтанно как эмерджентное свойство обучения.
Почему это важно для безопасности и интерпретируемости ИИ
Открытие J-space имеет огромное значение для безопасности искусственного интеллекта. Если ученые смогут отслеживать активность в этом пространстве, у них появится возможность выявлять скрытые мотивы в поведении моделей. Это открывает путь к более эффективному обнаружению атак, таких как prompt-injection, когда вредоносные инструкции пытаются перехватить управление ответом модели.
Исследователи также продемонстрировали, что могут вручную изменять содержимое J-space, что напрямую влияет на ответы и поведение Claude. Это дает беспрецедентный уровень контроля и понимания.
Anthropic опубликовала исходный код реализации J-lens и выложила демо-версию на Neuronpedia, приглашая научное сообщество проверить результаты на практике. Это продолжение серии работ компании: в октябре 2025 года они опубликовали доклад о формирующейся интроспективной осознанности, а в апреле запустили инициативы по изучению благополучия моделей.
Мнение эксперта: Обнаружение J-space — это не просто академический курьез. Это шаг к «прозрачному ИИ», когда мы сможем заглянуть в «черный ящик» нейросети и понять, почему она принимает те или иные решения. Для криптоиндустрии, где ИИ все чаще используется для анализа рынков и управления активами, это прямой путь к повышению доверия и безопасности. Возможность мониторить внутренние процессы модели — это новый стандарт безопасности, к которому мы должны стремиться.