Команда исследователей Anthropic сделала неожиданное открытие внутри своих моделей Claude. В ходе анализа внутренних процессов они наткнулись на структуру, которая не была заложена разработчиками при проектировании. Речь идёт о механизме под названием «J-space» — глобальном рабочем пространстве, к которому обращаются разные компоненты модели.

Исследование, опубликованное 6 июля, стало заметным шагом вперёд в понимании того, что на самом деле происходит «под капотом» больших языковых моделей. J-space работает как виртуальная доска: когда Claude отвечает на вопрос, решает задачу или выполняет инструкцию, ключевая информация появляется в этом пространстве, чтобы разные части модели могли с ней взаимодействовать.

Как работает J-space?

Для обнаружения J-space специалисты Anthropic разработали специальный инструмент под названием «J-lens». С его помощью они наблюдали, как информация перемещается внутри модели во время выполнения задания. Самое примечательное: J-space возник спонтанно в процессе обучения — его не закладывали в архитектуру напрямую.

Идея напоминает концепцию «глобального рабочего пространства» из нейронаук. У человека эта система обеспечивает доступ к важной информации сразу для нескольких мыслительных процессов. Например, когда человек слышит вопрос, вспоминает нужный факт и решает, как ответить, мозг сводит все необходимые данные в одном месте.

Claude работает похоже. Исследователи показали, что модель может описывать содержимое J-space по запросу, а также изменять его, если об этом попросить. Более того, когда учёные вручную меняли J-space, менялись и ответы Claude, и его поведение при выполнении заданий.

Почему это важно для безопасности ИИ

Открытие имеет огромное значение для безопасности искусственного интеллекта. Если учёные смогут отслеживать активность J-space, у них появится шанс выявлять скрытые мотивы в поведении ИИ-моделей. За счёт этого можно будет эффективнее отмечать, когда система начинает работать ненадёжно.

В том числе — выявление атак. Мониторинг J-space позволяет увидеть момент, когда модель сталкивается с попытками prompt-инъекции (внедрение вредоносных инструкций в запрос, чтобы перехватить управление ответом). Даже частичный доступ к такому «осознанному» слою обработки открывает важные перспективы для исследований.

Пока возможности ограничены: большая часть обработки информации у Claude по-прежнему идёт вне J-space. Тем не менее Anthropic открыла исходный код реализации J-lens и выложила демоверсию на Neuronpedia, предложив исследовательскому сообществу проверить результаты на практике.

Исследование опирается на серию более ранних работ. В октябре 2025 года Anthropic опубликовала доклад о формирующейся интроспективной осознанности. Ранее, в апреле 2025 года, компания запустила инициативы по изучению благополучия моделей, шаг за шагом продвигаясь в понимании того, что происходит внутри её систем.

Мой комментарий: Это открытие может стать поворотным моментом для всей индустрии ИИ. Способность заглядывать в «рабочее пространство» модели — это не просто научный интерес, а реальный инструмент для повышения безопасности и контроля. Если мы сможем видеть, как модель принимает решения, мы сможем лучше защищать её от взломов и манипуляций. Для криптоиндустрии, где ИИ уже используется для анализа рынков и управления активами, это особенно актуально.