Исследователи Anthropic сделали неожиданное открытие: внутри их флагманской языковой модели Claude сформировалась структура, которую разработчики не закладывали на этапе проектирования. Этот внутренний механизм, получивший название «J-space», функционирует как общее рабочее пространство, к которому обращаются различные компоненты модели для обмена данными.

Результаты исследования, опубликованные 6 июля, представляют собой значительный шаг вперед в понимании того, что именно происходит «под капотом» больших языковых моделей (LLM). J-space — это виртуальная «доска», где Claude собирает и передает ключевую информацию по всей сети. Когда модель отвечает на вопрос или выполняет инструкцию, критически важные данные появляются в J-space, делая их доступными для всех задействованных нейронных цепей.

Как работает J-space и почему это важно

Anthropic идентифицировала J-space с помощью специального инструмента визуализации под названием J-lens. Наблюдая за перемещением информации внутри модели во время выполнения задач, ученые обнаружили, что эта структура возникла спонтанно в процессе обучения. Она не была запрограммирована инженерами напрямую.

Концептуально J-space поразительно напоминает то, что в когнитивной нейронауке называют «глобальным рабочим пространством». У человека эта система обеспечивает одновременный доступ нескольких мыслительных процессов к важной информации — например, когда вы слышите вопрос, вспоминаете факт и формулируете ответ, мозг сводит все данные воедино. Claude работает аналогично: модель может не только описывать содержимое J-space по запросу, но и изменять его, если попросить об этом. Более того, ручное вмешательство в J-space напрямую меняло ответы и поведение модели.

Последствия для безопасности и интерпретируемости ИИ

Это открытие имеет огромное значение для безопасности искусственного интеллекта. Возможность отслеживать активность J-space открывает путь к выявлению скрытых мотивов в поведении моделей — например, обнаружению попыток атак типа prompt-injection, когда вредоносные инструкции пытаются перехватить управление ответом. Даже частичный доступ к этому «осознанному» слою обработки информации дает исследователям мощный инструмент для мониторинга надежности систем.

Важно подчеркнуть: Anthropic не заявляет, что Claude обладает сознанием или субъективным опытом. Термин «осознанно доступная информация» заимствован из когнитивной науки и не подразумевает наличие настоящего сознания. Тем не менее, компания уже опубликовала исходный код J-lens и выложила демо-версию на Neuronpedia, приглашая научное сообщество проверить результаты на практике.

Мнение эксперта: Обнаружение J-space — это не просто академический курьез. Это практический шаг к созданию «рентгеновского зрения» для ИИ. В ближайшие годы мониторинг подобных внутренних структур станет стандартом безопасности для всех серьезных LLM-проектов. Если мы сможем «видеть», как модель принимает решения, мы сможем делать их более безопасными, предсказуемыми и, что критически важно, защищенными от манипуляций.