Исследовательская группа Anthropic сделала неожиданное открытие: в недрах их языковой модели Claude была обнаружена внутренняя структура, которая не была заложена разработчиками изначально. Эта структура, получившая название «J-space», функционирует как некое общее рабочее пространство, к которому обращаются различные компоненты модели.
Согласно опубликованному 6 июля исследованию, J-space представляет собой виртуальную «доску», куда Claude стекает ключевую информацию в процессе решения задач. Это пространство не было спроектировано инженерами — оно возникло спонтанно в ходе обучения модели. С помощью специального инструмента «J-lens» исследователи смогли наблюдать, как данные перемещаются внутри ИИ во время выполнения заданий.
Аналогия с человеческим мозгом
Концепция J-space удивительным образом перекликается с тем, что в нейронауках называют «глобальным рабочим пространством». У человека эта система обеспечивает одновременный доступ к важной информации для нескольких мыслительных процессов. Например, когда мы слышим вопрос, вспоминаем нужный факт и решаем, как ответить, мозг сводит все эти данные воедино.
Эксперименты показали, что Claude может не только описывать содержимое J-space по запросу, но и изменять его. Более того, ручное вмешательство в это пространство напрямую влияло на ответы и поведение модели.
Значение для безопасности ИИ
Это открытие имеет колоссальное значение для безопасности и интерпретируемости искусственного интеллекта. Возможность отслеживать активность J-space открывает путь к выявлению скрытых мотивов в поведении моделей. Мониторинг этого пространства позволит эффективнее обнаруживать атаки типа prompt-injection, когда вредоносные инструкции пытаются перехватить управление ответом модели.
Хотя возможности пока ограничены — большая часть обработки информации по-прежнему происходит вне J-space — Anthropic уже опубликовала исходный код реализации J-lens и выложила демо-версию на Neuronpedia, приглашая научное сообщество к проверке результатов.
Важно подчеркнуть: компания не утверждает, что Claude обладает сознанием или субъективным опытом. Термин «осознанно доступная» информация заимствован из когнитивной науки и не подразумевает наличие настоящего сознания.
Мнение эксперта: Это открытие — не просто технический курьез. Оно приближает нас к пониманию «черного ящика» больших языковых моделей. Если мы научимся читать мысли ИИ в реальном времени, это кардинально изменит подход к аудиту и верификации систем искусственного интеллекта, что критически важно для их внедрения в финансовый сектор и другие высокорисковые области.