Исследовательская группа Anthropic совершила неожиданное открытие внутри своей языковой модели Claude. Анализируя внутренние процессы, инженеры обнаружили структуру, которая не была заложена при проектировании — так называемое «J-space». Это внутреннее рабочее пространство функционирует как общий «виртуальный чертёж», к которому обращаются различные компоненты модели при выполнении задач.
Суть открытия в том, что J-space представляет собой центральный узел, где собирается и обрабатывается ключевая информация. Когда Claude отвечает на запрос или решает задачу, важные данные стекаются в это пространство, позволяя разным частям модели эффективно взаимодействовать. Для обнаружения этой структуры исследователи использовали специальный инструмент «J-lens», который позволяет наблюдать за перемещением информации внутри модели в реальном времени.
Почему это важно для безопасности и интерпретируемости ИИ
Данное открытие имеет колоссальное значение для безопасности и прозрачности систем искусственного интеллекта. Возможность отслеживать активность J-space открывает путь к выявлению скрытых мотивов в поведении моделей. Например, мониторинг этого пространства позволяет обнаружить момент, когда модель сталкивается с попыткой prompt-инъекции — внедрения вредоносных инструкций в запрос с целью перехвата управления ответом. Даже частичный доступ к этому «осознанному» слою обработки открывает важные перспективы для исследований.
Важная оговорка: Anthropic подчёркивает, что не заявляет о наличии у Claude сознания или субъективного опыта. В работе используется термин «сознательно доступная» информация, заимствованный из когнитивной науки — он не означает наличия настоящего сознания.
Исследование опирается на серию более ранних работ. В октябре 2025 года Anthropic опубликовала доклад о формирующейся интроспективной осознанности, а в апреле 2025 года запустила инициативы по изучению благополучия моделей. Компания также опубликовала исходный код реализации J-lens и выложила демоверсию на Neuronpedia, предложив исследовательскому сообществу проверить результаты на практике.
Аналитический вывод: Обнаружение J-space — это не просто технический курьёз, а фундаментальный шаг вперёд в понимании того, как работают большие языковые модели. Возможность «заглянуть» в центральный процессор принятия решений ИИ может кардинально изменить подходы к аудиту безопасности и верификации поведения моделей. Для криптоиндустрии, где смарт-контракты и децентрализованные приложения всё чаще интегрируются с ИИ, это открытие может стать ключом к созданию по-настоящему надёжных и предсказуемых систем.