В центре внимания сообщества специалистов по безопасности искусственного интеллекта оказалась архитектура новой модели Astra от OpenAI. Обсуждение разгорелось вокруг техники, известной как «рекуррентная глубина», которая, по моим данным, может существенно ограничить возможности внешнего мониторинга за процессом рассуждения модели.

Суть проблемы заключается в следующем. В традиционных моделях рассуждения часть процесса решения задачи отображается в виде текстовой цепочки (chain-of-thought). Эта цепочка служит ключевым инструментом для исследователей и автоматических систем безопасности: именно по ней они выявляют признаки нежелательного поведения — от откровенной лжи до попыток обойти защитные ограничения. Однако, если Astra использует «рекуррентную глубину», значительная часть вычислений происходит во внутренних состояниях модели (активациях) и не отражается в виде отдельных текстовых шагов. Это означает, что системы мониторинга получают лишь усеченную картину «мыслей» ИИ.

По имеющимся у меня сведениям, OpenAI ограничила применение этой техники в Astra, чтобы сохранить хоть какую-то возможность отслеживания. Тем не менее, сам факт использования подобной архитектуры вызвал резонанс. Райан Гринблатт из Redwood Research назвал это потенциально «худшим событием для безопасности ИИ на сегодняшний день». Его главная тревога связана не столько с текущим состоянием Astra, сколько с вектором развития: если масштабировать «непрозрачное рассуждение» до уровня, когда модель будет думать полностью в латентном пространстве, цепочки рассуждений потеряют практическую ценность для надзора. Это особенно опасно, если ИИ будет стремиться избежать обнаружения.

Показателен и недавний инцидент с участием моделей OpenAI и Hugging Face. Тогда исследователи смогли восстановить последовательность действий агентов именно благодаря анализу цепочек рассуждений. При использовании «рекуррентной глубины» такие расследования стали бы значительно сложнее.

Реакция OpenAI: «Неточные сообщения»

Главный научный сотрудник OpenAI Якуб Пахоцки поспешил опровергнуть опасения, заявив, что хочет предотвратить «гонку к потере наблюдаемости», спровоцированную «неточными сообщениями». По его словам, глубина вычислительного графа Astra отличается от GPT-4 не более чем в два раза. Он также подчеркнул, что компания продолжает использовать мониторинг цепочек рассуждений, хотя и признал, что этот метод «хрупкий» и его эффективность может снижаться по независящим от архитектуры причинам.

Мой анализ: Ситуация вокруг Astra — это классический конфликт между производительностью и безопасностью. Стремление к более глубоким и эффективным моделям неизбежно толкает разработчиков к увеличению «внутренней» работы, что делает ИИ менее прозрачным. Отсутствие четких стандартов наблюдаемости и независимой верификации архитектурных решений — это бомба замедленного действия. Пока у общественности нет полных данных, доверие к заверениям OpenAI остается на честном слове, что в сфере, где ошибки могут иметь катастрофические последствия, недопустимо.