В центре внимания сообщества исследователей безопасности ИИ оказалась архитектура новой модели Astra от OpenAI. Обсуждение касается не столько ее производительности, сколько фундаментального вопроса: насколько мы вообще способны контролировать процесс рассуждения таких систем?
Суть потенциальной проблемы заключается в применении техники, известной как «рекуррентная глубина». Вместо того чтобы полностью выстраивать логическую цепочку в виде текста, модель может выполнять значительную часть вычислений во внутренних состояниях, которые не отображаются в явном виде. Это создает своего рода «непрозрачное рассуждение», что напрямую влияет на методы мониторинга, используемые для выявления потенциально опасного поведения, такого как обход защитных ограничений или ложь.
Ключевая проблема для безопасности
Ведущие эксперты в области безопасности ИИ выражают обеспокоенность по этому поводу. Райан Гринблатт из Redwood Research назвал возможную архитектуру Astra одним из наиболее серьезных рисков для контроля над ИИ. Его опасение связано не столько с текущим состоянием модели, сколько с вектором развития.
Главный риск, по его мнению, заключается в том, что масштабирование подобного подхода может привести к созданию систем, которые рассуждают полностью в латентном пространстве. Это практически лишит исследователей и автоматизированные системы надзора возможности интерпретировать действия модели и своевременно вмешиваться. Особенно тревожно это выглядит на фоне недавних инцидентов, когда для анализа действий ИИ-агентов следователи полагались именно на текстовые цепочки рассуждений.
Показательно, что в ответ на критику главный научный сотрудник OpenAI, Якуб Пахоцки, поспешил заверить общественность. Он заявил, что глубина вычислительного графа Astra не превышает аналогичный показатель GPT-4 более чем в два раза, а также подчеркнул, что компания всегда стремилась сохранять возможность мониторинга. Однако он также признал, что сама возможность такого контроля является «хрупкой» и может ухудшаться.
Эта ситуация обнажает ключевой парадокс развития ИИ: стремление к созданию все более мощных и автономных систем неизбежно сталкивается с проблемой их контролируемости. OpenAI уже присвоила Astra критический уровень кибервозможностей, что подразумевает способность модели к самостоятельному поиску уязвимостей. Вопрос о том, насколько мы можем доверять «черному ящику» с такими способностями, становится не просто техническим, а экзистенциальным.
Мое профессиональное мнение: публичная дискуссия вокруг Astra — это важный сигнал. Мы стоим на пороге, когда возможности моделей начинают опережать наши инструменты для их понимания. Требование независимой оценки и раскрытия технических деталей архитектуры — это не праздное любопытство, а необходимая мера для обеспечения безопасности на следующем этапе развития ИИ.