Анализ последних данных о готовящейся модели Astra от OpenAI выявил потенциально тревожный тренд в области безопасности искусственного интеллекта. В центре дискуссии оказалась техника, известная как «рекуррентная глубина», которая, по моим данным, может существенно ограничить возможности внешнего мониторинга за процессом рассуждения нейросети.

Суть проблемы заключается в том, что Astra, в отличие от многих предшественников, демонстрирует исследователям лишь малую часть своих промежуточных умозаключений. Это достигается за счет того, что значительная часть вычислений происходит не в текстовой цепочке, а во внутренних состояниях модели. Для сообщества это критически важно, так как именно текстовые цепочки рассуждений служат основным инструментом для выявления признаков нежелательного поведения — от откровенной лжи до попыток обойти защитные протоколы.

Риски для безопасности и надзора

Ведущий научный сотрудник Redwood Research, Райан Гринблатт, в своем анализе назвал подобное архитектурное решение серьезным риском. Его главная обеспокоенность связана не столько с текущим состоянием Astra, сколько с потенциальной траекторией развития. Если OpenAI будет масштабировать «непрозрачное рассуждение», мы можем прийти к моделям, которые мыслят полностью в латентном пространстве, что сделает цепочки рассуждений бесполезными для надзора. Особенно это опасно, если ИИ намеренно пытается избежать обнаружения.

Показательным является недавний инцидент с участием агентов OpenAI и Hugging Face. Расследование тех событий во многом опиралось на восстановление последовательности действий через цепочки рассуждений. При новой архитектуре восстановить причинно-следственные связи было бы практически невозможно.

Официальная позиция OpenAI

В ответ на волну критики главный научный сотрудник OpenAI Якуб Пахоцки поспешил заверить общественность, что глубина вычислительного графа Astra находится в пределах двукратного значения от GPT-4. Он подчеркнул, что компания продолжает работу над сохранением мониторинга цепочек рассуждений, хотя и признал, что этот механизм остается «хрупким». Примечательно, что ранее OpenAI уже временно приостанавливала обучение новых систем из-за возросших киберрисков, а Astra получила критический уровень кибервозможностей, продемонстрировав способность находить неизвестные уязвимости без контроля человека.

Мой взгляд: публичное раскрытие информации со стороны OpenAI является недостаточным. Ситуация требует независимой технической экспертизы, чтобы оценить реальную степень снижения наблюдаемости. Без этого мы рискуем двигаться к созданию систем, чье поведение станет непредсказуемым и неконтролируемым, что противоречит базовым принципам безопасного развития ИИ.