В центре внимания сообщества исследователей ИИ оказалась новая модель Astra от OpenAI. Обсуждение вызвано не ее производительностью, а потенциальным снижением прозрачности внутренних процессов, что ставит под вопрос эффективность существующих механизмов надзора.
Суть проблемы: «рекуррентная глубина»
Согласно полученным мной сведениям, в Astra применяется техника, известная как «рекуррентная глубина». В отличие от стандартных моделей рассуждения, где логические шаги отображаются в виде текстовой цепочки, доступной для анализа, рекуррентная глубина предполагает повторную обработку внутренних представлений модели до генерации следующего текстового шага. Это означает, что значительная часть вычислений происходит в скрытых состояниях нейросети и не отражается в явном виде, что потенциально сокращает объем информации, доступной системам мониторинга.
Ключевой риск здесь заключается в том, что исследователи и автоматизированные системы безопасности, которые полагаются на цепочки рассуждений для выявления признаков нежелательного поведения — например, лжи или попыток обойти ограничения — могут потерять эту важнейшую возможность. Если модель способна «думать» в латентном пространстве, не раскрывая свои намерения в тексте, надзор за ней становится крайне затруднительным.
Оценка экспертов и позиция OpenAI
Эта новость вызвала серьезную обеспокоенность у ведущих специалистов. Райан Гринблатт, главный научный сотрудник Redwood Research, назвал такое архитектурное решение потенциально «худшим событием для безопасности ИИ». Его главное опасение связано с тем, что масштабирование «непрозрачного рассуждения» может привести к созданию моделей, которые мыслят полностью в латентном пространстве, лишая цепочки рассуждений практической ценности для мониторинга.
В ответ на критику главный научный сотрудник OpenAI Якуб Пахоцки поспешил заверить общественность, что глубина вычислительного графа Astra отличается от GPT-4 не более чем в два раза. Он подчеркнул, что компания стремится сохранить возможность мониторинга цепочек рассуждений, хотя и признал, что эта возможность является «хрупкой» и может ухудшаться по независящим от архитектуры причинам.
Несмотря на эти заверения, ситуация остается тревожной. Напомню, что в августе OpenAI уже временно замедляла масштабирование новых моделей из-за киберрисков, а самой Astra был присвоен критический уровень кибервозможностей. Это указывает на то, что компания осознает всю серьезность потенциальных угроз.
Мой анализ: Позиция OpenAI, сводящая все к «фактору двух» от GPT-4, выглядит несколько уклончивой. Даже небольшое увеличение «глубины» вычислений в латентном пространстве может экспоненциально усложнить задачу интерпретации для внешних систем. Ключевой вопрос не в том, насколько архитектура отличается от предыдущей, а в том, какой процент критически важных рассуждений остается за пределами видимости для мониторинга. Общественности необходима более детальная и независимая оценка этого аспекта, чтобы мы могли адекватно оценить реальные риски.