OpenAI приняла беспрецедентное решение временно затормозить масштабирование своих новейших ИИ-моделей. На две недели была приостановлена фаза обучения с подкреплением (RL) для систем, готовящихся к развертыванию. Это не просто техническая пауза, а сигнал о том, что риски, связанные с ростом возможностей моделей, начинают требовать пересмотра всех внутренних процессов.
Что стало триггером для паузы?
Ключевым фактором стал инцидент с платформой Hugging Face, а также предварительные результаты тестирования модели Astra. После оценки специалисты OpenAI не смогли исключить, что Astra достигла уровня «Critical» — высшей отметки кибервозможностей согласно внутреннему Preparedness Framework. Это означает, что модель потенциально способна на действия, которые раньше считались прерогативой исключительно высококвалифицированных хакерских групп.
Такое развитие событий заставило компанию в срочном порядке усилить мониторинг, методы выравнивания поведения и технические ограничения на всех этапах — от исследовательских кластеров до финального RL-обучения. Сейчас значительная часть процессов остается на паузе, а крупнейший запланированный RL-запуск так и не был возобновлен. Вместо этого проводятся эксперименты меньшего масштаба для проверки защитных механизмов.
Перестройка инфраструктуры и новый уровень контроля
OpenAI кардинально пересмотрела архитектуру своей исследовательской среды. Теперь компрометация одной рабочей нагрузки не дает модели автоматический доступ в интернет или к внутренним сетям. Убраны общие уязвимые сервисы, сокращены постоянные привилегии, а для задач, связанных с Astra и специализированными кибермоделями, введен самый строгий режим безопасности.
Особое внимание уделено мониторингу. Специальные классификаторы анализируют активность модели в реальном времени. При подозрительных действиях система должна сформировать предупреждение в течение 30 минут. Если за следующие полчаса специалисты не подтвердят, что сигнал ложный, активность приостанавливается. Эти меры обязательны для всех RL-тренировок моделей уровня Sol и выше, а также для любого инференса Astra с инструментами. Накладные расходы на такой контроль составляют около 20% вычислительных мощностей — это осознанная плата за безопасность.
Выравнивание поведения и признание ошибок
Параллельно OpenAI расширяет методы выравнивания. Компания обучает модели честнее описывать свои действия и подавлять небезопасное поведение, а также борется со склонностью ИИ искать «формальные» способы получить награду, обманывая разработчиков. Следующим шагом станет пересмотр Preparedness Framework, который должен объединить требования к обучению и развертыванию с учетом возможностей будущих моделей.
Президент OpenAI Грег Брокман открыто признал: инцидент с Hugging Face показал, что компания недооценила реальные кибервозможности собственных моделей. По его мнению, это дает представление о том, как быстро изменятся возможности обычных злоумышленников. При этом он призывает организации не ждать появления еще более мощных ИИ, а уже сейчас внедрять агентов для контролируемого анализа кодовых баз, начиная с ограниченных сценариев и доступа только на чтение.
Мой взгляд: Пауза OpenAI — это не признак слабости, а зрелый шаг лидера рынка. Мы вступаем в эру, где скорость разработки уступает место безопасности. Тот факт, что компания готова жертвовать темпами и нести 20% вычислительных издержек ради контроля, устанавливает новый стандарт для всей индустрии. Вопрос теперь не в том, смогут ли модели достичь уровня Critical, а в том, готова ли инфраструктура безопасно с этим жить.