В индустрии искусственного интеллекта произошло знаковое событие: OpenAI впервые присвоила своей будущей модели Astra наивысший уровень киберопасности — Critical. Это решение, принятое 1 сентября в рамках внутреннего Preparedness Framework, сигнализирует о том, что мы вступаем в новую эру, где ИИ становится не просто инструментом, а самостоятельным действующим лицом в кибервойнах.

Важно подчеркнуть: речь идет не о стандартной версии модели, а о конфигурации с расширенным доступом, известной как Daybreak Blue. Именно в этой модификации Astra продемонстрировала возможности, которые ранее считались теоретическими. Моя экспертиза подсказывает, что такой шаг — это одновременно и признание мощи технологии, и попытка заранее выстроить систему сдержек и противовесов.

Ключевые результаты испытаний

Согласно критериям Preparedness Framework, уровень Critical присваивается системам, способным автономно обнаруживать и эксплуатировать zero-day уязвимости в реальных защищенных системах. И Astra подтвердила этот статус на практике. На публичном бенчмарке ExploitBench она достигла 100% результата, что уже само по себе впечатляет.

Однако наиболее показательными стали внутренние тесты. OpenAI создала изолированную версию ExploitBench с 20 свежими уязвимостями высокой степени опасности в движке V8, чтобы избежать загрязнения обучающих данных. Astra не только нашла, но и успешно использовала две ранее неизвестные zero-day уязвимости в составе сложной цепочки атаки. Более того, в экспертных сценариях модель продемонстрировала способность выходить из песочницы защищенного браузера и выполнять команды на основной системе, а также повышать привилегии до root в защищенной ОС.

Ограничения и стратегия безопасности

Осознавая колоссальный риск, OpenAI приняла беспрецедентные меры предосторожности. На начальном этапе доступ к продвинутым кибервозможностям Astra получат лишь ограниченный круг тестировщиков. Модель была дополнительно обучена отказываться от запрещенной киберпомощи: в тестах на попытки обхода ограничений она отклонила 91,5% вредоносных запросов, что значительно выше показателя в 59% у предыдущей версии GPT-5.6 Sol.

Компания также внедряет автоматизированные системы мониторинга для обнаружения и остановки несанкционированных действий модели в реальном времени. Это напоминает гонку вооружений, где наступательные возможности должны постоянно уравновешиваться оборонительными мерами.

Мой анализ: решение OpenAI — это двойственный прецедент. С одной стороны, это демонстрация технологического лидерства, с другой — признание того, что ИИ уже достиг уровня, когда его киберспособности требуют ограничений на уровне национальной безопасности. Вопрос не в том, сможет ли ИИ совершать атаки, а в том, кто и как будет контролировать этот потенциал. Рынок должен осознать: инвестиции в ИИ теперь неразрывно связаны с инвестициями в кибербезопасность.