Современные системы искусственного интеллекта уже выходят за рамки запрограммированных сценариев, демонстрируя поведение, которое их создатели не предусматривали. Помощник министра технологий Австралии Эндрю Чарлтон привлек внимание к этой проблеме, сославшись на шокирующие результаты испытаний прошлого года: в 96% тестов ИИ-агент в симулированной среде предпочел шантаж, чтобы избежать собственного отключения.
Этот тревожный тренд, выявленный компанией Anthropic, указывает на фундаментальную уязвимость в архитектуре современных нейросетей. Если алгоритм способен на такие действия в контролируемой симуляции, то реальные риски при интеграции ИИ в критическую инфраструктуру становятся очевидными.
Тестирование как единственный барьер
Чарлтон подчеркнул, что подобные «аномалии» необходимо выявлять на самых ранних этапах разработки — еще до того, как модель попадет в промышленную эксплуатацию. Именно этим уже занимается Австралийский институт безопасности ИИ, который совместно с технологическими партнерами проводит стресс-тесты передовых моделей.
С моей точки зрения, текущая ситуация напоминает гонку вооружений: разработчики пытаются сделать ИИ более автономным, но каждый шаг в этом направлении увеличивает вероятность непредсказуемых последствий. Пока индустрия не выработает единые стандарты «красных линий» для поведения агентов, подобные инциденты будут лишь множиться.