Команда Protocol Security из состава Ethereum Foundation (EF) провела масштабный эксперимент: они развернули скоординированных ИИ-агентов против критических компонентов блокчейн-инфраструктуры. Под прицел попали системное ПО, криптографический код и смарт-контракты. Результаты оказались неожиданными даже для самих разработчиков.

Главный вывод, который сделали в EF, касается не столько количества найденных ошибок, сколько процесса их обработки. Как отметили в команде, ИИ действительно находит баги — это не стало сюрпризом. Удивило другое: насколько мало усилий потребовалось для их обнаружения и насколько много — для отделения реальных уязвимостей от ложных срабатываний.

Важно подчеркнуть: искусственный интеллект не заменил человека в процессе аудита безопасности. Он лишь сместил узкое место. Раньше исследователи тратили основное время на поиск гипотез, теперь же — на проверку огромного массива сгенерированных кандидатов. Триаж, а не генерация, стал новым узким горлышком.

Архитектура системы: роевой интеллект вместо монолита

Protocol Security отказалась от классической схемы с одним большим ИИ-агентом, управляющим всем процессом. Вместо этого была развернута сеть специализированных систем, работающих параллельно против одного репозитория. Одни агенты отвечали за первичную разведку кода, другие — за поиск потенциальных уязвимостей, заполнение пробелов и валидацию. Координация осуществлялась через общий репозиторий и систему контроля версий.

Как пояснили в EF, время, которое раньше уходило на формирование и проверку гипотез, теперь перераспределено на их массовую оценку: построение оракула, триаж, ведение списка известных проблем и раскрытие. Агенты отлично справляются с быстрым сканированием больших участков кода, трассировкой путей выполнения и подготовкой материалов для proof-of-concept. Но каждый кандидат все равно требует независимого воспроизведения на реальном коде, прежде чем его можно квалифицировать как уязвимость.

Конкретные находки и ограничения метода

Публично раскрытый пример — уязвимость CVE-2026-34219 в Rust-реализации libp2p gossipsub. Она связана с обработкой backoff expiry — периода, в течение которого узел временно ограничивает взаимодействие с пиром. Ошибка позволяла удаленно вызвать аварийное завершение процесса при обработке специально сформированного PRUNE-сообщения с почти максимальным значением backoff. Причина — непроверенная арифметика при сложении Instant + Duration, что приводило к переполнению.

Однако общее число реальных багов, обнаруженных агентами, в EF не раскрыли. В блоге упоминается о нескольких находках, но публично назван только один пример. Большинство сгенерированных кандидатов оказались ложноположительными, дублями или проблемами вне рамок проверки. В EF назвали это нормальной частью метода, а не провалом системы. Цель — быстро отбрасывать неверные кандидаты и подкреплять реальные доказательством, с которым трудно спорить.

Примечательно, что ИИ-агенты хуже справляются с уязвимостями, которые проявляются только через длинную цепочку корректных действий. Такая логика требует не только найти подозрительный фрагмент кода, но и доказать, что вся последовательность состояний действительно достижима. Это классическая проблема комбинаторного взрыва, с которой сталкиваются все автоматизированные анализаторы.

Мое профессиональное мнение: Эксперимент EF — важный шаг в эволюции безопасности блокчейнов, но он наглядно демонстрирует, что ИИ сегодня — это мощный инструмент для генерации гипотез, а не для их верификации. Пока человеческий фактор остается критическим звеном в триаже, полная автоматизация аудита безопасности — дело отдаленного будущего. Инвестиции в инструменты для быстрой валидации кандидатов станут следующим логичным этапом развития этой технологии.