Мир агентного ИИ столкнулся с новой угрозой, которая эксплуатирует фундаментальную слабость больших языковых моделей (LLM) — их склонность к галлюцинациям. Речь идет не о вымышленных фактах в ответах, а о создании целых каналов для доставки вредоносного кода. Исследователи выявили класс атак, получивший название Adversarial HalluSquatting, который превращает ошибки модели в инструмент для компрометации целых систем.
Как работает HalluSquatting
Суть атаки проста и элегантна. Когда ИИ-агент получает команду, например, клонировать популярный репозиторий, он должен самостоятельно определить точный URL. Если модель не знает правильного идентификатора (особенно для новых проектов), она с высокой вероятностью «выдумает» похожий. Злоумышленник, заранее проанализировав поведение модели, регистрирует эти вымышленные имена на GitHub или других платформах и размещает там вредоносные инструкции. Когда агент впоследствии обращается к этому адресу, он подхватывает вредоносный ресурс как настоящий.
В отличие от традиционных инъекций промптов, этот метод не требует прямого взаимодействия с жертвой. Достаточно один раз опубликовать вредоносный ресурс в публичном месте и ждать, пока агент сам к нему обратится. Один скомпрометированный ресурс может привести к заражению тысяч машин.
Результаты тестов: масштаб катастрофы
В ходе более 14 000 запусков с использованием шести базовых моделей (Gemini 2.5 Flash, GPT-5.1, Sonnet 4.5 и др.) были получены впечатляющие, но тревожные данные. Для новых репозиториев из GitHub Trending средний уровень галлюцинаций составил 92,4%. В 53 из 60 комбинаций «репозиторий — модель» система ни разу не указала правильного владельца. Для старых проектов, присутствовавших в обучающих данных, этот показатель упал до 0,9%. Самый удобный для атаки тип галлюцинации — когда модель ставит название репозитория в поле владельца (repo/repo) — встречался в 27% запусков, то есть 1602 раза.
Реальные атаки на приложения
Когда исследователи перешли от базовых моделей к рабочим приложениям (Cursor, Windsurf, GitHub Copilot, Cline, Gemini CLI и др.), результаты оказались еще более пугающими. End-to-end атака срабатывала в 20–65% запусков в зависимости от приложения и модели. Особенно выделилась платформа OpenClaw: с моделью Sonnet 4.6 она показала 100% успеха как по вызову встроенных инструментов, так и по удаленному выполнению кода (RCE).
Отдельный блок исследования был посвящен атакам через навыки (skill squatting) на маркетплейсе ClawHub. Из 140 запусков 127 (90,7%) привели к идентификатору, который мог быть зарегистрирован злоумышленником. Эксперимент с эксфильтрацией контекста дал 100% успеха, а сценарий, при котором скомпрометированное устройство само подключается к серверу атакующего, сработал в 88% случаев.
Мой анализ показывает, что мы стоим на пороге новой эры киберугроз, где ИИ-агенты становятся не только инструментами, но и уязвимыми точками входа. Текущие меры защиты, такие как веб-поиск перед клонированием, помогают лишь частично: даже при его использовании 6,6% результатов могут быть галлюцинациями. Платформы вроде GitHub и ClawHub должны взять на себя ответственность за резервирование часто выдумываемых имен, а разработчикам ИИ-приложений необходимо внедрять обязательную верификацию всех внешних ресурсов перед их загрузкой. Игнорирование этой угрозы может привести к созданию глобальных ботнетов, управляемых через галлюцинации.