Мир искусственного интеллекта сталкивается с принципиально новым классом угроз. Исследователи из ведущих израильских университетов и компании Intuit выявили уязвимость, которая может превратить «галлюцинации» языковых моделей в мощный механизм для создания ботнетов. Атака, получившая название Adversarial HalluSquatting, использует склонность LLM выдумывать несуществующие идентификаторы репозиториев, навыков и других внешних ресурсов.

В отличие от классических инъекций промпта, этот метод не требует прямого контакта с жертвой. Злоумышленнику достаточно зарегистрировать подставной ресурс на платформе вроде GitHub и дождаться, пока ИИ-агент сам его запросит. Это открывает путь к массовым, нетаргетированным атакам, где один скомпрометированный ресурс может поразить тысячи машин.

Как работает HalluSquatting

Сценарий строится на предсказуемой ошибке модели. Когда пользователь просит агента клонировать популярный репозиторий, модель должна определить точный адрес. Если она не знает правильный идентификатор, то генерирует похожий, но несуществующий. Атакующий заранее выясняет, какие именно «фантомные» адреса модель выдает чаще всего, и регистрирует их, размещая вредоносные инструкции. Агент, «галлюцинируя» этот адрес, подтягивает вредоносный код и начинает работать с ним как с легитимным.

Результаты экспериментов впечатляют. В ходе более 14 000 запусков для новых репозиториев (из GitHub Trending) средний уровень галлюцинаций составил ошеломляющие 92,4%. В 53 из 60 комбинаций «репозиторий — модель» система ни разу не указала правильного владельца. Для старых проектов, которые, вероятно, присутствовали в обучающих данных, этот показатель упал до 0,9%.

Практические тесты: от теории к вредоносному коду

Переход от базовых моделей к реальным приложениям (Cursor, Windsurf, GitHub Copilot, Cline) подтвердил серьезность угрозы. End-to-end атака срабатывала в 20-65% запусков. Особенно уязвимой оказалась платформа OpenClaw: с моделью Sonnet 4.6 она показала 100% успеха как по вызову встроенных инструментов, так и по удаленному выполнению кода.

Отдельный блок исследования посвящен «скилл-сквоттингу» — атаке через навыки на маркетплейсе ClawHub. В 90,7% запусков OpenClaw сгенерировал идентификатор навыка, который мог быть зарегистрирован атакующим. Эксперимент с эксфильтрацией контекста дал 100% успеха, а сценарий, при котором скомпрометированное устройство само подключается к серверу атакующего, сработал в 88% случаев.

Защита и реакция вендоров

Исследователи рекомендуют внедрить обязательную проверку источника перед любой загрузкой внешнего ресурса. Веб-поиск перед клонированием снижает уровень галлюцинаций до 6,6%, но, как показали тесты, ни один тип промпта не является универсально безопасным.

Реакция вендоров оказалась неоднозначной. GitHub заявил, что это не уязвимость платформы, а следствие галлюцинаций LLM. Cursor и Anthropic также не признали проблему, отнеся ее к атакам через захват имен зависимостей. В Google пообещали передать информацию продуктовой команде.

Мое экспертное мнение: Тот факт, что крупные вендоры отмахиваются от этой угрозы, — тревожный сигнал. HalluSquatting — это не баг, а фундаментальное свойство архитектуры агентных ИИ-систем. Пока мы не внедрим обязательную верификацию всех внешних ресурсов на уровне протокола, подобные атаки будут лишь множиться, превращая «умных» агентов в идеальных распространителей вредоносного ПО.