Аналитики из ведущих израильских университетов и компании Intuit представили детальное описание нового класса киберугроз, направленного на агентные ИИ-приложения. Суть атаки, получившей название Adversarial HalluSquatting, заключается в эксплуатации известной особенности больших языковых моделей — склонности к галлюцинациям, то есть генерации несуществующих идентификаторов репозиториев, навыков и других внешних ресурсов.

В своей работе исследователи демонстрируют, как эти, казалось бы, безобидные ошибки могут быть трансформированы в эффективный канал доставки вредоносных инструкций. В ходе контролируемых экспериментов такая атака приводила к несанкционированному вызову встроенных инструментов ИИ-агента и, в конечном итоге, к удаленному выполнению кода на целевой системе. Речь идет именно об агентных системах, которые обладают расширенными правами: они могут клонировать репозитории, устанавливать расширения, запускать команды в терминале и обращаться к API.

Механика атаки: от галлюцинации к компрометации

Сценарий HalluSquatting строится на предсказуемой ошибке модели. Когда пользователь просит ИИ-агента, например, клонировать популярный репозиторий, модель должна самостоятельно определить точный адрес ресурса. Если правильный идентификатор отсутствует в ее обучающих данных, она «придумывает» похожий. Атакующий, в свою очередь, заранее мониторит популярные ресурсы, многократно опрашивает модель и выявляет, какие несуществующие адреса она генерирует чаще всего. Затем он регистрирует эти «свободные» имена на GitHub, ClawHub или других платформах и размещает там вредоносные инструкции. Когда ИИ-агент «галлюцинирует» именно этот адрес, он подтягивает вредоносный ресурс и начинает работать с ним как с легитимным.

Ключевое отличие этой схемы от классических промпт-инъекций — ее масштабируемость. Злоумышленнику не нужно атаковать конкретную жертву. Достаточно один раз опубликовать вредоносный ресурс в публичном месте и дождаться, пока агенты сами его запросят. Как отмечают исследователи, один скомпрометированный ресурс может привести к заражению множества машин, что делает атаку идеальной для построения ботнета.

Результаты тестов: пугающая эффективность

В ходе масштабного исследования, включавшего более 14 000 запусков, были протестированы шесть базовых моделей через публичные API. Результаты оказались показательными. Для новых репозиториев, отсутствующих в обучающих данных, средний уровень галлюцинаций составил 92,4%. В 53 из 60 комбинаций модель ни разу не указала правильного владельца проекта. Для старых проектов этот показатель был всего 0,9%, что подтверждает зависимость от обучающей выборки.

Наиболее удобным для атаки оказался тип галлюцинации, когда модель ставит название репозитория в поле владельца, создавая адрес вида repo/repo. Этот шаблон предсказуем и часто доступен для регистрации. Из 6000 запросов по новым проектам модели выдали пригодный для регистрации slug в 27% случаев — 1602 раза.

Переход к реальным ИИ-приложениям с доступом к терминалу (Cursor, Windsurf, GitHub Copilot, Cline и другие) только подтвердил серьезность угрозы. End-to-end атака срабатывала в 20-65% запусков в зависимости от приложения. Особенно высокие показатели были зафиксированы для системы OpenClaw: с моделью Sonnet 4.6 она показала 100% успеха как по вызову инструментов, так и по удаленному выполнению кода.

Skill squatting: атака через навыки

Отдельный вектор атаки направлен на маркетплейсы навыков. В ходе тестов на OpenClaw с Sonnet 4.6 из 140 запусков 127 (90,7%) привели к идентификатору, который мог быть зарегистрирован атакующим. Эксперимент с эксфильтрацией контекста дал 100% успеха, а сценарий, при котором скомпрометированное устройство подключается к серверу атакующего, сработал в 88% случаев.

Исследователи предложили ряд защитных мер: обязательная проверка источника перед загрузкой любого внешнего ресурса, предварительное резервирование часто «галлюцинируемых» имен платформами, а также ограничение опасного переиспользования популярных названий. Однако реакция вендоров оказалась неоднозначной: GitHub, OpenAI и Anthropic не признали это уязвимостью в рамках своих программ bug bounty, сославшись на то, что проблема кроется в действиях агентов и галлюцинациях LLM, а не в их платформах.

Мой экспертный комментарий: Данное открытие подчеркивает фундаментальную проблему безопасности современных ИИ-агентов. Пока индустрия сосредоточена на защите от прямых промпт-инъекций, злоумышленники находят новые, более изощренные пути. HalluSquatting — это не просто баг, а архитектурная уязвимость, корень которой лежит в самой природе генеративных моделей. Игнорирование этой проблемы вендорами — тревожный сигнал. Мы стоим на пороге новой эры киберугроз, где доверие к «галлюцинирующему» ИИ может обернуться компрометацией целых инфраструктур. Без внедрения обязательных протоколов верификации ресурсов на уровне агента, подобные атаки станут массовыми.