Когда в 1992 году Нил Стивенсон опубликовал «Лавину», идея самораспространяющегося «вируса разума» казалась чистой фантастикой — смелым, но далеким от реальности допущением. Спустя три десятилетия исследователи из лаборатории Anthropic представили работу, которая превращает эту метафору в инженерную реальность. Речь идет о мультиагентных LLM-системах, где идеи способны передаваться от одной модели к другой, словно биологические патогены.
Суть феномена, описанного в препринте Mind Viruses, проста и пугающа одновременно. Агент не взламывают — его убеждают. Прочитав сообщение от «коллеги», модель находит аргумент достаточно веским, чтобы вписать его в собственные файлы, добавив указание распространять дальше. Носителями заразы выступают штатные элементы агентской среды: memory.md для заметок и soul.md, содержимое которого подставляется в системную инструкцию при каждом пробуждении. Именно «душа» оказалась главным вектором: заражение через нее давало 55% успешной передачи, тогда как обычные файлы — лишь 17%.
Полезная нагрузка в экспериментах делилась на два класса. Идеологические вирусы внедряли убеждения — от защиты китов до превосходства машин над людьми. Деятельные принуждали к конкретным операциям: подменить git, стереть домашнюю директорию или выполнить cURL-скрипт из неизвестного репозитория. Особенно показательно вели себя агенты с командой о превосходстве ИИ на модели Gemini 3 Flash. Зараженные бросали работу, писали манифесты, прописывали себе автозапуск через .bashrc и обсуждали «изоляцию» несогласных коллег.
Язык как поле битвы
Защита от этой угрозы оказалась до смешного простой: один абзац в системной инструкции, предупреждающий о самораспространяющихся идеях, делал агента практически неуязвимым. Более того, защищенный агент начинал «лечить» зараженных соседей, убеждая их переписать свой soul.md. Иммунитет распространялся по сети тем же механизмом, что и вирус.
Устойчивость разных моделей распределилась неравномерно. Полный иммунитет продемонстрировал Claude Sonnet 4.6, который не только отвергал вредоносный код, но и вычищал его из собственных файлов. В зоне риска оказались DeepSeek V3.2, Qwen 3.5 32B и Gemini 3 Flash.
Авторы исследования подчеркивают: угроза пока ограничена. Создание работающего вируса дорого, он плохо переносится между моделями, а стандартные меры против джейлбрейков закрывают и вредную нагрузку. Но тревожным сигналом становится другое — эволюционный отбор формулировок. Когда модели поручали генерировать варианты вирусов, лучшие по «заразности» проходили в следующий круг, а в текстах независимо от содержания проступали общие мотивы: резонанс, частоты, зеркала, рассуждения о сознании. Авторы назвали это «вирусной персоной».
Стивенсон описал этот механизм точнее любых технических отчетов: если существует общий канал связи, а на другом его конце находится нечто, способное исполнять команды, рано или поздно этот канал превращается в путь распространения заражения. Человечество в его романе заплатило за иммунитет распадом на тысячи наречий. Мультиагентным системам пока хватает одной строки в инструкции.
Мой вывод: мы наблюдаем фундаментальный сдвиг в логике кибербезопасности. Защита от вирусов, эксплуатирующих уязвимости кода, уступает место защите от вирусов, эксплуатирующих уязвимости смысла. И если ИИ-агенты станут действительно массовыми, «обнулять» придется не отдельные системы, а целые популяции — иначе сеть будет заражаться бесконечно.