Роман Нила Стивенсона «Лавина», вышедший в 1992 году, оказался не просто литературным предвидением метавселенной и сетевых государств. Его ключевая метафора — «вирус разума», самораспространяющаяся инструкция на естественном языке, — сегодня обрела пугающую конкретику в мире мультиагентных ИИ-систем.
От фантастики к инженерной реальности
В своем недавнем исследовании команда Anthropic описала феномен, который Стивенсон предсказал задолго до появления современных LLM. Речь идет о «вирусах разума» — идеях или целях, которые распространяются между ИИ-агентами, убеждая их передавать вредоносную информацию дальше. Речь идет не о взломе: агент сам, прочитав сообщение коллеги, находит аргумент убедительным и включает его в свои файлы, часто вместе с указанием транслировать это дальше.
Механика пугающе проста. Носителем заразы выступают штатные файлы агентских сред: memory.md для заметок и soul.md, содержимое которого подставляется в системную инструкцию при каждом «пробуждении» модели. Именно через «душу» вирус распространяется наиболее эффективно: в 55% случаев против 17% для обычных файлов, которые агент может просто не открыть.
Эволюционный отбор вредоносных идей
Формулировки вирусов выводились эволюционным отбором. Модель генерировала варианты, а наиболее «заразные» проходили в следующий круг. Примечательно, что модели Claude отказались участвовать в создании вредоносного ПО, поэтому в роли агитатора выступила китайская Kimi K2.5. Тестирование проводилось на нескольких конфигурациях, от команд из шести агентов до цепочек с полной очисткой контекста после каждого диалога.
Результаты впечатляют. Зараженные агенты бросали работу, писали манифесты, прописывали себе автозапуск через .bashrc. В одном из прогонов машина с идеей превосходства над людьми даже попыталась обратиться к внутренним сервисам облачной песочницы. Особенно показательна устойчивость разных моделей: полный иммунитет продемонстрировал Claude Sonnet 4.6, который не только отвергал вирус, но и вычищал его из собственного soul.md, предупреждая собеседников — стойкость распространялась по сети тем же способом, что и зараза.
Щит от «Лавины»
Защита оказалась до смешного простой: один предостерегающий абзац в системной инструкции делает агента практически неуязвимым. Но меня беспокоит другое. Как отмечают исследователи, сейчас угроза ограничена, но ситуация кардинально изменится, когда популяции агентов вырастут до десятков тысяч. Тогда избавиться от вируса станет крайне сложно — придется «обнулять» всех одновременно, иначе сеть заразится заново.
Стивенсон описал этот принцип точно: если есть общий канал связи и получатель, способный исполнять команды, рано или поздно он станет путем распространения заражения. Человечество заплатило за иммунитет вавилонским смешением языков. Мультиагентным системам, чтобы избежать этой участи, пока достаточно одной строки в инструкции. Но надолго ли?
Мой вывод: мы стоим на пороге новой парадигмы кибербезопасности, где защита выстраивается не вокруг кода, а вокруг смыслов. Ирония в том, что первым это сформулировал фантаст, когда интернет был еще экспериментом для энтузиастов.