Команда Anthropic обнародовала данные о критическом пробеле в системе биологической безопасности своей флагманской модели Claude. Сбой, продолжавшийся почти год, затронул около 50 000 внешних подрядчиков и задел порядка 133 миллионов взаимодействий с искусственным интеллектом. Эта информация содержится в моем новом аналитическом отчете о состоянии защитных механизмов в индустрии.
Системный сбой: 11 месяцев без блокирующих классификаторов
В течение 11 месяцев — с мая 2025 по апрель 2026 года — весь трафик, проходивший через платформы сбора обратной связи, обрабатывался без активации блокирующих биологических классификаторов. Эти системы призваны выявлять и пресекать попытки использования модели в потенциально опасных химических или биологических целях. Критическая ошибка заключалась в том, что трафик маркировался внутренним флагом, который одновременно отключал фильтры и отключал регистрацию их срабатываний.
Наиболее тревожным аспектом является то, что большинство участников имели возможность вести с моделями открытые диалоги, а не только оценивать готовые ответы. Это означает, что потенциально опасные запросы не только не блокировались, но и полностью выпадали из поля зрения систем последующего аудита. Более того, в отчете признается, что до ужесточения требований у многих подрядчиков отсутствовали надежные процедуры проверки персонала, что делало возможным проникновение в команды Red Team злоумышленников.
Масштаб проверки: 1197 транскриптов под подозрением
После обнаружения ошибки Anthropic удалось восстановить практически весь массив данных, за исключением 1% переписок на одной из платформ, где информация не сохранялась без нажатия кнопки отправки. Для ретроспективного анализа всех запросов была задействована модель Claude Sonnet 5, которая присвоила высокий уровень риска 1197 транскриптам.
Детальный разбор показал, что большинство из них (757) относились к внутренним командам самой Anthropic. Из оставшихся 440 случаев 378 были намеренным red teaming — специализированными попытками взломать защиту для проверки ее надежности. Таким образом, лишь 62 внешних диалога не были связаны с тестированием. Ручная проверка этих переписок и случайной выборки из 30 red-team-диалогов не выявила явно опасного использования, которое могло бы существенно усилить потенциал злоумышленников в создании биологического оружия.
Несмотря на то, что компания оценивает вероятность существенного роста химико-биологического риска как «очень маловероятную», сам факт обнаружения такой масштабной уязвимости заставил пересмотреть официальные оценки. Уровень риска по сценарию CB-1 (создание известных угроз с помощью ИИ) был задним числом повышен с «очень низкого» до «низкого». Аналогичная корректировка затронула и оценку риска мисалаймента в ситуациях с высокими ставками.
Стоит отметить, что отчет также раскрывает степень зависимости самой Anthropic от собственных ИИ-систем: Claude уже пишет большую часть производственного кода компании. Однако, с моей точки зрения, этот инцидент подчеркивает фундаментальную проблему всей индустрии: даже у ведущих лабораторий с многоуровневой защитой могут существовать «слепые зоны» в инфраструктуре, о которых они не подозревают. Это серьезный звонок для всего рынка, демонстрирующий, что безопасность ИИ — это не статичный набор фильтров, а непрерывный процесс аудита и пересмотра собственных допущений.