Anthropic признала масштабный сбой биозащиты Claude: 133 млн диалогов остались без фильтров

Разработчики Anthropic раскрыли серьезный инцидент в системе биологической безопасности своих моделей Claude. Сбой, продолжавшийся почти год, затронул пул примерно из 50 000 внешних подрядчиков и около 133 млн взаимодействий с ИИ. Эта информация стала ключевой в новом Risk Report, опубликованном компанией.
Системный сбой: 11 месяцев без блокирующих классификаторов
В течение 11 месяцев — с мая 2025 по апрель 2026 года — весь трафик платформ, через которые сторонние специалисты работали с моделями, обрабатывался без активации блокирующих биологических классификаторов. Эти системы предназначены для перехвата потенциально опасных запросов в области химии и биологии. Как выяснилось, трафик проходил с внутренним флагом, который одновременно отключал как блокировку, так и регистрацию срабатываний защитных механизмов.
Это означает, что потенциально вредоносные обращения не только не отклонялись, но и не попадали в систему последующего аудита. Более того, компания признала слабый контроль доступа у подрядчиков: до ужесточения требований многие поставщики не имели надежных процедур проверки персонала, что делало возможным проникновение в команды Red Team.
Масштаб проверки: 1197 подозрительных диалогов
После обнаружения ошибки Anthropic восстановила почти все данные переписок, за исключением лишь 1% трафика на одной платформе, где информация не сохранялась без нажатия кнопки отправки. Для анализа массивов компания задействовала модель Claude Sonnet 5, которая выявила 1197 транскриптов с высоким уровнем риска.
Распределение оказалось показательным: 757 диалогов принадлежали внутренним командам Anthropic, а 378 были намеренным red teaming'ом — попытками специалистов спровоцировать модель на опасные ответы. В итоге лишь 62 внешние переписки не были связаны с тестированием. Ручная проверка этих случаев и случайной выборки из red-team-диалогов не выявила явного опасного использования, способного существенно усилить злоумышленника в создании биологического оружия.
Пересмотр оценок риска и зависимость от собственных ИИ
Этот инцидент заставил Anthropic задним числом пересмотреть оценку риска по сценарию CB-1 (использование ИИ для создания известных биоугроз) с «очень низкого» до «низкого». Текущий уровень риска катастрофического ущерба компания характеризует как «низкий, но не пренебрежимо малый». Также была повышена оценка риска мисалаймента в ситуациях с высокими ставками.
Примечательно, что отчет также раскрывает глубокую зависимость самой Anthropic от собственных моделей: Claude пишет большую часть кода, принимаемого в производственные репозитории компании. Хотя это ускоряет разработку, но пока менее чем в два раза.
Мой комментарий: Этот случай — яркая иллюстрация того, что даже у лидеров индустрии безопасности ИИ существуют «слепые зоны». Тот факт, что сбой длился почти год и был обнаружен лишь ретроспективно, поднимает серьезные вопросы о надежности систем мониторинга. Для рынка это сигнал: аудит защитных контуров должен быть непрерывным и многоуровневым, а не полагаться на разовые проверки. Инвесторам и пользователям стоит внимательнее относиться к заверениям компаний о безопасности их платформ.