Anthropic признала масштабный сбой биозащиты: 133 млн диалогов с ИИ остались без фильтров

Разработчики Anthropic раскрыли тревожную деталь в своей инфраструктуре безопасности: в течение почти года система биологической защиты Claude фактически бездействовала в отношении значительного сегмента пользовательского трафика. Речь идет о пуле примерно из 50 000 внешних подрядчиков и колоссальном объеме — свыше 133 млн взаимодействий с моделями. Эта информация содержится в моем новом аналитическом отчете о рисках, опубликованном в августе 2026 года.
Системный сбой продолжительностью 11 месяцев
Суть проблемы в том, что с мая 2025 по апрель 2026 года блокирующие биологические классификаторы не применялись к трафику платформ сбора обратной связи. Через эту инфраструктуру внешние подрядчики не только оценивали ответы, но и вели с моделями открытые диалоги. Как выяснилось, весь этот трафик маркировался внутренним флагом, который одновременно отключал и блокировку опасных запросов, и даже регистрацию их срабатывания.
Это означает, что потенциально опасные обращения не просто не блокировались — они полностью выпадали из систем последующего мониторинга. Более того, компания признала слабость контроля доступа у подрядчиков: до апреля 2026 года процедуры проверки персонала у многих поставщиков не позволяли надежно отсеивать потенциальных злоумышленников. По оценке, проникновение в команду Red Team было бы не слишком сложной задачей.
Аудит выявил лишь 62 подозрительных диалога
После обнаружения ошибки Anthropic восстановила почти весь массив переписок, за исключением ~1% данных на одной платформе, где сообщения не сохранялись без нажатия кнопки отправки. Для анализа всех запросов использовалась модель Claude Sonnet 5, которая присвоила высокий уровень биологического риска 1197 транскриптам. Из них 757 относились к внутренним командам самой Anthropic, а 378 — к намеренному red teaming. Таким образом, лишь 62 внешних диалога не были связаны с тестированием.
Ручная проверка этих случаев и выборки из 30 red-team-диалогов не выявила явно опасного использования, способного существенно повысить возможности злоумышленника в создании биологического оружия. Несмотря на это, компания признала, что инцидент подрывает уверенность в отсутствии других неизвестных пробелов в защите.
Пересмотр оценок риска и зависимость от собственного ИИ
Этот случай напрямую повлиял на официальную позицию Anthropic. Уровень риска по сценарию CB-1 (существенная помощь ИИ в создании известных биоугроз) был задним числом пересмотрен с «очень низкого» до «низкого». Текущий уровень риска катастрофического ущерба теперь характеризуется как «низкий, но не пренебрежимо малый». Аналогично была повышена оценка риска мисалаймента в ситуациях с высокими ставками.
Отчет также вскрывает поразительную степень зависимости компании от собственных моделей. Claude пишет большую часть производственного кода Anthropic, а внутренние исследования активно используют агентов на базе Mythos 5 и Model 2. Это создает интересный парадокс: компания, оценивающая риски ИИ, одновременно является его самым активным корпоративным потребителем.
Мой комментарий: Этот случай — яркая иллюстрация того, что даже у лидеров индустрии безопасности ИИ существуют «слепые зоны». Тот факт, что ошибка не привела к реальным инцидентам, — скорее удача, чем заслуга. Инвесторам и регуляторам стоит воспринимать это как сигнал: аудит защитных систем должен быть непрерывным, а не ретроспективным. Прозрачность Anthropic в этом вопросе заслуживает уважения, но она же подчеркивает, насколько хрупкой может быть биобезопасность в эпоху стремительного масштабирования ИИ.