Новости криптомира

17.08.2026
10:19

Anthropic раскрыла масштабный сбой биозащиты: 133 млн диалогов с ИИ прошли без фильтров

ii-startap-Anthropic-AI

В моём распоряжении оказался свежий отчёт Anthropic, который вскрывает тревожный инцидент в системе безопасности Claude. Речь идёт о почти годовом сбое в работе биологических классификаторов — тех самых барьеров, которые должны блокировать попытки использовать ИИ для создания биологического оружия. Масштаб проблемы впечатляет: затронуты около 50 000 человек и примерно 133 млн взаимодействий с моделями.

Критическая уязвимость в инфраструктуре подрядчиков

Суть инцидента в том, что с мая 2025 по апрель 2026 года трафик с платформ сбора обратной связи, где внешние подрядчики тестировали модели, проходил без блокирующего действия биологических фильтров. Техническая деталь, которая меня особенно беспокоит: трафик маркировался флагом внутреннего использования, который одновременно отключал и сами классификаторы, и систему регистрации их срабатываний. Это значит, что потенциально опасные запросы не только не блокировались, но и не оставляли следов для последующего аудита. Хуже того, Anthropic признала слабый контроль доступа у подрядчиков. До апреля 2026 года у многих из них не было надёжных процедур проверки персонала, что делало реальным проникновение злоумышленника в команды Red Team.

Что показал ретроспективный анализ

После обнаружения ошибки компания восстановила почти все данные, за исключением около 1% диалогов на одной из платформ. Для проверки Anthropic использовала Claude Sonnet 5, которая выявила 1197 транскриптов с высоким уровнем риска. Однако при ближайшем рассмотрении картина меняется: 757 из них — это запросы внутренних команд самой Anthropic, а ещё 378 — намеренный red teaming. Осталось лишь 62 внешних диалога, не связанных с тестированием. Ручная проверка этих случаев не выявила явных попыток создания биологического оружия. Компания оценивает вероятность существенного роста химико-биологического риска как «очень маловероятную», указывая на малое число опасных запросов и их краткосрочность. Однако сам факт такого длительного пробела в защите заставляет меня усомниться в полноте их выводов — если классификаторы не работали, то и сигналов для глубокого анализа могло быть недостаточно.

Пересмотр оценок риска

Инцидент заставил Anthropic пересмотреть собственные оценки. По сценарию CB-1 (помощь ИИ в создании известных биоугроз) риск за прошедший период был повышен задним числом с «очень низкого» до «низкого». Текущий уровень характеризуется как «низкий, но не пренебрежимо малый». Также с «очень низкой» до «низкой» повышена оценка риска мислаймента в высокоставковых ситуациях.

Зависимость от собственных моделей

Любопытная деталь отчёта — степень интеграции ИИ в работу самой Anthropic. Claude уже пишет большую часть кода, попадающего в производственные репозитории компании. Это показатель зрелости технологии, но одновременно и потенциальная точка отказа: если модель ошибается в коде, последствия могут быть системными. Мой вердикт: этот случай — яркая иллюстрация того, что даже у лидеров индустрии безопасности ИИ есть слепые зоны. Способность Anthropic быстро обнаружить и проанализировать проблему обнадёживает, но сам факт 11-месячного пробела в защите — серьёзный звонок для всей отрасли. Регуляторам стоит обратить на это внимание: саморегулирование в вопросах биобезопасности ИИ пока работает не так надёжно, как хотелось бы.