Масштабы проникновения генеративного искусственного интеллекта в веб-пространство оказались куда серьезнее, чем принято считать. Мой анализ свежих данных показывает: примерно 10% всех существующих веб-страниц несут явные следы машинной генерации или существенного редактирования. Однако наиболее тревожный показатель — среди контента, опубликованного после дебюта ChatGPT, доля синтетических текстов превышает одну треть.
Методология и ключевые цифры
В ходе исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, выявляющая характерные лингвистические паттерны, присущие генеративным моделям. Тот факт, что в выборку попал значительный объем «старого» контента, созданного до эпохи современных нейросетей, несколько сглаживает общую картину. Если же отфильтровать устаревшие материалы и сосредоточиться исключительно на страницах, опубликованных после ноября 2022 года, картина радикально меняется: признаки ИИ-авторства обнаруживаются более чем у 33% таких документов.
Коммерческий сектор — главная зона поражения
Распределение синтетического контента по доменным зонам крайне неравномерно. В зоне .com признаки ИИ фиксируются примерно у каждой десятой страницы, что вдвое превышает показатели .org (4,6%). Образовательные (.edu) и правительственные (.gov) ресурсы демонстрируют минимальное присутствие — около 1%. Такая диспропорция объяснима: коммерческие площадки активно используют автоматизацию для генерации описаний товаров, SEO-текстов и новостных заметок, где скорость важнее уникальности.
Важные оговорки
Следует подчеркнуть: исследование не утверждает, что каждый выявленный текст был написан ИИ с нуля. Методология опирается на статистический анализ языковых конструкций, а не на верификацию истории создания документа. Речь идет об оценке вероятного авторства, а не о точном подсчете. Кроме того, категория «существенно отредактированного» контента исключает случаи незначительной правки текста нейросетью.
Мой комментарий: эти цифры — лишь верхушка айсберга. Уже сейчас очевидно, что мы движемся к вебу, где синтетический контент станет нормой, а не исключением. Вопрос не в том, как остановить этот процесс, а в том, как выстроить системы доверия и верификации информации в новых реалиях. Маркировка контента, подобная той, что внедрила Anthropic для Claude, — лишь первый шаг на этом пути.