Масштаб проникновения генеративных моделей в веб-пространство оказался куда серьезнее, чем принято считать. Мой анализ свежих данных показывает: примерно каждая десятая веб-страница в интернете несет в себе явные признаки машинной генерации или существенной редактуры. Однако если смотреть на контент, опубликованный после дебюта ChatGPT в ноябре 2022 года, картина становится радикально иной — более трети таких страниц имеют синтетическое происхождение.

Методология и масштаб явления

В ходе исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, настроенная на поиск характерных лингвистических паттернов, свойственных генеративным нейросетям. Общий показатель в 10% может показаться скромным, но он размывается за счет огромного пласта устаревшего контента, созданного задолго до эры современных LLM.

Когда мы отсекаем «доисторический» веб и фокусируемся исключительно на публикациях, появившихся после запуска ChatGPT, мы видим стремительную экспансию ИИ. Треть новых страниц — это не маргинальная ниша, а системный тренд, который будет только усиливаться по мере интеграции Claude, Gemini и других моделей в повседневные рабочие процессы.

Коммерческий сектор — главный драйвер

Распределение синтетики по доменным зонам подчеркивает экономическую подоплеку явления. В зоне .com признаки ИИ-генерации обнаруживаются у каждой десятой страницы — это вдвое выше, чем в некоммерческой зоне .org (4,6%). Еще более показателен разрыв с образовательными и государственными доменами (.edu и .gov), где доля едва достигает 1%.

Такая диспропорция логична: коммерческие площадки активно автоматизируют создание описаний товаров, SEO-текстов и новостных лент. Это объемные, шаблонные форматы, где скорость и экономия ресурсов важнее уникального авторского взгляда. В начале бума ChatGPT эти различия были сглажены, но сейчас рынок четко сегментировался.

Важные оговорки методологии

Стоит подчеркнуть, что речь идет не о точном подсчете «написанного роботом», а о вероятностной оценке. Исследователи не проверяли историю правок и не опрашивали авторов. Анализ опирался на статистические языковые маркеры, которые могут присутствовать и в тексте, написанном человеком, но прошедшем агрессивную ИИ-редактуру. Кроме того, мелкие правки с помощью нейросети в эту категорию, как правило, не попадают.

В этом контексте показательно недавнее решение Anthropic о глобальной маркировке контента, созданного Claude. Индустрия начинает осознавать: без четкой идентификации синтетики мы рискуем окончательно потерять грань между фактом и симулякром.

Мой вывод: мы наблюдаем не просто тренд, а тектонический сдвиг в экономике контента. Веб стремительно превращается в среду, где человеческое авторство становится премиальным продуктом на фоне дешевой и безликой машинной массы. Вопрос не в том, остановит ли это кто-то, а в том, как мы адаптируем алгоритмы поиска и доверия к новой реальности.