Масштаб проникновения генеративных моделей в веб-контент оказался куда серьезнее, чем принято считать. Мой анализ свежих данных Pew Research Center показывает: примерно 10% всех веб-страниц в интернете несут следы текста, созданного или глубоко отредактированного искусственным интеллектом. Однако ключевая цифра скрыта глубже — среди материалов, опубликованных после дебюта ChatGPT, доля синтетики превышает треть.

ИИ захватывает новые страницы

Исследователи изучили случайную выборку из 10 000 англоязычных страниц, собранных в июле 2026 года через Common Crawl. Для идентификации авторства применялась модель машинного обучения, обученная выявлять характерные языковые паттерны генеративных нейросетей. На первый взгляд, 10% — скромный показатель, но он включает огромный пласт исторического контента, созданного до эры современных LLM.

Когда я отфильтровываю старые артефакты и фокусируюсь только на страницах, появившихся после ноября 2022 года, картина радикально меняется. Более трети таких страниц демонстрируют явные признаки ИИ-генерации. Это подтверждает: рост синтетического контента напрямую коррелирует с экспансией ChatGPT, Claude, Gemini и их конкурентов.

Коммерческий сектор — главный полигон ИИ

Распределение ИИ-контента по доменным зонам крайне неравномерно и отражает экономические стимулы. В 2026 году каждая десятая страница в зоне .com несет следы нейросетей — это вдвое выше, чем в .org (4,6%). На образовательных (.edu) и государственных (.gov) ресурсах доля падает до 1%, что в десять раз ниже коммерческого сектора. Разрыв объясняется просто: бизнес-сайты массово публикуют описания товаров, SEO-статьи и новости, которые легко автоматизировать. В начале эры ChatGPT эти различия были сглажены, но сейчас рынок четко сегментировался.

Методологические нюансы

Важно подчеркнуть: Pew не проверял историю создания каждой страницы и не опрашивал авторов. Анализ основан на статистических языковых маркерах, которые коррелируют с ИИ-генерацией. Поэтому результаты стоит трактовать как оценку вероятного авторства, а не точный подсчет. Более того, речь идет о «написанном или существенно отредактированном» контенте — мелкие правки нейросетью в эту категорию не попадают.

Показательно, что Anthropic уже в августе ввела глобальную маркировку контента от Claude, что лишь подтверждает системность проблемы.

Мой вывод: эти цифры — не просто статистика, а сигнал о тектоническом сдвиге в производстве информации. Рынок стремительно движется к гибридному контенту, где грань между человеческим и машинным авторством стирается. Для инвесторов и аналитиков это означает необходимость пересмотра оценки качества веб-активов и рисков дезинформации в ближайшие годы.