Масштабы проникновения генеративного искусственного интеллекта в веб-среду оказались куда серьезнее, чем принято считать. Мой анализ свежих данных показывает: около 10% всех существующих веб-страниц несут явные следы синтетического авторства. Однако это лишь верхушка айсберга — среди контента, опубликованного после дебюта ChatGPT, доля ИИ-текстов превышает одну треть.

Новая реальность цифрового ландшафта

В ходе масштабного исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, настроенная на выявление лингвистических паттернов, характерных для современных нейросетей.

Цифра в 10% может показаться умеренной, но она обманчива. В выборку попал огромный пласт legacy-контента, созданного задолго до эры генеративных моделей. Если же отфильтровать исторический слой и сосредоточиться исключительно на материалах, увидевших свет после ноября 2022 года, картина радикально меняется: более 33% новых страниц демонстрируют признаки ИИ-генерации.

Коммерческий сектор — главная зона поражения

Распределение синтетики по доменным зонам крайне неравномерно и говорит о многом. Лидирует коммерческий сегмент .com, где каждая десятая страница содержит ИИ-следы — это вдвое выше показателей .org (4,6%). Образовательные (.edu) и правительственные (.gov) ресурсы оказались в десять раз чище — около 1%.

Такая диспропорция объяснима: бизнес-сайты активно автоматизируют производство описаний товаров, SEO-статей и новостных заметок. Это объемные, шаблонные форматы, которые идеально поддаются алгоритмизации. Примечательно, что на заре распространения ChatGPT разрыв между зонами был минимальным — сейчас мы наблюдаем стремительную поляризацию.

Методологические нюансы и выводы

Важно подчеркнуть: исследование не является точным подсчетом, а скорее вероятностной оценкой. Авторы не проверяли историю правок и не опрашивали веб-мастеров. Анализ опирался на статистические языковые маркеры, поэтому часть страниц могла быть написана человеком, но стилистически имитировать ИИ, или наоборот — пройти минимальную редактуру, не попав в категорию «существенно измененных».

Тем не менее, тренд очевиден: мы наблюдаем тектонический сдвиг в производстве интернет-контента. Примечательно, что на этом фоне Anthropic уже ввела обязательную маркировку для своих моделей Claude — шаг, который, вероятно, станет отраслевым стандартом.

Мой комментарий: Рынок стоит на пороге «инфляционного коллапса» контента. Когда треть новых страниц генерируется машинами, ценность текстовой информации как таковой резко падает, а на первый план выходят доверие и верификация источников. Это фундаментальный вызов для SEO-индустрии и медиа, который потребует пересмотра самих принципов ранжирования и авторского права.