Масштаб проникновения генеративных моделей в веб-пространство оказался куда значительнее, чем принято считать. Мой анализ данных, основанный на выборке из 10 000 англоязычных страниц, собранных в июле 2026 года через Common Crawl, показывает: около 10% всего веба несет явные следы синтетической генерации. Однако это средняя температура по больнице — она размывает реальную картину из-за огромного массива устаревшего контента, созданного до эры современных LLM.

Критический сдвиг после ChatGPT

Ключевой инсайт кроется в динамике. Если отфильтровать страницы, опубликованные после ноября 2022 года — момента запуска ChatGPT, — цифры становятся по-настоящему тревожными. Более трети всех новых материалов в сети демонстрируют признаки машинного авторства или существенной редактуры нейросетями. Это не просто статистика, это маркер фундаментальной трансформации информационного ландшафта, где алгоритмы стали главными фабриками текстов.

География синтетики: коммерция VS академия

Распределение ИИ-контента по доменным зонам выявляет четкую закономерность. В зоне .com доля таких страниц достигла 10% — это вдвое выше, чем в .org (4,6%). Еще более показателен разрыв с академическим и государственным секторами: в .edu и .gov этот показатель едва дотягивает до 1%. Примечательно, что на заре распространения ChatGPT эти различия были почти незаметны, что указывает на стремительную адаптацию коммерческих площадок к автоматизации рутинного контента: описаний товаров, SEO-текстов и новостных лент.

Методологическая осторожность

Важно понимать границы этой оценки. Анализ опирается на лингвистические маркеры, статистически коррелирующие с генеративными моделями, а не на верификацию истории создания каждой страницы. Речь идет о вероятностной оценке, а не о точном подсчете. Кроме того, категория включает как полностью сгенерированные, так и существенно отредактированные ИИ материалы, что оставляет пространство для дискуссий о природе «соавторства».

Мой комментарий: Эти цифры — лишь вершина айсберга. Реальная доля синтетики, вероятно, выше, поскольку модели становятся все совершеннее и их выходные данные сложнее отличить от человеческого текста. Рынку срочно нужны стандарты верификации и маркировки, иначе мы рискуем утонуть в потоке правдоподобной, но неверифицируемой информации, где доверие к вебу как источнику знаний будет окончательно подорвано.