Цифровой ландшафт стремительно трансформируется: мой анализ свежих данных показывает, что примерно 10% всех веб-страниц в интернете несут явные следы машинной генерации или глубокой редактуры. Однако куда более тревожная цифра скрывается в динамике — среди материалов, опубликованных после дебюта ChatGPT, доля синтетического контента превышает 33%.
Масштаб экспансии: от 10% до трети
В ходе исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, настроенная на поиск лингвистических паттернов, характерных для генеративных нейросетей. На первый взгляд, 10% — это умеренный показатель, но он включает в себя огромный пласт «доисторического» контента, созданного до эры продвинутых LLM.
Если же отфильтровать этот legacy-контент и сфокусироваться исключительно на публикациях, появившихся после ноября 2022 года, картина меняется радикально. Более одной трети таких страниц демонстрируют высокую вероятность ИИ-авторства. Это прямое доказательство того, что генеративные модели стали основным инструментом производства текстов для значительной части веба.
География синтетики: коммерция лидирует
Распределение ИИ-контента по доменным зонам крайне неравномерно, что говорит о прагматичном использовании технологии. В зоне .com признаки генерации обнаруживаются примерно у каждой десятой страницы. Для сравнения, в некоммерческой зоне .org этот показатель вдвое ниже — 4,6%. Наиболее «чистыми» остаются образовательные (.edu) и правительственные (.gov) ресурсы, где доля синтетики едва достигает 1%.
Такая дифференциация объяснима: коммерческие площадки активно автоматизируют создание SEO-текстов, карточек товаров и новостных лент. В начале распространения ChatGPT разрыв между зонами был минимален, однако сейчас рынок четко сегментировался по степени внедрения ИИ.
Методологическая осторожность
Важно понимать ограничения этой оценки. Исследование не проверяет историю правок каждой страницы и не опрашивает авторов. Выводы основаны на статистическом анализе языковых маркеров, которые коррелируют с ИИ-генерацией. Речь идет о вероятностной оценке, а не о точном подсчете. Кроме того, категория «существенно отредактированный» контент исключает легкую корректуру, что делает оценки даже несколько консервативными.
Мой комментарий: Рынок уже прошел точку невозврата. Мы наблюдаем не просто тренд, а фундаментальный сдвиг в экономике контента. Однако гонка за объемом с помощью ИИ создает риск девальвации информации и роста «цифрового шума». В ближайшие годы ключевым активом станет не скорость генерации, а доверие к источнику и качество верификации данных. Игроки, которые смогут выстроить гибридные редакционные процессы, где ИИ усиливает, а не заменяет аналитику, получат решающее преимущество.