Масштаб проникновения генеративных нейросетей в веб-контент оказался значительно глубже, чем принято считать. Мой анализ свежих данных показывает: примерно 10% всех существующих веб-страниц несут явные следы синтетической генерации или существенного редактирования алгоритмами. Однако наиболее тревожный показатель — среди материалов, опубликованных после дебюта ChatGPT, доля такого контента превышает одну треть.
Методология и ключевые цифры
В ходе исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, настроенная на поиск специфических лингвистических паттернов, характерных для современных LLM.
Тот факт, что в общем массиве лишь каждая десятая страница имеет признаки ИИ, может ввести в заблуждение. Это объясняется тем, что в выборку попало огромное количество «легаси»-контента, созданного до эпохи генеративного ИИ. Если же отфильтровать исторический пласт и сосредоточиться исключительно на публикациях, вышедших после ноября 2022 года, картина радикально меняется: более 33% новых страниц так или иначе созданы или отредактированы нейросетями.
Где ИИ чувствует себя вольготно
Распределение синтетики по доменным зонам крайне неравномерно, и это говорит о многом. В зоне .com признаки ИИ обнаружены примерно у каждой десятой страницы. Для сравнения, в .org этот показатель составляет 4,6%, а в академических (.edu) и правительственных (.gov) доменах — около 1%.
Такая диспропорция логична. Коммерческий сектор исторически завязан на большие объемы контента — описания товаров, SEO-тексты, новостные ленты. Именно эти форматы проще всего автоматизировать, что мы и наблюдаем на практике. В начале бума ChatGPT разрыв между зонами был менее выражен, что указывает на ускоряющуюся коммерциализацию синтетики.
Важные оговорки
Стоит подчеркнуть, что исследование не является «детектором лжи» для каждой конкретной страницы. Методология оценивает вероятность, а не точный факт использования ИИ. Речь идет о текстах, где доля машинного вмешательства значительна; мелкая правка или корректура нейросетью, скорее всего, осталась за кадром.
Мой комментарий: Эти цифры — лишь верхушка айсберга. По моим оценкам, к текущему моменту доля синтетики в новом контенте уже перешагнула отметку в 50%, особенно в новостных агрегаторах и нишевых блогах. Мы движемся к точке невозврата, где поисковые алгоритмы и рекомендательные системы будут вынуждены полностью пересмотреть критерии ранжирования, иначе они просто утонут в потоке сгенерированного шума. Вопрос не в том, будет ли интернет синтетическим, а в том, как мы научимся отделять зерна от плевел.