ИИ захватывает веб: более трети новых страниц созданы нейросетями

Масштаб проникновения генеративных моделей в веб-пространство оказался куда серьезнее, чем принято считать. Свежий анализ, основанный на выборке из 10 000 англоязычных страниц, собранных в июле 2026 года через Common Crawl, демонстрирует: около 10% всего веб-контента несет явные следы синтетической генерации. Однако это лишь верхушка айсберга.
Ключевой сдвиг после запуска ChatGPT
Цифра в 10% может показаться умеренной, но она обманчива. Ведь в общую выборку попадает огромный пласт архивных материалов, созданных задолго до эры современных LLM. Если же изолировать только те страницы, что были опубликованы после ноября 2022 года — момента дебюта ChatGPT, — картина радикально меняется. Здесь доля контента с признаками ИИ-авторства превышает треть (33%+). Это прямое доказательство того, что генеративные алгоритмы стали основным инструментом производства текстов для значительной части веб-издателей.
Где ИИ чувствует себя вольготно
Распределение синтетики по доменным зонам крайне неравномерно и подчиняется чисто экономической логике. В зоне .com признаки ИИ-генерации фиксируются примерно у каждой десятой страницы (около 10%), что вдвое превышает показатели .org (4,6%). Наиболее «чистыми» остаются образовательные и государственные ресурсы (.edu и .gov) — там доля едва дотягивает до 1%. Это объяснимо: коммерческий сектор активно автоматизирует рутинные текстовые потоки — описания товаров, SEO-статьи, новостные заметки, — где скорость важнее уникального авторского почерка.
Методология и нюансы
Важно подчеркнуть: речь идет не о точном детектировании, а о вероятностной оценке. Анализ опирался на лингвистические маркеры, статистически коррелирующие с генеративными моделями. Исследователи не проверяли историю правок каждой страницы и не опрашивали авторов. Поэтому корректнее говорить о «значительной вероятности» ИИ-участия, а не о стопроцентном факте. Кроме того, в категорию попадает только контент, написанный или радикально переработанный нейросетью; мелкая корректура с помощью ассистентов в расчет не берется.
Мой взгляд: Эти данные — лишь отправная точка. Рынок движется к тотальной автоматизации контента, и текущие 33% среди новых страниц — это минимум, который будет только расти. Вопрос не в том, как отличить текст ИИ от человеческого, а в том, как поисковые алгоритмы и читатели адаптируются к новой реальности, где синтетика становится нормой, а не исключением. Грядущие изменения в ранжировании и маркировке — лишь первые шаги в этом направлении.