Масштабное исследование, проведенное аналитиками Pew Research Center, пролило свет на стремительную экспансию генеративных моделей в веб-пространстве. Согласно полученным данным, примерно 10% всех существующих веб-страниц несут на себе следы машинной генерации или значительной редактуры. Однако наиболее тревожный показатель скрывается в динамике: среди контента, опубликованного после дебюта ChatGPT в ноябре 2022 года, доля синтетических текстов превышает 33%. Это означает, что каждый третий новый материал в интернете создан или существенно переработан нейросетью.
Методология исследования заслуживает отдельного внимания. В основу анализа легла случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации «цифрового почерка» ИИ применялась специализированная модель машинного обучения, настроенная на поиск характерных лингвистических паттернов, свойственных генеративным алгоритмам. Такой подход позволяет выявить статистически значимые маркеры, но не является стопроцентным доказательством авторства.
Коммерческий сектор — главная зона поражения
Распределение ИИ-контента по доменным зонам демонстрирует четкую корреляцию с экономическими стимулами. Лидирует с большим отрывом коммерческий сектор: в зоне .com признаки генерации обнаруживаются у каждой десятой страницы (около 10%). Для сравнения, в некоммерческой зоне .org этот показатель вдвое ниже — 4,6%. Наиболее «чистыми» остаются образовательные и государственные ресурсы: в доменах .edu и .gov доля синтетики едва достигает 1%.
Такая диспропорция объясняется структурой контента. Коммерческие площадки активно используют ИИ для автоматизации рутинных текстовых объемов: описаний товаров, SEO-статей, справочных материалов и новостных заметок. В начале эры ChatGPT подобного разрыва между зонами не наблюдалось — расхождение усилилось по мере развития технологий.
Методологические оговорки и перспективы
Важно подчеркнуть: исследование не является точным подсчетом, а скорее оценкой вероятного авторства. Pew не анализировал историю создания страниц и не опрашивал авторов. Выводы основаны исключительно на лингвистическом анализе, который может давать погрешность. Кроме того, категория «существенно отредактированного» контента исключает незначительные правки текста, выполненные с помощью ИИ.
На фоне этих данных становится понятным решение Anthropic о внедрении глобальной маркировки для контента, созданного моделями Claude. В условиях, когда синтетика становится неотъемлемой частью веба, вопрос доверия к информации и прозрачности происхождения текстов выходит на первый план. Рынок уже столкнулся с проблемой «инфошума», где алгоритмы генерируют контент для алгоритмов, и это ставит перед индустрией фундаментальные вопросы о качестве и достоверности данных.
Мой комментарий: Тенденция к тотальной синтетизации контента несет в себе скрытые риски не только для читателей, но и для самих поисковых систем и моделей ИИ, обучающихся на этих данных. Возникает эффект «вырождения» информации, когда модели обучаются на собственных выходах. В ближайшие годы мы неизбежно придем к необходимости внедрения криптографических стандартов верификации контента, иначе цифровая экосистема рискует превратиться в замкнутую петлю самообмана.