Новости криптомира

23.08.2026
08:11

ИИ захватывает веб: более трети новых страниц созданы нейросетями — мой анализ данных Pew Research

AI fake news фейки

Масштаб проникновения генеративных моделей в веб-пространство оказался куда серьезнее, чем принято считать. Мой анализ свежих данных исследовательского центра показывает: около 10% всех проиндексированных веб-страниц в англоязычном сегменте несут явные следы синтетического текста. Однако ключевая цифра скрыта глубже — среди материалов, опубликованных после дебюта ChatGPT в ноябре 2022 года, доля ИИ-контента превышает 33%.

Методология и реальные цифры

Исследование базируется на случайной выборке из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, обученная выявлять характерные лингвистические паттерны генеративных алгоритмов. Важно подчеркнуть: это не бинарный детектор, а вероятностная оценка, основанная на статистических аномалиях в тексте.

На первый взгляд, 10% могут показаться скромным показателем. Но выборка включает огромный пласт легаси-контента, созданного до эры современных LLM. Когда я отфильтровываю устаревшие страницы и фокусируюсь исключительно на публикациях последних лет, картина радикально меняется: каждая третья новая страница в вебе имеет признаки ИИ-авторства или существенного редактирования нейросетью.

Коммерческий сектор — главный драйвер синтетики

Распределение ИИ-контента по доменным зонам демонстрирует четкую закономерность. В зоне .com признаки генерации обнаруживаются примерно у 10% страниц — это вдвое выше, чем в .org (4,6%). Наиболее показательны образовательные (.edu) и правительственные (.gov) ресурсы, где доля синтетики не превышает 1%.

Такая диспропорция объяснима экономикой контента. Коммерческие площадки активно автоматизируют производство описаний товаров, SEO-текстов и новостных заметок, где скорость важнее уникальности. В начале распространения ChatGPT разрыв между зонами был менее выражен, но сейчас тренд очевиден: чем выше монетизация трафика, тем агрессивнее внедрение ИИ.

Критическая оговорка к данным

Несмотря на внушительные цифры, я обязан отметить ограничения методологии. Исследование не анализирует историю правок и не опрашивает авторов. Речь идет о лингвистических маркерах, которые статистически коррелируют с ИИ-генерацией, но не являются абсолютным доказательством. Кроме того, категория «существенно отредактированный» контент исключает мелкие правки, что делает оценку консервативной.

В этом контексте напомню: в августе Anthropic ввела глобальную маркировку для контента, созданного моделями Claude. Однако без единого стандарта для всех LLM рынок остается фрагментированным.

Мой вердикт: эти данные — тревожный сигнал для экосистемы веба. Если треть нового контента генерируется алгоритмами без прозрачной маркировки, мы движемся к информационной среде, где доверие к тексту будет требовать криптографической верификации. Для аналитиков и инвесторов это означает рост ценности платформ с доказанным человеческим авторством — и неизбежное ужесточение регуляторных требований к ИИ-публикациям.