ИИ захватывает веб: более трети новых страниц созданы нейросетями

Масштабы проникновения генеративных моделей в веб-пространство оказались куда серьезнее, чем принято считать. Мой анализ свежих данных показывает: примерно 10% всех существующих веб-страниц в интернете несут явные следы синтетического текста. Однако если рассматривать только контент, опубликованный после дебюта ChatGPT в ноябре 2022 года, картина становится по-настоящему тревожной — доля таких материалов превышает треть.
Методология: как отличить человека от машины
Исследование базируется на случайной выборке из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, которая выявляла в текстах характерные лингвистические паттерны, свойственные генеративным алгоритмам. Важно понимать: это не точный подсчет, а вероятностная оценка авторства.
На первый взгляд, 10% могут показаться скромной цифрой. Но выборка включала огромный пласт устаревшего контента, созданного задолго до эры современных LLM. Когда я отсекаю «доисторические» страницы и фокусируюсь на материалах пост-2022 года, доля синтетики взлетает до 34-36%. Это прямое свидетельство того, как быстро ChatGPT, Claude, Gemini и их конкуренты трансформируют информационное поле.
Коммерческий сектор — главная зона поражения
Распределение ИИ-контента по доменным зонам крайне неравномерно, и это говорит о многом. В зоне .com признаки генерации обнаруживаются примерно у каждой десятой страницы — вдвое чаще, чем в .org (4,6%). А вот в академических (.edu) и правительственных (.gov) сегментах доля синтетики едва достигает 1%.
Такая диспропорция объяснима. Коммерческие площадки исторически заточены под массовое производство текстов: описания товаров, SEO-статьи, новостные ленты. Именно эти форматы легче всего автоматизировать. Редакции и корпоративные блоги активно используют ИИ для удешевления контент-производства, жертвуя качеством и уникальностью ради объема.
Оговорки и реальные риски
Стоит подчеркнуть: исследование не утверждает, что каждый такой текст написан нейросетью с нуля. Речь идет о «написанном или существенно отредактированном» контенте. Мелкие правки, вроде исправления грамматики, не попадают в эту категорию. Тем не менее, тренд очевиден: интернет стремительно заполняется синтетикой, и этот процесс ускоряется.
На этом фоне шаг Anthropic по глобальной маркировке контента от Claude выглядит своевременным, но недостаточным. Прозрачность происхождения текстов становится критически важной для сохранения доверия к информации. Без четких стандартов и механизмов верификации мы рискуем утонуть в потоке правдоподобной, но бездушной генерации, которая размывает границу между реальным опытом и статистической вероятностью.
Мое экспертное мнение: рынку срочно нужны инструменты аутентификации контента на уровне протоколов, а не добровольных инициатив отдельных компаний. Иначе через пару лет мы не сможем отличить аналитику от галлюцинаций модели, и это ударит по всей экосистеме цифровых медиа.