Новости криптомира

24.08.2026
05:25

ИИ захватывает веб: более трети новых страниц созданы нейросетями

AI fake news фейки

Масштабы проникновения генеративных моделей в веб-пространство оказались куда серьезнее, чем принято считать. Мой анализ свежих данных показывает: примерно 10% всех существующих веб-страниц в интернете несут явные следы синтетического текста. Однако если рассматривать только контент, опубликованный после дебюта ChatGPT в ноябре 2022 года, картина становится по-настоящему тревожной — доля таких материалов превышает треть.

Методология: как отличить человека от машины

Исследование базируется на случайной выборке из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, которая выявляла в текстах характерные лингвистические паттерны, свойственные генеративным алгоритмам. Важно понимать: это не точный подсчет, а вероятностная оценка авторства.

На первый взгляд, 10% могут показаться скромной цифрой. Но выборка включала огромный пласт устаревшего контента, созданного задолго до эры современных LLM. Когда я отсекаю «доисторические» страницы и фокусируюсь на материалах пост-2022 года, доля синтетики взлетает до 34-36%. Это прямое свидетельство того, как быстро ChatGPT, Claude, Gemini и их конкуренты трансформируют информационное поле.

Коммерческий сектор — главная зона поражения

Распределение ИИ-контента по доменным зонам крайне неравномерно, и это говорит о многом. В зоне .com признаки генерации обнаруживаются примерно у каждой десятой страницы — вдвое чаще, чем в .org (4,6%). А вот в академических (.edu) и правительственных (.gov) сегментах доля синтетики едва достигает 1%.

Такая диспропорция объяснима. Коммерческие площадки исторически заточены под массовое производство текстов: описания товаров, SEO-статьи, новостные ленты. Именно эти форматы легче всего автоматизировать. Редакции и корпоративные блоги активно используют ИИ для удешевления контент-производства, жертвуя качеством и уникальностью ради объема.

Оговорки и реальные риски

Стоит подчеркнуть: исследование не утверждает, что каждый такой текст написан нейросетью с нуля. Речь идет о «написанном или существенно отредактированном» контенте. Мелкие правки, вроде исправления грамматики, не попадают в эту категорию. Тем не менее, тренд очевиден: интернет стремительно заполняется синтетикой, и этот процесс ускоряется.

На этом фоне шаг Anthropic по глобальной маркировке контента от Claude выглядит своевременным, но недостаточным. Прозрачность происхождения текстов становится критически важной для сохранения доверия к информации. Без четких стандартов и механизмов верификации мы рискуем утонуть в потоке правдоподобной, но бездушной генерации, которая размывает границу между реальным опытом и статистической вероятностью.

Мое экспертное мнение: рынку срочно нужны инструменты аутентификации контента на уровне протоколов, а не добровольных инициатив отдельных компаний. Иначе через пару лет мы не сможем отличить аналитику от галлюцинаций модели, и это ударит по всей экосистеме цифровых медиа.