Новости криптомира

23.08.2026
23:45

ИИ захватывает веб: более трети новых страниц созданы нейросетями

AI fake news фейки

Масштаб проникновения генеративных моделей в веб-пространство оказался куда серьёзнее, чем принято думать. Мой анализ свежих данных показывает: около 10% всех веб-страниц в интернете несут явные следы синтетического текста. Однако если смотреть на контент, опубликованный после дебюта ChatGPT в ноябре 2022 года, картина становится радикально иной — более трети таких страниц созданы или существенно отредактированы искусственным интеллектом.

Методология и цифры

В ходе исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через Common Crawl. Для выявления ИИ-авторства применялась модель машинного обучения, которая выискивала характерные лингвистические паттерны, свойственные генеративным алгоритмам. На первый взгляд, 10% — скромный показатель, но он включает огромный пласт устаревшего контента, созданного задолго до эры современных нейросетей. Когда же фильтруешь данные и оставляешь только «свежие» публикации, доля синтетики взлетает до 33% и выше.

Где ИИ чувствует себя вольготно

Распределение синтетического контента по доменным зонам крайне неравномерно. Коммерческие сайты (.com) лидируют с показателем около 10% — это вдвое больше, чем в зоне .org (4,6%). А вот образовательные (.edu) и правительственные (.gov) ресурсы демонстрируют мизерные ~1%. Такая диспропорция объяснима: бизнес-площадки активно автоматизируют производство описаний товаров, SEO-статей и новостных заметок, где скорость важнее глубины. В начале распространения ChatGPT разрыв между зонами был менее выражен, что указывает на ускоряющуюся коммерциализацию ИИ-текстов.

Важные оговорки

Стоит подчеркнуть: исследование не утверждает, что каждый такой текст написан машиной от и до. Речь идёт о вероятностной оценке, основанной на стилистических маркерах. Многие авторы могли использовать ИИ для черновиков или лёгкой редактуры, что тоже попадает в категорию «существенного редактирования». Это не точный подсчёт, а индикатор тренда, который невозможно игнорировать.

Мой вывод: мы наблюдаем тектонический сдвиг в производстве контента. Рынок уже не может полагаться на «человеческое» происхождение текстов по умолчанию. Вопрос не в том, используют ли ИИ, а в том, как отличить качественную аналитику от массовой генерации. Инвесторам и читателям стоит учитывать этот фактор при оценке информационной надёжности ресурсов.