Новости криптомира

24.08.2026
00:05

ИИ захватывает интернет: более трети новых веб-страниц созданы нейросетями

AI fake news фейки

Масштабы проникновения генеративных моделей в веб-контент оказались куда серьёзнее, чем принято считать. Мой анализ свежих данных показывает: примерно 10% всех существующих веб-страниц в интернете несут явные следы машинной генерации или глубокой редактуры. Однако если смотреть на контент, созданный после дебюта ChatGPT в ноябре 2022 года, картина становится радикально иной — более трети таких страниц имеют признаки синтетического происхождения.

Методология и ключевые цифры

В ходе исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года через архив Common Crawl. Для идентификации использовалась модель машинного обучения, настроенная на поиск характерных лингвистических паттернов, свойственных генеративным алгоритмам. Важно понимать: выборка включала значительный пласт «старого» веба, созданного до эпохи современных LLM, что объясняет сравнительно скромные 10% в общей массе.

Но если отфильтровать устаревшие страницы и сосредоточиться исключительно на публикациях, появившихся после запуска ChatGPT, доля синтетики взлетает до 33% и выше. Это прямое свидетельство того, что распространение Claude, Gemini и других моделей не просто ускоряет производство контента, а фундаментально меняет его структуру.

Коммерческий сектор — главный драйвер

Распределение ИИ-контента по доменным зонам крайне неравномерно. В зоне .com признаки генерации обнаружены примерно у каждой десятой страницы — это вдвое больше, чем в .org (4,6%). На академических и государственных ресурсах (.edu и .gov) доля падает до 1%, что в десять раз ниже. Такая диспропорция объясняется просто: коммерческие площадки массово автоматизируют рутинные тексты — описания товаров, SEO-статьи, справочные материалы и новостные заметки, где скорость публикации критична, а уникальность авторского голоса не является приоритетом.

Оговорки и реальность

Стоит подчеркнуть: исследование не является точным подсчётом. Речь идёт о вероятностной оценке, основанной на статистических языковых маркерах, а не о верификации истории правок. Небольшая корректура нейросетью не попадает в категорию «написанного ИИ», но глубокая переработка — уже да. Это важный нюанс, который, впрочем, не отменяет главного вывода: мы наблюдаем тектонический сдвиг в производстве веб-контента, и его последствия для SEO, медиа и доверия аудитории ещё предстоит осмыслить.

Моё экспертное мнение: эти цифры — лишь верхушка айсберга. Пока алгоритмы детекции полагаются на лингвистические паттерны, генеративные модели быстро учатся их маскировать. Уже сейчас очевидно, что без внедрения криптографической маркировки происхождения контента (как это делает Anthropic для Claude) мы рискуем утонуть в потоке качественной, но неотличимой от человеческой синтетики, что обесценит труд живых авторов и подорвёт основы информационной гигиены.