Масштабы проникновения генеративного ИИ в веб-пространство оказались куда серьёзнее, чем принято считать. Мой анализ свежих данных показывает: примерно каждая десятая веб-страница в интернете несёт явные следы машинной генерации или существенного редактирования. Однако если смотреть на контент, созданный после запуска ChatGPT в ноябре 2022 года, картина становится радикально иной — более трети таких страниц имеют признаки ИИ-авторства.

Методология и масштаб явления

Выборка из 10 000 случайных англоязычных страниц, собранных в июле 2026 года через Common Crawl, была проанализирована с помощью модели машинного обучения. Алгоритм выявлял лингвистические паттерны, статистически характерные для генеративных моделей. Важно подчеркнуть: это не точный подсчёт, а оценка вероятного авторства, основанная на языковых маркерах.

Тот факт, что среди «свежих» публикаций доля синтетического контента превышает 33%, говорит о тектоническом сдвиге в производстве информации. ChatGPT, Claude, Gemini и их конкуренты стали не просто инструментами, а основными «авторами» значительной части веб-контента.

Коммерческий сектор — главный драйвер

Распределение ИИ-контента по доменным зонам крайне неравномерно. В зоне .com признаки генерации обнаружены примерно у 10% страниц — это вдвое больше, чем в .org (4,6%). Ещё более показателен разрыв с академическим и государственным сегментами: в зонах .edu и .gov доля ИИ-текстов составляет лишь около 1%.

Такая диспропорция объяснима. Коммерческие площадки активно автоматизируют производство описаний товаров, SEO-статей и новостных заметок — форматов, которые легко масштабируются нейросетями. Напротив, сайты с высокими требованиями к достоверности и экспертизе (образование, госсектор) сохраняют «человеческое» авторство.

Важные оговорки и выводы

Необходимо сделать существенную ремарку: исследование не проверяло историю создания страниц и не опрашивало авторов. Речь идёт о вероятностной оценке, а не о доказанном факте генерации. Кроме того, категория «написанного или существенно отредактированного» ИИ исключает случаи лёгкой корректуры, что делает оценку консервативной.

На этом фоне логичным выглядит недавний шаг Anthropic по введению глобальной маркировки контента, созданного Claude. Однако, на мой взгляд, это лишь вершина айсберга. Мы движемся к миру, где верификация происхождения информации станет не менее важной, чем её содержание. Рынку нужны новые стандарты аутентичности, иначе доверие к вебу как источнику знаний будет стремительно эрозировать.