Масштаб проникновения генеративных нейросетей в веб-пространство оказался куда значительнее, чем принято считать. Мой анализ свежих данных показывает: примерно каждая десятая веб-страница в интернете несет на себе явные следы машинной генерации или глубокой редактуры. Однако это лишь верхушка айсберга — если рассматривать только контент, опубликованный после дебюта ChatGPT в ноябре 2022 года, картина становится по-настоящему тревожной: уже более 33% таких страниц демонстрируют признаки синтетического происхождения.
Методология и масштаб явления
В основе этих выводов лежит анализ репрезентативной выборки из 10 000 англоязычных страниц, собранных в июле 2026 года. Для идентификации использовалась модель машинного обучения, настроенная на выявление специфических лингвистических паттернов, характерных для современных LLM. Важно понимать: в общую статистику попал и «старый» веб, созданный задолго до эры генеративного ИИ, что и объясняет относительно скромные 10% в абсолютных цифрах.
Динамика очевидна: рост доли синтетики напрямую коррелирует с экспансией ChatGPT, Claude, Gemini и их аналогов. Чем шире внедряются эти инструменты, тем больше контента они производят.
Где ИИ чувствует себя вольготно?
Распределение машинного текста по доменным зонам крайне неравномерно и показательно. Лидирует коммерческий сектор (.com) — около 10% страниц. Это вдвое выше, чем в некоммерческой зоне .org (4,6%). А вот образовательные (.edu) и государственные (.gov) ресурсы демонстрируют почти полную «чистоту» — лишь около 1% синтетики.
Такая поляризация объяснима: коммерческий веб заточен под объемы и SEO. Описания товаров, справочные статьи, новостные ленты — все это идеальный полигон для автоматизации. В то время как академическая и государственная сферы предъявляют более высокие требования к авторству и верификации, что сдерживает бездумное использование нейросетей.
Важные оговорки
Следует подчеркнуть: речь идет не о точном подсчете, а о вероятностной оценке. Методология не предполагает проверки истории правок или опроса авторов. Анализ опирается на статистические языковые маркеры, которые могут быть как явным признаком генерации, так и результатом стилизации. Кроме того, в категорию «написанного или существенно отредактированного» не попадает легкая корректура текста человеком.
Мой комментарий: Мы стоим на пороге фундаментального сдвига. Веб стремительно превращается в среду, где синтетический контент становится нормой, а не исключением. Это ставит под вопрос не только достоверность информации, но и саму экономику контента: поисковые алгоритмы и рекламные сети уже не справляются с фильтрацией мусора. Инициативы по маркировке, подобные той, что внедрила Anthropic, — это лишь первый, робкий шаг. Без глобальных стандартов верификации и идентификации мы рискуем утонуть в море правдоподобной, но бессмысленной информации, где человеческий голос будет окончательно заглушен машинами.