Масштаб проникновения генеративных нейросетей в веб-пространство оказался значительно глубже, чем принято считать. Мой анализ свежих данных показывает: примерно каждая десятая веб-страница в интернете несет следы синтетического авторства. Однако если смотреть на контент, опубликованный после запуска ChatGPT, ситуация выглядит куда более радикально — более трети таких страниц демонстрируют явные признаки генерации или существенного редактирования искусственным интеллектом.
Методология и ключевые цифры
В ходе исследования была проанализирована случайная выборка из 10 000 англоязычных страниц, собранных в июле 2026 года. Для идентификации использовалась модель машинного обучения, обученная выявлять лингвистические паттерны, характерные для современных LLM. На первый взгляд, 10% от общего массива — цифра умеренная. Но не стоит забывать: в выборку попало огромное количество «старого» веба, созданного задолго до эры генеративного ИИ.
Если же отсечь наследие прошлого и сосредоточиться исключительно на материалах, опубликованных после ноября 2022 года, картина меняется драматически. Синтетические следы обнаруживаются более чем у трети новых страниц. Это прямое доказательство того, что ChatGPT, Claude, Gemini и их аналоги стали главными «авторами» современного контента.
Кто лидирует по генерации
Распределение синтетики по доменным зонам крайне неравномерно, и это отражает экономическую логику. В зоне .com признаки ИИ обнаруживаются у каждой десятой страницы (около 10%), что вдвое превышает показатели .org (4,6%). А вот образовательные (.edu) и правительственные (.gov) ресурсы демонстрируют лишь около 1% — в десять раз меньше.
Такая диспропорция объясняется природой контента. Коммерческий сектор заваливает сеть массовыми текстами: описаниями товаров, SEO-статьями и новостными заметками. Именно эти форматы проще всего автоматизировать. В начале бума ChatGPT разрыв между зонами был менее заметен, но сейчас рынок адаптировался к возможностям ИИ в полной мере.
Важные оговорки
Стоит подчеркнуть: исследование не утверждает, что каждый такой текст написан ботом. Методология основана на статистическом анализе языковых маркеров, а не на проверке истории создания файлов. Это скорее оценка вероятного авторства, а не точный подсчет. Кроме того, категория «написанного или отредактированного» ИИ подразумевает значительную обработку, а не просто использование автозамены или мелких правок.
Мой комментарий: Эти данные — тревожный звонок для рынка контента. Мы стоим на пороге инфляции информационного шума, где поисковики и агрегаторы захлебываются в синтетике. Отрасли нужны новые стандарты верификации и маркировки, иначе доверие к вебу как источнику знаний будет окончательно подорвано. Инициативы вроде маркировки контента от Anthropic — лишь первый шаг в правильном направлении, но индустрии предстоит пройти долгий путь.