ИИ-индустрия скупает книги и лица: почему машинам всё ещё нужны люди

Пока ИИ-лаборатории отчитываются о прогрессе в обучении моделей, на заднем плане разворачивается гонка за ресурсом, который невозможно синтезировать. Речь о «чистых» данных, созданных человеком. И спрос на них принимает всё более причудливые формы — от оптовой скупки печатных книг с последующей утилизацией до аренды человеческих лиц для цифровых аватаров.
Сервис ISBNdb, владеющий метаданными 113 млн изданий, предложил ИИ-компаниям специфическую услугу: закупку книг партиями до миллиона экземпляров с последующей оцифровкой. Когда схема стала достоянием общественности, компания поспешила удалить промо-страницу и заявила, что речь шла лишь о «проверке рыночного спроса». В параллельном сегменте платформы ActID и New Claw уже платят людям от $15 до $700 за право использовать их лица как основу для персонажей ИИ-сериалов.
Коллапс модели: когда ИИ начинает пожирать сам себя
Феномен, известный как «коллапс модели», — это деградация ИИ-системы, которая обучается на данных, сгенерированных другими нейросетями. С каждым циклом результат становится всё более усреднённым и теряет связь с реальностью. Термин формализовала международная группа исследователей под руководством Ильи Шумайлова в мае 2023 года, математически доказав, что при подмешивании синтетических данных модели сначала теряют способность воспроизводить редкие события, а затем накапливают ошибки.
Масштаб проблемы очевиден. В апреле 2025 года исследователи Ahrefs проверили 900 000 вновь индексируемых страниц в Google — более 74% имели признаки автогенерации. По оценке Epoch AI, весь пригодный для обучения текст в интернете может закончиться к 2032 году. Поэтому книги, изданные до 2022 года, стали золотым активом: они гарантированно свободны от синтетического мусора и «отравленных» данных.
Отдельно стоит отметить судебный прецедент июня 2025 года, когда судья Уильям Алсуп постановил, что оцифровка законно приобретённых печатных книг для обучения языковых моделей подпадает под доктрину добросовестного использования. Это решение открыло шлюзы: теперь достаточно сохранить чек на бумажную книгу, чтобы документально подтвердить происхождение данных.
Лица как товар: новая экономика цифровых аватаров
Рынок ИИ-контента в Китае демонстрирует взрывной рост. Более 95% из 128 000 ИИ-минидорам, выпущенных за первые три месяца 2026 года, созданы с использованием искусственного интеллекта. Платформы вроде ActID и New Claw превратили аренду внешности в полноценный бизнес: от $15 до $700 за лицензирование изображения, с комиссией платформы в 10%.
Однако контроль над использованием цифровых клонов остаётся хрупким. Показательны случаи британских граждан, продавших права на свои аватары стартапу Synthesia, чьи цифровые двойники затем «снялись» в пропагандистских роликах, поддерживающих диктаторов Венесуэлы и Буркина-Фасо. Профсоюз Equity уже добивается законодательного запрета на передачу неконтролируемых прав на цифровую внешность.
Схема везде одинакова: тексты, лица, голоса, движения — всё это становится сырьём для ИИ. Раньше данные брали без спроса, теперь за них платят. Но суть сделки не меняется: актив безвозвратно уходит из-под контроля владельца, просто теперь с квитанцией.
Мой комментарий: Индустрия ИИ стоит перед фундаментальным парадоксом: чем больше моделей обучается на синтетических данных, тем быстрее они деградируют, и тем ценнее становятся «человеческие» данные. Но рынок этих данных стихийный и юридически незрелый. Пока не будет создана прозрачная система лицензирования с чёткими ограничениями контекста использования, мы будем наблюдать всё новые скандалы с утратой контроля над цифровыми копиями личности. Это системный риск, который индустрия предпочитает игнорировать.