ИИ-индустрия скупает книги и лица: почему машинам всё ещё нужен человек

Сервис ISBNdb, владеющий метаданными 113 млн изданий, предложил ИИ-лабораториям необычную услугу: оптовую закупку книг партиями до миллиона экземпляров с последующей оцифровкой и утилизацией. После того как схема попала в поле зрения журналистов, компания поспешно удалила промо-страницу и заявила, что никаких сделок не заключала, назвав это лишь «проверкой рыночного спроса».
Параллельно в индустрии набирает обороты другой тренд: платформы ActID и New Claw платят людям от $15 до $700 за право использовать их лица в ИИ-сериалах и рекламе. Разберёмся, почему нейросетям критически необходим «человеческий» контент и что такое коллапс модели.
Проклятие рекурсии
Термин «коллапс модели» описывает деградацию ИИ-системы, которая обучается на данных, сгенерированных другими нейросетями. С каждым циклом результаты становятся всё более усреднёнными и предсказуемыми, теряя связь с реальностью. Впервые этот феномен формализовала международная группа исследователей под руководством Ильи Шумайлова в мае 2023 года, опубликовав работу «Проклятие рекурсии».
Масштаб проблемы подтверждается цифрами: в апреле 2025 года аналитики Ahrefs проверили 900 000 новых страниц в поиске Google и выяснили, что более 74% материалов содержат признаки автогенерации. По оценке Epoch AI, весь пригодный для обучения текст в интернете может закончиться к 2026–2032 годам. Именно поэтому книги, изданные до 2022 года, становятся для ИИ-компаний золотой жилой — это один из немногих источников, гарантированно свободных от «синтетического мусора».
Книги под нож
Практика скупки и уничтожения печатных изданий уже вышла за пределы отдельных стартапов. В августе 2024 года трое американских авторов подали коллективный иск против Anthropic, обвинив компанию в нарушении авторских прав. Выяснилось, что корпорация вложила десятки миллионов долларов в «неофициальный» проект Panama: скупала тиражи, срезала переплёты гидравлическими ножами и сканировала книги в промышленных масштабах. В июне 2025 года судья Уильям Алсуп постановил, что такая оцифровка подпадает под доктрину добросовестного использования.
ISBNdb, работавшая более двух десятилетий как крупнейшая база метаданных, предложила ИИ-лабораториям услуги оптового брокера: выкуп книг партиями от 1000 до 1 млн экземпляров, гарантии «чистоты» от ИИ-слопа и юридическую защиту через NDA. Руководство площадки прямо заявляло: «ИИ-компания уничтожила два миллиона книг — это не тот заголовок, который вызовет симпатию у общества». Букинисты подтвердили аномальные закупки с апреля 2026 года — продажи одного из торговцев выросли с двадцати экземпляров до нескольких сотен в неделю.
Разрыв между стоимостью сырья и готового продукта поражает: книга, уничтожаемая сразу после сканирования, стоит на вторичном рынке от $2 до $5, а модель, обученная на миллионах таких экземпляров, оценивается в миллиарды долларов.
Аренда лиц
В Китае рынок ИИ-контента растёт стремительно: более 95% из 128 000 ИИ-минидорам, выпущенных за первые три месяца 2026 года, созданы с использованием искусственного интеллекта. Платформы вроде ActID и New Claw устроены как маркетплейсы: компании платят людям от $15 до $700 за лицензирование их изображения. Пользователи загружают фото, сделанные в специальных студиях, а продюсеры выбирают лица по категориям вроде «соседская девушка» или «брутальный».
Однако контроль над собственной внешностью оказывается хрупким. Британские граждане, продавшие права на цифровые аватары стартапу Synthesia, обнаружили свои лица в пропагандистских роликах, связанных с правительством Николаса Мадуро и диктатором Буркина-Фасо Ибрагимом Траоре. Пекинский адвокат Иле Дэн отмечает: условия лицензирования часто настолько размыты, что невозможно понять, кто и как будет использовать внешность в итоге.
Не забудьте квитанцию
Схема везде одинакова: тексты, лица, голоса, движения — всё это становится сырьём для ИИ. Раньше данные брали без спроса, теперь за них платят. Но структура сделки не меняется: актив безвозвратно уходит из-под контроля владельца, просто теперь с квитанцией.
Мой вывод: Мы наблюдаем формирование нового класса активов — «человеческих данных», — где стоимость определяется не содержанием, а пригодностью для обучения. Пока ИИ-индустрия зависит от «органического» контента, эта зависимость будет только усиливаться. Но как только модели научатся самогенерировать качественные данные без коллапса, ценность человеческого вклада может стремительно обнулиться. Вопрос лишь в том, успеет ли правовое поле адаптироваться раньше, чем мы окончательно потеряем контроль над собственной цифровой сущностью.