ИИ-индустрия скупает книги и лица: почему машинам всё ещё нужен человек

Сервис ISBNdb, агрегирующий метаданные 113 млн печатных изданий, предложил ИИ-лабораториям необычную услугу: закупку книг партиями до миллиона экземпляров с последующей оцифровкой и утилизацией. После того как схема попала в поле зрения журналистов, компания поспешно удалила страницу с описанием и заявила, что речь шла лишь о «проверке рыночного спроса», а никаких сделок не заключалось.
Параллельно в другом сегменте платформы вроде ActID и New Claw предлагают людям от $15 до $700 за лицензирование их лиц для ИИ-персонажей в сериалах и рекламе. Разберёмся, почему лаборатории вынуждены охотиться за «органикой» и что ещё человеческого потребуется машинам.
Проклятие синтетики
Термин «коллапс модели» описывает деградацию ИИ-системы, которая обучается на данных, сгенерированных другими нейросетями. С каждым циклом результаты становятся всё более усреднёнными, предсказуемыми и теряют связь с реальностью, которую LLM должна отражать. Впервые этот феномен формализовала международная группа исследователей под руководством Ильи Шумайлова в мае 2023 года, опубликовав работу «Проклятие рекурсии» в Nature. Они математически доказали: при регулярном подмешивании синтетики модель сначала забывает редкие события и тонкие закономерности, а затем накапливает ошибки и снижает разнообразие ответов.
Масштаб проблемы подтверждают цифры. В апреле 2025 года аналитики Ahrefs проверили 900 000 новых страниц в поиске Google и обнаружили, что более 74% контента имеет признаки автогенерации. По оценке Epoch AI, весь пригодный для обучения текст в интернете может закончиться к 2026–2032 годам. Книги, изданные до 2022 года, становятся для ИИ-компаний одним из немногих источников, гарантированно свободных от синтетического мусора и встроенных ловушек. Некоторые авторы даже прибегают к «отравлению» данных, пряча в тексте скрытые команды. Исследование британского Института безопасности ИИ, Anthropic и Оксфорда показало: LLM можно незаметно обучить вредоносным паттернам с помощью всего 250 «отравленных» документов.
Книги под нож
В августе 2024 года три американских автора подали коллективный иск против Anthropic, обвинив компанию в нарушении авторских прав при обучении моделей Claude. Согласно материалам дела, Anthropic вложила десятки миллионов долларов в проект Panama: анонимно скупала тиражи печатных книг, срезала переплёты и сканировала их в промышленных масштабах с последующей утилизацией. В июне 2025 года судья Уильям Алсуп постановил, что оцифровка законно приобретённых книг для обучения языковых моделей подпадает под доктрину добросовестного использования. Теперь достаточно сохранить чек — и происхождение данных подтверждено документально.
Эта практика уже вышла за пределы отдельных стартапов. ISBNdb, работающая более двух десятилетий как крупнейшая база метаданных печатных книг, превратила скупку и уничтожение тиражей в сервис под ключ. 21 июля 2026 года журналист Эмануэль Майберг обнаружил на сайте компании промо-раздел с предложением для ИИ-лабораторий:
- выкуп книг до 2022 года выпуска партиями от 1000 до 1 млн экземпляров;
- гарантии «чистоты» от ИИ-слопа и алгоритмов отравления;
- юридическую защиту через NDA и легальность закупок на вторичном рынке.
Руководство площадки прямо заявляло: «Проблема восприятия реальна. „ИИ-компания уничтожила два миллиона книг“ — это не тот заголовок, который вызовет симпатию у общества». Опрос независимых букинистов подтвердил аномальные закупки с апреля 2026 года: продажи одного из торговцев выросли с двадцати экземпляров до нескольких сотен в неделю. Покупателей не интересовали ни жанр, ни ценность — только наличие ISBN. Уникальные издания при этом теряются безвозвратно, отправляясь под сканер вместо книжной полки.
После публикации расследования ISBNdb удалила промо-страницу и выпустила заявление, отрицая какие-либо сделки. Однако разрыв между стоимостью сырья и готового продукта красноречив: книга за $2–5 на вторичном рынке превращается в модель, оцениваемую в миллиарды долларов.
Лица как товар
В Китае за последние три года суды рассмотрели около 700 дел о незаконном использовании внешности с помощью ИИ. В марте 2026 года пекинский суд вынес беспрецедентное решение: использование чужого лица в дипфейках без разрешения незаконно, даже если изображение модифицировано. Это отражает бум ИИ-контента: более 95% из 128 000 ИИ-минидорам, выпущенных за первые три месяца 2026 года, были созданы с помощью искусственного интеллекта. Платформы вроде ActID и New Claw устроены как маркетплейсы: компании платят людям от $15 до $700 за лицензирование изображения, а пользователи сами загружают фото, сделанные в специальных студиях. Категории — от «соседской девушки» до «брутального» и «супермодели».
Заявленная цель — защитить людей от того, что случилось с платформой Hongguo от ByteDance, когда двое инфлюенсеров обвинили компанию в краже лиц, и сериал с 40 млн просмотров пришлось удалить. С начала 2026 года ByteDance уничтожила свыше 85 000 роликов с несанкционированным использованием чужих лиц и голосов. Однако контроль остаётся хрупким. Британские граждане, продавшие права на свои аватары стартапу Synthesia, обнаружили, что их цифровые клоны использовались в пропагандистских роликах, поддерживающих диктаторов Венесуэлы и Буркина-Фасо. Профсоюз актёров Equity теперь добивается законодательного запрета на передачу неконтролируемых прав на цифровую внешность.
Не только книги и лица
Роботам нужны примеры естественных движений. Современные симуляции физики несовершенны, и синтетические данные для роботов сталкиваются с той же проблемой коллапса. В 2025 году в разработку гуманоидов вложили более $6 млрд, а компании вроде Scale AI и Encord нанимают операторов для записи бытовых движений. Tesla платит до $48 в час людям, которые в костюмах захвата движения повторяют рутинные действия для обучения Optimus.
Если отбросить разницу в носителе — тексты, лица, голоса, движения, — схема везде одна. Раньше данные брали без спроса: сканировали архивы, скрейпили фото, обучались на голосах из открытого доступа. Теперь за это платят. Но структура сделки не меняется: актив безвозвратно уходит из-под контроля владельца, просто теперь с квитанцией.
Мой комментарий: Мы наблюдаем фундаментальный сдвиг: ИИ-индустрия переходит от паразитического потребления данных к их легальной, но не менее хищнической закупке. Пока рынок не выработает механизмы долгосрочного контроля за использованием лицензированных активов, владельцы — будь то авторы или модели — остаются заложниками одной и той же сделки: разовый платёж против бессрочной потери контроля.