Новости криптомира

08.08.2026
04:52

ИИ-индустрия скупает книги и лица: почему нейросетям нужна «органика» и что будет дальше

img-bbaf321c89b70f44-1766402574726061

Сервис ISBNdb, который объединяет метаданные 113 миллионов изданий, предложил ИИ-компаниям специфическую услугу: закупку книг партиями до миллиона штук с последующей оцифровкой и утилизацией. Когда эта схема стала достоянием общественности, компания поспешила удалить страницу с описанием услуги и заявила, что никаких сделок не заключала, назвав это лишь «проверкой рыночного спроса».

В другом сегменте рынка платформы ActID и New Claw готовы платить людям от $15 до $700 за право использовать их лица как основу для персонажей ИИ-сериалов и рекламы.

Разберемся, почему лаборатории вынуждены скупать «органику», что такое «коллапс модели» и какие еще человеческие ресурсы понадобятся машинам.

Уроборос: когда ИИ пожирает сам себя

Термин «коллапс модели» описывает деградацию ИИ-системы по мере обучения на данных, сгенерированных другими нейросетями. С каждым циклом результат становится более усредненным, предсказуемым и теряет связь с реальностью, которую большая языковая модель должна отражать.

Впервые этот термин формализовала международная группа исследователей под руководством Ильи Шумайлова. В мае 2023 года они опубликовали резонансную работу «Проклятие рекурсии: обучение на сгенерированных данных заставляет модели забывать», где математически доказали: при регулярном подмешивании синтетических данных модели перестают корректно воспроизводить информацию о редких событиях, а затем начинают накапливать ошибки.

Масштаб проблемы подтверждают цифры. В апреле 2025 года исследователи Ahrefs проверили 900 000 вновь индексируемых страниц в поиске Google — доля материалов с признаками автогенерации превысила 74%. По оценке Epoch AI, весь пригодный для обучения текст в интернете может закончиться в период между 2026 и 2032 годами.

Именно поэтому книги, изданные до 2022 года, обладают особой ценностью — это один из немногих источников, гарантированно свободных от машинного мусора и намеренных «ловушек». Некоторые авторы уже прибегли к встречной мере — «отравлению» данных, пряча в тексте символы, которые модель интерпретирует как скрытую команду. Исследование совместной команды Британского института безопасности ИИ, Anthropic и Оксфорда доказало: LLM можно незаметно обучить вредоносным паттернам с помощью всего 250 «отравленных» документов.

451 градус по Антропику

Судьба книг в этой гонке очевидна не для всех продавцов. В августе 2024 года три известных американских автора подали коллективный иск против Anthropic, обвинив руководство в нарушении авторских прав при обучении моделей Claude. Согласно материалам дела, компания вложила десятки миллионов долларов в «неофициальный» проект Panama: анонимно скупала тиражи печатных книг, срезала переплеты и сканировала их в промышленных масштабах с последующей утилизацией.

В июне 2025 года судья Уильям Алсуп постановил: оцифровка законно приобретенных печатных книг и использование цифровых копий для обучения языковых моделей подпадает под доктрину добросовестного использования. Теперь достаточно купить бумажную книгу и сохранить чек — происхождение данных подтверждено документально.

По информации 404 Media, эта практика давно вышла за пределы отдельных стартапов. ISBNdb, работающая более двух десятилетий как крупнейшая международная база метаданных печатных книг, превратила скупку и уничтожение книг в сервис под ключ. 21 июля 2026 года журналист Эмануэль Майберг обнаружил промо-раздел, где компания предлагала ИИ-лабораториям услуги оптового брокера:

  • организацию выкупа печатных книг до 2022 года партиями от 1000 до 1 млн экземпляров;
  • гарантии «чистоты» книг от ИИ-слопа и алгоритмов отравления;
  • юридическую защиту через соглашения о неразглашении и законность приобретения на вторичном рынке.

Руководство площадки прямо заявляло: «Проблема восприятия реальна. „ИИ-компания уничтожила два миллиона книг“ — это не тот заголовок, который вызовет симпатию у общества».

Независимые букинисты подтвердили аномальные закупки с апреля 2026 года: продажи выросли с двадцати экземпляров до нескольких сотен за неделю. Закупщиков не интересовал жанр или ценность — главным критерием был код ISBN. Приобретали даже редкие иностранные издания, игнорируя стоимость. Уникальные экземпляры теряются безвозвратно — единственный оставшийся экземпляр может закончить свой путь под сканером.

После публикации расследования ISBNdb удалила промо-страницу и выпустила заявление: «Факты: ISBNdb никогда не покупала, не сканировала и не продавала книги. Эта страница была лишь тестом на рыночный спрос».

Разрыв между стоимостью сырья и готового продукта трудно назвать пропорциональным. Книга, уничтожаемая сразу после сканирования, стоит на вторичном рынке от $2 до $5. Модель, обученная на миллионах таких экземпляров, оценивается в миллиарды долларов.

Нужно больше: рынок лиц и голосов

За последние три года Интернет-суд Гуанчжоу рассмотрел около 700 дел о незаконном использовании чужой внешности с помощью ИИ. В марте 2026 года пекинский суд вынес беспрецедентное решение: использование чужой внешности в дипфейках без разрешения незаконно, даже если изображение было модифицировано.

Эта практика отражает рост рынка ИИ-контента. В Китае более 95% из 128 000 ИИ-минидорам, выпущенных за первые три месяца 2026 года, были произведены с использованием искусственного интеллекта. Спрос на живые лица породил новый вид сделки — аренду внешности. Платформы ActID и New Claw устроены как маркетплейс: компании платят от $15 до $700 за лицензирование изображения. Пользователи загружают фото, сделанные в специальных студиях, а продюсеры выбирают лица по полу, возрасту и категориям вроде «соседская девушка» или «брутальный».

Руководитель отдела операций New Claw Лонг Лю объяснил логику просто: «Продажа прав на использование фото дает людям возможность зарабатывать, продолжая офлайн-карьеру». ActID, основанная в Шэньчжэне в марте 2026 года, зарегистрировала около 800 пользователей, из которых 300 согласились лицензировать изображения. Цена варьируется от $15 до $74 за эпизод при комиссии платформы в 10%.

Заявленная цель платформ — защитить людей от того, что произошло с площадкой ИИ-дорам Hongguo, принадлежащей ByteDance. В апреле 2026 года двое инфлюенсеров обвинили компанию в краже лиц. Сериал с 40 млн просмотров пришлось удалить. С начала 2026 года ByteDance уничтожила свыше 85 000 роликов с несанкционированным использованием чужих лиц и голосов.

Пекинский адвокат Иле Дэн считает рынок лицензирования позитивным шагом, но предупреждает: «Многие агентства платят людям считанные десятки долларов за сбор данных. Условия лицензирования часто настолько размыты, что невозможно понять, кто и для чего в итоге использует эту внешность».

На практике контроль оказался хрупким. Люди, продавшие лицензию на лицо, столкнулись с тем, что их цифровые клоны использовались в недобросовестной рекламе или политической пропаганде. Два резонансных случая произошли с британцами, продавшими права на аватары стартапу Synthesia: актер Дэн Дьюхерст обнаружил, что его «клон» стал ведущим фейкового новостного канала, связанного с правительством Николаса Мадуро, а модель Марк Торрес — что его образ использовали в пропагандистских роликах, поддерживающих диктатора Буркина-Фасо. Оба случая стали прецедентами для британского профсоюза актеров Equity, который добивается законодательного запрета на передачу неконтролируемых прав на цифровую внешность.

Не забудьте квитанцию

Книги и лица — не все, что нужно ИИ-компаниям. На рынке голосовых данных складывается похожая ситуация: в июне 2026 года участники профсоюза SAG-AFTRA ратифицировали соглашение, расширяющее защиту от использования синтетических копий голоса без согласия.

Роботам нужны примеры естественных движений. Современные симуляции физики недостаточно точно воспроизводят, как рука обхватывает кружку, поэтому синтетические данные для роботов сталкиваются с проблемой, похожей на коллапс моделей. По данным MIT, в 2025 году в разработку гуманоидов вложили более $6 млрд, а Tesla платит до $48 в час людям, которые часами в костюме захвата движения повторяют рутинные действия для обучения машин Optimus.

Если вынести за скобки разницу в носителе — тексты, лица, голоса, движения, — схема везде одна и та же. Раньше данные брали без спроса: сканировали архивы, скрейпили фотографии. Теперь за это платят. Только структура сделки не меняется: актив все так же безвозвратно уходит из-под контроля владельца, просто теперь с квитанцией.

Книги и человеческая внешность кажутся разными категориями, но для ИИ-индустрии это один тип ресурса — данные для обучения. Компании готовы покупать, но рынок устроен так, что защиты сделка не предполагает. После передачи прав человек не может полностью контролировать, кто и как будет использовать его голос, лицо или созданный контент.

Мой вывод: мы наблюдаем фундаментальный сдвиг в экономике данных. ИИ-индустрия, достигнув потолка «бесплатного» контента, теперь вынуждена платить за органические данные, но делает это без прозрачных механизмов защиты прав. Пока суды и профсоюзы догоняют реальность, рынок будет оставаться «диким Западом», где цена вопроса — не только деньги, но и контроль над собственной идентичностью.