На производственной линии гидравлический резак срезает корешок книги. Отдельные страницы затем подаются в промышленный сканер, а бумажные остатки уничтожаются или отправляются на переработку . После завершения процесса физического экземпляра не остаётся.
Особый интерес представляют книги, изданные до 2022 года. Предполагается, что в них содержится написанный людьми текст, ещё не смешанный с массово распространяемым контентом, созданным предыдущими поколениями ИИ . Для разработчиков это более предсказуемый и качественный материал, чем случайные тексты из открытого интернета.
Одним из первых тревожных сигналов для книжного рынка стало письмо, которое получил Питер де Фрис — антикварный продавец из магазина De Vries & De Vries в нидерландском Харлеме.
Отправительница, представившаяся Наталией или Натали, заявила, что работает в сингапурской компании 2077AI. К письму прилагалась таблица с более чем 3 000 ISBN: в списке были преимущественно узкоспециализированные академические и малоизвестные книги. Де Фриса просили найти издания, подготовить коммерческое предложение и оценить стоимость доставки в Китай .
Сначала букинист решил, что это спам или попытка фишинга. Позднее похожие запросы начали получать продавцы подержанных книг в Нидерландах, Германии, Швейцарии и Испании. Они предположили, что книги могут через цепочку посредников направляться американским AI-лабораториям .
Рассекреченные материалы дела Bartz v. Anthropic показали, что Anthropic начала Project Panama в начале 2024 года . Компания потратила десятки миллионов долларов, чтобы приобрести миллионы бумажных книг, механически снять с них переплёты, отсканировать каждую страницу и уничтожить оригиналы. Целью было создание закрытой, высококачественной коллекции текстов для обучения Claude .
Во внутреннем документе, датированном 2024 годом и опубликованном в январе 2026 года, масштаб замысла сформулирован предельно прямо: «Project Panama — это наша попытка разрушающим способом отсканировать все книги в мире» .
В предложениях подрядчиков фигурировала возможность обработать от 500 000 до 2 миллионов книг примерно за шесть месяцев . Более 4 000 страниц судебных материалов подробно описывают различные стороны этой операции .
23 июня 2025 года судья Уильям Алсап из окружного суда США по Северному округу Калифорнии вынес важное решение по делу Bartz v. Anthropic. Он постановил, что использование законно приобретённых книг для обучения ИИ является «исключительно трансформативным» и подпадает под доктрину fair use — добросовестного использования в американском авторском праве .
Практический смысл решения таков: если компания получила экземпляр законным путём, например купила его, то перевод книги в цифровую форму и последующее уничтожение бумажного оригинала для обучения модели может быть допустимым .
Однако это решение не стало полной индульгенцией для всех способов получения данных. Суд отказался признать добросовестным использованием скачивание книг с пиратских ресурсов и создание библиотеки из таких копий . Иными словами, законная покупка бумажного экземпляра и пиратское получение цифровой копии получили принципиально разную правовую оценку.
В июле 2026 года федеральный суд в Сан-Франциско утвердил соглашение на 1,5 млрд долларов по коллективному иску авторов к Anthropic . Среди истцов были Андреа Барц, Чарльз Грэбер и другие писатели .
Сумма связана не с тем, что суд признал незаконным само сканирование легально купленных книг. Напротив, это базовое направление деятельности Anthropic суд ранее счёл допустимым. Спор также включал претензии по поводу пиратских материалов, которые компания хранила и использовала .
Вокруг спроса на данные для больших языковых моделей, или LLM, сформировался отдельный рынок оптовой закупки книг. Крупные AI-провайдеры используют сторонние сервисы и посреднические компании, в том числе базу ISBNdb, чтобы размещать анонимные заказы на сотни тысяч изданий и не раскрывать личность конечного покупателя .
Продавцы в разных европейских странах сообщают о практически одинаковых запросах на большие партии узкопрофильных книг. После закупки издания отправляются в логистические или перерабатывающие центры — иногда в Китай, — где их разбирают и сканируют .
Для книжной торговли это необычная модель: книги покупают не для чтения, коллекционирования или пополнения библиотеки, а как временный физический носитель данных. Ценность экземпляра заканчивается после того, как последняя страница попадает в цифровой архив.
Архивисты, библиотекари и продавцы редких книг опасаются, что вместе с массовым сбором данных исчезают последние физические экземпляры редких и не переиздававшихся академических работ .
Существуют и неразрушающие способы оцифровки. Например, специальные книжные сканеры вроде Treventus ScanRobot могут обрабатывать хрупкие издания, не повреждая их, — заявленная скорость достигает 2 500 страниц в час . Но на промышленном масштабе разрезание книг обходится дешевле и позволяет работать быстрее .
Именно здесь возникает ключевая проблема. Цифровая копия может сохранить содержание для модели, но не заменяет сам исторический объект: его переплёт, типографские особенности, пометки владельцев и физическое присутствие в архиве. Если у узкоспециализированной работы осталось всего несколько известных экземпляров, уничтожение одного из них становится необратимой культурной и научной потерей .