Расследование свидетельствует о масштабном, по крайней мере по характеру описанного процесса, конвейере закупки и оцифровки книг. Но оно не установило общее число обработанных экземпляров и не назвало конкретную модель Amazon, обученную на этих сканах.
Amazon сообщила 404 Media, что покупает книги «для улучшения своих продуктов». При этом компания, по данным издания, не раскрыла:
Эта оговорка важна. Расследование даёт операционные свидетельства: отслеженную посылку, конкретный объект Amazon, подразделение по обработке книг и рассказы работников о сканировании и уничтожении. Но это ещё не полное публичное признание того, что каждая обработанная книга становится частью обучающих данных конкретной модели Amazon.
Самый точный вывод звучит уже, но осторожнее: 404 Media обнаружило признаки операции Amazon по оцифровке книг, которая совместима со сбором данных для ИИ. Это происходит на фоне активных инвестиций Amazon в разработку передовых моделей и сервисы для работы с данными. Отдельно Reuters сообщало, что Amazon перестраивает ИИ-стратегию вокруг нового проекта по созданию передовой модели.
Продавцы рассказали 404 Media, что некоторые оптовые заказы выглядели необычно: партии были разнородными и, судя по всему, мало зависели от рыночной цены, состояния, тематики или перспектив перепродажи конкретной книги.
Обычный покупатель, ориентированный на перепродажу, должен учитывать спрос и маржу. Покупателю, которому важны данные для обучения ИИ, может быть выгоднее получить широкий набор названий и ISBN — международных идентификаторов книг.
Поэтому у продавцов возникло подозрение, что ИИ-компании или посредники по сбору данных пытаются охватить не отдельные коммерчески ценные издания, а как можно большую часть опубликованного книжного каталога. Ранее 404 Media писало, что ISBNdb рекламировала высокообъёмную закупку печатных книг для ИИ-компаний. После публикации материала компания удалила соответствующую информацию и заявила, что страница была «тестом интереса рынка».
Это не доказывает, что каждый необычный заказ связан с Amazon или искусственным интеллектом. Но объясняет, почему книжному рынку трудно интерпретировать такие закупки: случайный набор может быть бессмысленным с точки зрения розничной торговли и вполне логичным с точки зрения расширения датасета.
Печатные книги дают разработчикам ИИ то, что становится всё более востребованным: большие массивы человеческого текста, созданного до массового распространения генеративного ИИ. Старые и давно не переиздававшиеся работы могут содержать специализированные, региональные, исторические и другие сведения, которые никогда не публиковались в интернете или плохо доступны в цифровом виде.
По этой причине книги могут представлять собой широкий корпус текста, с меньшей вероятностью состоящий из синтетического контента. В материалах 404 Media об ISBNdb старые книги описывались как ценный источник, в том числе потому, что они «свободны от ИИ-мусора» — так в публикации обозначалась тревога по поводу будущих датасетов, в которых будет всё больше текстов, созданных самими моделями.
Исследователи и разработчики также обсуждают «коллапс моделей» — возможную ситуацию, при которой многократное обучение на синтетических результатах снижает качество и разнообразие последующих моделей. Это объясняет интерес к старым текстам, написанным людьми, но не доказывает ни того, что модели Amazon уже столкнулись с коллапсом, ни того, что книги из Лас-Вегаса собирали именно по этой причине.
Описанный процесс Amazon напоминает Project Panama компании Anthropic. В рамках этой операции Anthropic покупала физические книги, снимала переплёты, сканировала страницы, а затем выбрасывала бумажные оригиналы, создавая цифровой материал для работы с ИИ.
В постановлении от 23 июня 2025 года по делу Bartz v. Anthropic судья Уильям Алсап пришёл к выводу, что использование книг для обучения Claude и его предшественников было «чрезвычайно трансформативным» и в рассмотренных обстоятельствах подпадало под доктрину добросовестного использования (fair use) в соответствии с американским законом об авторском праве. Суд также признал добросовестным использованием оцифровывание законно купленных печатных книг: Anthropic, по сути, заменила приобретённые физические экземпляры более удобными, компактными и доступными для поиска цифровыми копиями во внутренней библиотеке.
Это решение не означает, что уничтожение книги автоматически делает обучение ИИ законным. Существенны способ приобретения, цель использования, сохранение или распространение копий и другие обстоятельства. В том же процессе иначе оценивалось создание библиотеки из пиратских книг, полученных незаконным путём.
Для истории с Amazon это ключевое различие. Даже если книги покупаются законно, отдельно остаются вопросы масштаба операции, назначения сканов, договорённостей с авторами и издателями, а также сохранения редких физических произведений. Эти вопросы не решаются узким выводом суда по делу Bartz.
Возражения продавцов связаны не только с потерей выручки или компенсацией за авторские права. Редкие и давно не издающиеся книги могут иметь историческую, интеллектуальную, культурную и эмоциональную ценность. Когда дефицитный экземпляр разрезают и отправляют в переработку, текст может сохраниться в виде скана, но физический артефакт исчезает.
Это проблема сохранения наследия, на которую решение по авторскому праву не даёт полного ответа. Процесс может быть юридически допустимым при одном наборе обстоятельств и одновременно тревожить коллекционеров, продавцов, библиотеки и читателей, для которых книга — не просто контейнер текста.
Ситуация также показывает информационный разрыв. ИИ-компании могут понимать ценность малоизвестных книг для датасетов задолго до того, как отдельный продавец осознает: странный оптовый заказ — часть более широкой стратегии закупки. Публичная формулировка Amazon о покупке книг «для улучшения продуктов» оставляет без ответа самые практические вопросы книжного рынка: насколько масштабны закупки, что именно сканируют и что происходит с полученными файлами.
Предполагаемая операция вписывается в более широкий курс Amazon на конкуренцию в передовом ИИ. Reuters сообщало в июле 2026 года, что компания сворачивает многие собственные модели и концентрирует ресурсы на новом проекте по созданию передовой модели. Параллельно AWS продвигает Nova Forge — сервис, позволяющий сочетать собственные данные клиентов с подготовленными Amazon обучающими данными при разработке настраиваемых передовых моделей.
Эти факты объясняют, почему Amazon может быть заинтересована в высококачественных текстовых массивах, но сами по себе не доказывают, что книги, отслеженные 404 Media, использовались для обучения конкретной модели. Самые прямые свидетельства по-прежнему связаны с расследованием о маршруте посылки и объекте в Лас-Вегасе.
Главный вопрос теперь шире самой Amazon: не превращается ли рынок физических книг в невидимую цепочку поставок для ИИ? В одном документированном случае, описанном 404 Media, книги прошли путь от продавца до объекта Amazon, где их, по рассказам работников, сканировали и уничтожали. Полный масштаб операции и дальнейшая судьба цифровых материалов пока остаются неизвестными.