Depois, os livros são levados para instalações de processamento. Uma máquina hidráulica remove ou corta as lombadas, deixando as folhas soltas. As páginas passam por scanners de alta velocidade e, concluída a digitalização, o papel é triturado, transformado em polpa ou encaminhado para reciclagem .
O interesse por títulos publicados antes de 2022 está ligado à busca por textos escritos por humanos, anteriores à disseminação de conteúdo produzido por sistemas de IA. Para as empresas, esses livros podem oferecer material mais consistente e menos sujeito à chamada “poluição” por textos gerados artificialmente .
Um dos indícios que ajudaram a revelar esse mercado surgiu com Pieter de Vries, livreiro especializado em obras antigas da De Vries & De Vries, em Haarlem, nos Países Baixos.
De Vries recebeu um e-mail de uma pessoa que se identificava como “Natalia” ou “Nataly”, ligada à empresa 2077AI, de Singapura. A mensagem vinha acompanhada de uma planilha com mais de 3 mil ISBNs, em sua maioria de obras acadêmicas de nicho e títulos pouco conhecidos. O pedido era para localizar os livros, preparar cotações e estimar o custo de envio para a China .
O livreiro inicialmente descartou a mensagem, imaginando que se tratasse de spam ou tentativa de phishing. Pedidos semelhantes, porém, apareceram entre comerciantes de livros usados nos Países Baixos, na Alemanha, na Suíça e na Espanha. As encomendas passaram a ser associadas à cadeia de fornecimento de laboratórios de IA dos Estados Unidos .
Documentos judiciais liberados no processo de direitos autorais Bartz v. Anthropic mostram que a Anthropic começou, no início de 2024, uma operação sigilosa chamada Project Panama .
A empresa teria gastado dezenas de milhões de dólares para adquirir milhões de livros físicos. Os exemplares eram desmontados mecanicamente, página por página, digitalizados e destruídos. O objetivo era criar uma biblioteca digital privada, de alta qualidade, para treinar o Claude .
Um documento interno de planejamento, datado de 2024 e tornado público em janeiro de 2026, descrevia o projeto nos seguintes termos: “O Project Panama é nosso esforço para escanear destrutivamente todos os livros do mundo” .
Propostas de fornecedores indicavam uma capacidade de processamento de até 2 milhões de livros em seis meses . Mais de 4 mil páginas de documentos judiciais detalham diferentes aspectos da operação .
Em 23 de junho de 2025, o juiz distrital federal William Alsup, do Tribunal Distrital do Norte da Califórnia, decidiu no caso Bartz v. Anthropic que o uso de livros obtidos legalmente para treinar modelos de IA era “quintessencialmente transformador” e se enquadrava na doutrina do fair use, a exceção de uso justo prevista na legislação de direitos autorais dos Estados Unidos .
Na prática, a decisão considerou que a empresa poderia comprar legalmente exemplares impressos, convertê-los para um formato digital e usá-los no treinamento dos modelos. O tribunal também entendeu que a destruição dos exemplares comprados fazia parte dessa conversão permitida .
A decisão, entretanto, não deu carta branca para qualquer fonte de conteúdo. O juiz rejeitou o argumento de que cópias obtidas em sites de pirataria constituiriam uso justo. A criação e a manutenção de uma biblioteca baseada em cópias pirateadas permaneceram sujeitas a responsabilização .
É importante destacar que essa foi uma decisão baseada na legislação de direitos autorais dos Estados Unidos. Ela não estabelece automaticamente como a prática seria avaliada pela legislação brasileira ou por tribunais de outros países.
Em julho de 2026, um juiz federal de São Francisco aprovou um acordo de US$ 1,5 bilhão em uma ação coletiva movida por autores contra a Anthropic . Entre os autores estavam Andrea Bartz e Charles Graeber .
O acordo veio depois da decisão de junho de 2025. A sentença havia considerado legal, sob a doutrina americana de fair use, o treinamento com livros comprados legalmente, mas o processo também envolvia alegações relacionadas ao uso de material pirateado .
Por isso, a decisão não significou que todas as práticas atribuídas à empresa fossem consideradas legais. Ela separou o uso transformador de cópias adquiridas de forma legítima da obtenção e retenção de cópias não autorizadas.
O caso também expôs o crescimento de um mercado secundário voltado à aquisição de livros para o treinamento de LLMs, sigla em inglês para “modelos de linguagem de grande escala”.
Grandes empresas de IA passaram a recorrer a serviços intermediários, entre eles a empresa de banco de dados de ISBN ISBNdb, para fazer pedidos anônimos de centenas de milhares de exemplares. A intermediação dificulta a identificação do comprador final e reduz o impacto público da operação .
Livre iros europeus relataram receber pedidos semelhantes, muitas vezes para títulos obscuros e recentes. Os livros seriam enviados para centros de processamento — em alguns casos, na China ou em outros locais especializados — onde ocorreria a desmontagem e a digitalização .
A principal preocupação de arquivistas, bibliotecários e comerciantes de livros raros é que exemplares físicos únicos ou muito difíceis de encontrar estejam sendo destruídos permanentemente .
Existem métodos de digitalização não destrutivos, que preservam a encadernação e permitem escanear livros frágeis sem danificá-los. O Treventus ScanRobot, por exemplo, é citado como capaz de digitalizar até 2.500 páginas por hora sem destruir o material .
Essas alternativas, porém, tendem a ser mais lentas e caras em escala industrial. O corte das lombadas e a alimentação automática das folhas oferecem velocidade, mas eliminam o exemplar original .
Para obras acadêmicas obscuras, das quais podem restar apenas algumas cópias conhecidas, o problema vai além do desperdício físico. Se o último exemplar for transformado em dados e triturado, uma parte do patrimônio cultural e científico pode desaparecer de forma irreversível .