荷蘭哈勒姆的古董書商彼得·德弗里斯(Pieter de Vries)收到一封自稱「娜塔莉亞」(或「娜塔莉」)的女子來信,她任職於新加坡公司 2077AI。信件附上一份超過 3,000 個 ISBN 碼 的試算表,多為小眾學術與冷門書籍,要求他提供報價並估算運往中國的運費 。德弗里斯起初以為是垃圾郵件或釣魚詐騙。類似的要求也出現在荷蘭、德國、瑞士和西班牙的二手書商,他們懷疑這些訂單最終都流向美國的 AI 實驗室 。
在 Bartz v. Anthropic 版權訴訟中解密的法院文件顯示,Anthropic 自 2024 年初 起執行了一項名為 「巴拿馬計畫」 的祕密行動 。該公司花費 數千萬美元 購買數百萬本實體書,以機械方式切掉書脊、掃描每一頁,再銷毀原始書籍——一切都是為了為其 Claude 聊天機器人建立一個私人、高品質的訓練語料庫 。
一份 2024 年的內部規劃文件,於 2026 年 1 月解密,裡面寫道:「巴拿馬計畫是我們努力以破壞性方式掃描世界上所有書籍的行動。」 目標是在 六個月內 處理多達 200 萬本書 。超過 4,000 頁的法院文件詳細記錄了這項行動 。
2025 年 6 月 23 日,加州北區聯邦地方法院法官 威廉·阿爾蘇普(William Alsup)在 Bartz v. Anthropic 案中裁定,使用合法購入的書籍來訓練 AI 模型是 「本質上的轉變性使用」,構成美國版權法下的 合理使用 。核心原則:只要 AI 公司合法取得副本(購買),掃描並銷毀它們用於訓練是被允許的 。然而,法官否決了關於盜版副本的即決判決——認定從盜版網站下載並非合理使用 。
2026 年 7 月,舊金山聯邦法官批准了 Bartz v. Anthropic 集體訴訟案的 15 億美元和解金。該訴訟由作者(包括 Andrea Bartz、Charles Graeber 等人)於兩年前對 Anthropic 提起 。這項和解是在 2025 年 6 月的合理使用裁決之後達成的——雖然法院已確立其核心做法(掃描合法購入的書籍)是合法的,但案件中也涉及盜版素材的相關索賠 。
一個針對 LLM 訓練的大宗書籍採購 次級市場 已經興起。主要 AI 供應商利用 第三方中間服務——包括 ISBN 資料庫公司 ISBNdb——來匿名訂購數十萬本書籍,隱藏最終買家的身份 。歐洲各地的書商回報收到幾乎相同的批量採購查詢。這些書籍被運往樞紐站(有時在中國或其他處理中心)進行破壞性掃描 。
檔案管理員、圖書館員和珍本書商發出警報:稀有及絕版學術文本的最後實體版本正被永久銷毀 。與非破壞性數位化(例如 Treventus ScanRobot,可在不傷害書籍的情況下以每小時 2,500 頁的速度數位化脆弱書籍)不同,工業化絞碎在規模上更便宜——但這意味著一旦處理完一個書目,就再也沒有實體副本留存 。對於只有少數已知副本存在的冷門小眾作品,這代表著無法挽回的文化與學術損失 。