彼得·德·弗里斯是荷兰哈勒姆De Vries & De Vries古籍书店的书商。他收到了一封自称“娜塔莉亚”(或“娜塔莉”)的人发来的邮件,对方来自一家名为2077AI的新加坡公司。邮件附有一份超过3000个ISBN号的清单——大部分是冷门学术著作和晦涩难懂的书籍——要求他提供这些书、准备报价并估算运往中国的运费。德·弗里斯起初以为是垃圾邮件或钓鱼信息。类似请求也出现在荷兰、德国、瑞士和西班牙的旧书商面前,这些订单被怀疑最终都汇集到了美国的AI实验室。
来自Bartz诉Anthropic版权诉讼的解密法庭文件揭露,Anthropic自2024年初起运行了一个代号为**“巴拿马项目”的秘密行动。该公司花费数千万美元**购买数百万册实体书,用机械切掉书脊,逐页扫描,然后销毁原书——所有这一切都是为了为其Claude聊天机器人建立一个私有的高质量训练语料库。
一份注明日期为2024年的内部规划文件,在2026年1月解密后写道:“‘巴拿马项目’是我们以破坏性方式扫描世界上所有书籍的努力”。其目标是在六个月内处理高达200万册图书。超过4000页的法庭文件详细记录了该行动的方方面面。
2025年6月23日,美国加州北区联邦地区法院的威廉·阿尔苏普法官在Bartz诉Anthropic案中裁定,使用合法购买的书籍训练AI模型是**“典型的转换性使用”,符合美国版权法中的“合理使用”**原则。其核心原则是:只要AI公司合法获取了副本(即购买),那么将其扫描并销毁用于训练就是允许的。不过,法官驳回了关于盗版副本的即决判决——认定从盗版网站下载不属于合理使用。
2026年7月,旧金山一名联邦法官批准了Bartz诉Anthropic集体诉讼中达成的15亿美元和解协议。该诉讼由作家安德里亚·巴茨、查尔斯·格雷伯等人两年前对Anthropic提起。该和解发生在2025年6月的“合理使用”裁决之后——在法院已确认其核心做法(扫描合法购买的书籍)合法后,Anthropic同意支付赔偿,但该案也涉及盗版材料的相关指控。
一个蓬勃发展的二级市场已经出现,专门为大型语言模型训练进行批量图书采购。主要的AI提供商利用第三方中介服务——包括ISBN数据库公司ISBNdb——来匿名下单数十万册图书,从而隐藏最终买家的身份。欧洲各地的书商都报告收到了近乎相同的批量购买询价。这些购买来的书籍被运往(有时在中国或其他处理中心)进行毁灭性扫描的枢纽。
档案学家、图书馆员和古籍书商发出警报,稀有的绝版学术文本的最后一批实体副本正在被永久销毁。与“非破坏性数字化”(例如,能每小时无损伤数字化2500页脆弱书籍的Treventus ScanRobot)不同,工业级粉碎成本更低——但这也意味着一旦某本书被处理,就没有实体副本留存了。对于那些仅存少量已知副本的冷门小众著作来说,这代表着不可逆转的文化和学术损失。