หนังสือก่อนปี 2022 เป็นเป้าหมายสำคัญ เนื่องจากมีเนื้อหาที่เขียนโดยมนุษย์ก่อนยุคที่เนื้อหาที่สร้างโดย AI จะเพิ่มขึ้นอย่างมาก จึงถูกมองว่าเป็นข้อมูลฝึกที่ “สะอาด” กว่าข้อมูลออนไลน์ที่อาจปะปนกับข้อความที่สร้างโดย AI แล้ว
หนึ่งในเบาะแสที่ทำให้เรื่องนี้ถูกจับตามองมาจาก Pieter de Vries เจ้าของร้านหนังสือโบราณ De Vries & De Vries ในเมืองฮาร์เลม ประเทศเนเธอร์แลนด์
De Vries ได้รับอีเมลจากผู้หญิงที่แนะนำตัวว่า “Natalia” หรือ “Nataly” จากบริษัท 2077AI ซึ่งตั้งอยู่ในสิงคโปร์ อีเมลดังกล่าวแนบตารางรายชื่อหนังสือมากกว่า 3,000 ISBN ส่วนใหญ่เป็นหนังสือวิชาการเฉพาะทางและชื่อที่ไม่ใช่หนังสือขายดี พร้อมขอให้เขาช่วยจัดหา เตรียมใบเสนอราคา และประเมินค่าขนส่งไปยังจีน
เขาในตอนแรกคิดว่าอีเมลนี้อาจเป็นสแปมหรือฟิชชิง จึงไม่ได้ให้ความสนใจมากนัก แต่ภายหลังผู้สื่อข่าวที่กำลังตรวจสอบคำสั่งซื้อนี้ติดต่อมา ทำให้เขาทราบว่ารายการหนังสืออาจเกี่ยวข้องกับการฝึก AI
ร้านหนังสือมือสองในเนเธอร์แลนด์ เยอรมนี สวิตเซอร์แลนด์ และสเปน ก็รายงานว่าได้รับคำขอคล้ายกัน โดยมีข้อสงสัยว่าหนังสือเหล่านี้ถูกส่งต่อไปยังห้องปฏิบัติการ AI ในสหรัฐฯ
เอกสารศาลที่ถูกเปิดผนึกในคดีลิขสิทธิ์ Bartz v. Anthropic เผยว่า Anthropic เริ่มปฏิบัติการลับชื่อ Project Panama ในช่วงต้นปี 2024
บริษัทใช้เงิน หลายสิบล้านดอลลาร์ เพื่อซื้อหนังสือกระดาษหลายล้านเล่ม ก่อนตัดสัน สแกนทุกหน้า และทำลายต้นฉบับ เป้าหมายคือการสร้างคลังข้อมูลดิจิทัลส่วนตัวคุณภาพสูงสำหรับฝึกแชตบอต Claude
เอกสารวางแผนภายในปี 2024 ซึ่งถูกเปิดผนึกในเดือนมกราคม 2026 ระบุข้อความว่า:
“Project Panama คือความพยายามของเราในการสแกนหนังสือทุกเล่มในโลกแบบทำลายต้นฉบับ”
ข้อเสนอจากผู้ให้บริการและเอกสารในคดีระบุเป้าหมายการประมวลผลหนังสือสูงสุด 2 ล้านเล่มภายใน 6 เดือน ขณะที่เอกสารศาลมากกว่า 4,000 หน้าให้รายละเอียดเกี่ยวกับขอบเขตของโครงการ
เมื่อวันที่ 23 มิถุนายน 2025 ผู้พิพากษาศาลแขวงสหรัฐฯ William Alsup แห่งเขตนอร์เทิร์นดิสทริกต์ของรัฐแคลิฟอร์เนีย ตัดสินในคดี Bartz v. Anthropic ว่า การนำหนังสือที่ได้มาอย่างถูกกฎหมายไปฝึกโมเดล AI เป็นการใช้ที่ “เปลี่ยนแปลงสาระและวัตถุประสงค์อย่างยิ่ง” หรือ quintessentially transformative และเข้าข่าย fair use ตามกฎหมายลิขสิทธิ์สหรัฐฯ
หลักการสำคัญของคำตัดสินคือ หากบริษัท AI ซื้อสำเนาหนังสือมาอย่างถูกต้อง การแปลงหนังสือเหล่านั้นเป็นไฟล์ดิจิทัลเพื่อใช้ฝึกโมเดล รวมถึงการทำลายต้นฉบับหลังสแกน อาจได้รับความคุ้มครองตามหลัก fair use
อย่างไรก็ตาม ศาลไม่ได้ตัดสินในลักษณะเดียวกันกับสำเนาที่ได้มาจากการละเมิดลิขสิทธิ์ โดยระบุว่าการดาวน์โหลดหนังสือจากเว็บไซต์ละเมิดลิขสิทธิ์หรือ “ห้องสมุดเงา” ไม่ใช่ fair use
คำตัดสินนี้จึงไม่ได้หมายความว่าการใช้หนังสือมีลิขสิทธิ์เพื่อฝึก AI ทุกกรณีถูกกฎหมาย แต่เป็นคำวินิจฉัยที่ผูกกับข้อเท็จจริงและกรอบของคดีดังกล่าว โดยเฉพาะความแตกต่างระหว่างหนังสือที่ซื้อมาอย่างถูกต้องกับสำเนาที่ได้มาจากแหล่งละเมิด
ในเดือน กรกฎาคม 2026 ผู้พิพากษาศาลรัฐบาลกลางในซานฟรานซิสโกอนุมัติข้อตกลงยุติคดีแบบกลุ่มมูลค่า 1.5 พันล้านดอลลาร์ ในคดี Bartz v. Anthropic ซึ่งเริ่มต้นจากการฟ้องร้องของผู้เขียนหลายราย รวมถึง Andrea Bartz และ Charles Graeber
ข้อตกลงดังกล่าวเกิดขึ้นหลังคำตัดสินเดือนมิถุนายน 2025 ที่ยอมรับว่าการสแกนหนังสือซึ่ง Anthropic ซื้อมาอย่างถูกกฎหมายเข้าข่าย fair use แต่คดียังเกี่ยวข้องกับข้อกล่าวหาเรื่องการใช้สำเนาหนังสือจากแหล่งละเมิดลิขสิทธิ์ ซึ่งเป็นประเด็นทางกฎหมายที่แตกต่างกัน
เมื่อความต้องการข้อมูลฝึกเพิ่มขึ้น ก็เกิดตลาดรองสำหรับการจัดหาหนังสือจำนวนมากให้กับการฝึก LLM หรือโมเดลภาษาขนาดใหญ่ บริษัท AI รายใหญ่ใช้บริการคนกลางภายนอก รวมถึงบริษัทฐานข้อมูล ISBN อย่าง ISBNdb เพื่อสั่งซื้อหนังสือหลายแสนเล่มโดยไม่เปิดเผยชื่อผู้ซื้อปลายทาง
คำสั่งซื้อที่มีรูปแบบใกล้เคียงกันจากร้านหนังสือหลายประเทศในยุโรปสะท้อนห่วงโซ่อุปทานรูปแบบใหม่ หนังสือถูกซื้อรวมเป็นล็อต ส่งไปยังศูนย์รวบรวมหรือศูนย์ประมวลผล ซึ่งบางแห่งอยู่ในจีนหรือพื้นที่อื่น ก่อนเข้าสู่กระบวนการตัดสันและสแกน
การใช้คนกลางช่วยลดการเปิดเผยตัวตนของบริษัท AI และลดแรงกดดันด้านภาพลักษณ์จากการเก็บข้อมูลจำนวนมาก แต่ก็ทำให้เส้นทางของหนังสือและผู้รับผิดชอบปลายทางตรวจสอบได้ยากขึ้น
นักจดหมายเหตุ บรรณารักษ์ และผู้ค้าหนังสือหายากเตือนว่า หนังสือวิชาการหายากหรือหนังสือที่เลิกพิมพ์บางเล่มอาจเหลือสำเนากระดาษเพียงไม่กี่ฉบับ หากสำเนาเหล่านั้นถูกซื้อไปตัดสันและทำลาย ก็อาจไม่มีต้นฉบับเหลือให้คนรุ่นหลัง นักวิจัย หรือห้องสมุดเข้าถึงอีก
การสแกนแบบไม่ทำลาย เช่น ระบบ Treventus ScanRobot สามารถแปลงหนังสือที่เปราะบางเป็นดิจิทัลได้โดยไม่ต้องแยกเล่ม มีข้อมูลว่าระบบดังกล่าวสแกนได้สูงสุด 2,500 หน้าต่อชั่วโมง แต่กระบวนการแบบนี้ใช้เวลาและต้นทุนสูงกว่าเมื่อทำในระดับอุตสาหกรรม
ข้อแลกเปลี่ยนจึงชัดเจน: การตัดสันและทำลายหนังสือมีประสิทธิภาพและราคาถูกกว่าสำหรับงานปริมาณมหาศาล แต่สำหรับผลงานเฉพาะทางที่มีสำเนาเหลืออยู่เพียงหยิบมือ การสูญเสียทางกายภาพอาจเป็นความเสียหายทางวัฒนธรรมและวิชาการที่ย้อนคืนไม่ได้
ท้ายที่สุด ประเด็นนี้ไม่ได้มีเพียงคำถามว่า AI จะเรียนรู้จากหนังสือได้หรือไม่ แต่ยังรวมถึงคำถามว่า ใครเป็นเจ้าของข้อมูลที่ถูกแปลงเป็นดิจิทัล ใครควรรับผิดชอบต่อหนังสือที่ถูกทำลาย และการสร้างคลังความรู้ให้เครื่องจักรควรแลกมาด้วยการสูญเสียคลังความรู้ฉบับจริงหรือไม่