ويبدو أن جزءًا من الطلب يتركز على الكتب المنشورة قبل عام 2022، لأنها تحتوي على نصوص كتبها بشر قبل انتشار المحتوى المُنشأ بالذكاء الاصطناعي على نطاق واسع . وبالنسبة إلى شركات تطوير النماذج اللغوية الكبيرة، تمثل هذه الكتب مصدرًا منظمًا وعالي الجودة للبيانات، لا مجرد صفحات عشوائية جُمعت من الإنترنت.
كان بائع الكتب الهولندي القديم بيتر دي فريس من أوائل من لاحظوا نمطًا غير مألوف. فقد تلقى، عبر متجر De Vries & De Vries في مدينة هارلم، رسالة من شخص قدمت نفسها باسم «ناتاليا» أو «ناتالي» ويعمل لدى شركة سنغافورية تُدعى 2077AI.
أرفقت الرسالة جدولًا يضم أكثر من 3,000 رقم ISBN، معظمها لعناوين أكاديمية متخصصة وكتب غير رائجة، وطلبت منه البحث عنها وإعداد عروض أسعار وتقدير تكلفة شحنها إلى الصين . في البداية، ظن دي فريس أن الرسالة ليست سوى بريد مزعج أو محاولة تصيد إلكتروني.
لكن طلبات مشابهة ظهرت لدى باعة كتب مستعملة في هولندا وألمانيا وسويسرا وإسبانيا. ويشتبه بعض هؤلاء الباعة في أن الكتب تُجمع لصالح مختبرات ذكاء اصطناعي أمريكية .
أظهرت وثائق قضائية رُفعت عنها السرية في دعوى حقوق النشر Bartz v. Anthropic أن شركة Anthropic بدأت في مطلع عام 2024 عملية سرية أطلقت عليها اسم «مشروع بنما» .
أنفقت الشركة عشرات الملايين من الدولارات لشراء ملايين الكتب الورقية، ثم قطعت ظهورها ميكانيكيًا ومسحت كل صفحة فيها وأتلفت النسخ الأصلية، بهدف إنشاء مجموعة بيانات خاصة وعالية الجودة لتدريب روبوت المحادثة Claude .
وجاء في وثيقة تخطيط داخلية مؤرخة بعام 2024 وكُشف عنها في يناير 2026: «مشروع بنما هو جهودنا لمسح جميع الكتب في العالم بطريقة تدميرية» . وتشير الوثائق إلى هدف يتمثل في معالجة ما يصل إلى مليوني كتاب خلال ستة أشهر . كما تتناول العملية أكثر من 4,000 صفحة من ملفات المحكمة .
في 23 يونيو 2025، حكم قاضي المحكمة الجزئية الأمريكية ويليام أولسَب، في المنطقة الشمالية من كاليفورنيا، بأن استخدام الكتب التي جرى الحصول عليها بصورة قانونية لتدريب نماذج الذكاء الاصطناعي يُعد استخدامًا «تحويليًا بصورة جوهرية»، وبالتالي يندرج ضمن مبدأ الاستخدام العادل في قانون حقوق النشر الأمريكي .
وبصيغة مبسطة، رأت المحكمة أن شراء الشركة للنسخ بصورة قانونية ثم تحويلها إلى صيغة رقمية واستخدامها في التدريب يمكن أن يكون مسموحًا به. لكن هذا الحكم لم يمنح غطاءً قانونيًا لكل مصادر الكتب؛ فقد رفض القاضي إصدار حكم مماثل بشأن النسخ المقرصنة، واعتبر تنزيل الكتب من مواقع القرصنة استخدامًا لا يندرج ضمن الاستخدام العادل .
في يوليو 2026، وافق قاضٍ اتحادي في سان فرانسيسكو على تسوية جماعية بقيمة 1.5 مليار دولار في قضية Bartz v. Anthropic، التي رفعها مؤلفون، من بينهم أندريا بارتز وتشارلز غرايبر وآخرون، ضد الشركة قبل عامين .
جاءت التسوية بعد حكم يونيو 2025 الذي اعتبر مسح الكتب المشتراة قانونيًا وتدريب النماذج عليها استخدامًا عادلًا. إلا أن القضية تضمنت أيضًا ادعاءات تتعلق بامتلاك واستخدام مواد مقرصنة، وهي النقطة التي لم يشملها الحكم نفسه . لذلك لا تعني التسوية أن كل جوانب ممارسات Anthropic حظيت بالموافقة القانونية.
أدى هذا الطلب إلى نشوء سوق ثانوية لتوريد الكتب المخصصة لتدريب النماذج اللغوية الكبيرة. ووفق التقارير، تستعين شركات الذكاء الاصطناعي بخدمات وساطة تابعة لأطراف ثالثة، من بينها شركة قواعد بيانات أرقام ISBN المسماة ISBNdb، لإرسال طلبات مجهولة لشراء مئات الآلاف من الكتب، بما يحجب هوية المشتري النهائي .
وتشير إفادات باعة الكتب في أوروبا إلى تشابه كبير بين الطلبات الواردة إليهم. وبعد جمع الكتب، تُرسل أحيانًا إلى مراكز في الصين أو منشآت معالجة أخرى، حيث تُنفذ عملية القطع والمسح والتخلص من النسخ الورقية .
المشكلة لا تتعلق بالورق وحده، بل بما قد يختفي معه. فقد حذر أمناء الأرشيف وأمناء المكتبات وتجار الكتب النادرة من أن آخر النسخ المادية المتبقية من بعض الكتب الأكاديمية النادرة أو المنقطعة الطباعة قد تُتلف نهائيًا .
وتوجد بالفعل تقنيات للمسح غير التدميري، مثل Treventus ScanRobot، التي تتيح رقمنة الكتب الهشة دون إتلافها، وبسرعة تصل إلى 2,500 صفحة في الساعة وفق التقارير . لكن المسح التدميري أقل كلفة وأسهل للتوسع الصناعي، لأنه يحول الكتاب إلى صفحات منفصلة يمكن تمريرها بسرعة عبر الماسحات.
والنتيجة أن العنوان لا يبقى منه أي أصل مادي بعد انتهاء العملية. وإذا كان الكتاب المتخصص لا توجد منه سوى نسخ قليلة، فإن تحويل آخر نسخة إلى بيانات قابلة للبحث ثم إتلافها قد يمثل خسارة ثقافية وعلمية لا يمكن عكسها .
تكشف قصة «المسح التدميري» عن مفارقة لافتة: فالشركات تريد الحفاظ على المعرفة الموجودة في الكتب، لكنها تفعل ذلك أحيانًا بإزالة حاملها المادي نهائيًا. وقد يكون القانون قد رسم حدًا أوليًا بين النسخ المشتراة بصورة قانونية والنسخ المقرصنة، إلا أن السؤال الأوسع لا يزال قائمًا: هل يكفي تحويل الكتاب إلى بيانات كي تُعد مهمته قد انتهت، أم أن للنسخة الأصلية قيمة تتجاوز المعلومات التي تحتويها؟