مع اقتراب هذا السقف، وجهت OpenAI و Anthropic انتباههما إلى كنز لم يتم استغلاله سابقًا: بيانات التعاون الداخلي للشركات . سجلات التفاعلات البشرية الحية—رسائل البريد الإلكتروني التي تحتوي على مفاوضات، وتسجيلات الاجتماعات مع اتخاذ القرارات في الوقت الفعلي، وسلاسل المحادثات على Slack التي تظهر ديناميكيات مكان العمل الحقيقية—تقدم النوع من البيانات التحادثية العضوية التي أصبحت نادرة على الإنترنت العام.
ظهرت شبكة جديدة من الشركات الوسيطة للتوسط في هذه المعاملات الحساسة. يظهر اسمان بشكل متكرر: Mercor و SimpleClosure .
تقديرات السوق الأوسع، التي أوردتها Reuters في عام 2024، تعطي إحساسًا بالقيمة لكل وحدة: حوالي 0.001 دولار لكل كلمة للنص، و1 إلى 2 دولار لكل صورة، و2 إلى 4 دولار لكل فيديو قصير، و100 إلى 300 دولار لكل ساعة من الأفلام أو مقاطع الفيديو الأطول .
قامت SimpleClosure، وهي شركة لتصفية الشركات الناشئة، بمعالجة ما يقرب من 100 معاملة من هذا النوع خلال العام الماضي، وتراوحت المدفوعات من 10,000 إلى 100,000 دولار لكل شركة . تساعد منصة "Asset Hub" الخاصة بالشركة المؤسسين على تنظيف معلومات التعريف الشخصية (PII) من البيانات قبل ترخيصها—على الرغم من أن فعالية واتساق إخفاء الهوية هذا لا يزال غير مؤكد ويشكل نقطة خلاف متزايدة .
المدى الذي ستذهب إليه شركات الذكاء الاصطناعي لتأمين بيانات التدريب تجلى في القضية الاستثنائية لـ مشروع بنما، البرنامج الداخلي السري لشركة Anthropic لبناء مجموعة بيانات ضخمة للتدريب على الكتب .
كان للمشروع مساران. أولاً، اشترت Anthropic كتبًا مطبوعة مادية، وقطعت أغلفتها، ومسحتها ضوئيًا بشكل هدام صفحة بصفحة، محولة إياها إلى ملفات PDF قابلة للبحث، وتخلصت من النسخ الورقية الأصلية. كان الهدف: تحويل ما يصل إلى 2 مليون كتاب في ستة أشهر . نصحت مذكرة داخلية باستخدام اسم رمزي "لأننا لا نريد أن يُعرف أننا نعمل على هذا" .
ثانيًا، قامت الشركة بتنزيل أكثر من 7 ملايين ملف كتاب إلكتروني مقرصن من المكتبات الظليلة بما في ذلك LibGen و Pirate Library Mirror . قاد هذا المسار إلى دعوى قضائية جماعية رُفعت في عام 2024 من قبل المؤلفين أندريا بارتز وكيرك والاس جونسون وتشارلز جرايبر، الذين اتهموا Anthropic باستخدام ما يقرب من نصف مليون كتاب مقرصن لتدريب Claude .
في 20 يوليو 2026، وافق قاضٍ فيدرالي في سان فرانسيسكو على تسوية بقيمة 1.5 مليار دولار—وهي أكبر تعويضات معروفة عن حقوق النشر في التاريخ الأمريكي . أكثر من 500,000 مؤلف وناشر كانوا جزءًا من الدعوى الجماعية، وسيحصلون على ما يقدر بـ 3,000 دولار لكل عمل مؤهل .
الأهم من ذلك، أن المحكمة رسمت تمييزًا قانونيًا له آثار كبيرة على تدريب الذكاء الاصطناعي. استخدام الكتب الإلكترونية المقرصنة كان انتهاكًا وأدى إلى التسوية. لكن شراء الكتب المطبوعة المادية وتدميرها ومسحها ضوئيًا داخليًا للتدريب حُكم بأنه قد يكون مؤهلاً ليكون استخدامًا عادلاً، لأن كل نسخة مادية تم استبدالها بنسخة رقمية واحدة في عملية وصفتها المحكمة بأنها "تحويلية للغاية" . غطت الـ 1.5 مليار دولار مسؤولية الكتاب المقرصن؛ ولم يتم تغريم برنامج التدمير المادي .
مع تسارع الشركات لتحقيق الدخل من البيانات الداخلية، تظل أسئلة كبيرة قائمة. فعالية إخفاء هوية البيانات من قبل الوسطاء مثل SimpleClosure غير مؤكدة وتشكل نقطة خلاف متزايدة . تحتوي رسائل الموظفين على Slack ورسائل البريد الإلكتروني على معلومات شخصية وحساسة للغاية، وليس من الواضح ما إذا كانت تقنيات التجريد الحالية كافية لمنع إعادة التعريف.
في هذه الأثناء، تكاليف التدريب تتضاعف. قد تكلف عملية تدريب واحدة على نموذج بحجم GPT-4 100 مليون دولار أو أكثر . مع نفاد البيانات العامة عالية الجودة، فإن التكاليف المجمعة لترخيص البيانات الداخلية الخاصة، ودفع تسويات ضخمة مثل تسوية Anthropic البالغة 1.5 مليار دولار، وبناء خطوط أنابيب البيانات الاصطناعية، كلها تتزايد بشكل كبير. من المتوقع أن ينمو سوق بيانات التدريب على الذكاء الاصطناعي الأوسع بسرعة، من ما يقدر بـ 3.6 مليار دولار في عام 2025 إلى 23 مليار دولار بحلول عام 2034، حيث يصبح ترخيص النصوص البشرية فئة أصول رسمية .
بالنسبة للمستخدمين الأفراد، تغير المشهد. اعتبارًا من أواخر عام 2025، غيرت كل من OpenAI و Anthropic سياساتهما الافتراضية للسماح بالتدريب على محادثات المستهلك (ChatGPT Free و Plus، Claude Free و Pro و Max) ما لم ينسحب المستخدمون بنشاط . يظل عملاء المؤسسات و API مستبعدين من التدريب بشكل افتراضي بموجب اتفاقيات معالجة البيانات التعاقدية
.
الرسالة واضحة: في السباق لإطعام شهية الذكاء الاصطناعي التي لا تشبع للبيانات التي يولدها البشر، يتم إعادة رسم الحدود بين العام والخاص، والشخصي والتجاري—أرشيف Slack تلو الآخر.