Khi giới hạn đó đến gần, OpenAI và Anthropic đã chuyển sự chú ý sang một kho tàng chưa được khai thác trước đây: dữ liệu cộng tác nội bộ của doanh nghiệp . Các bản ghi tương tác trực tiếp của con người—email chứa các cuộc đàm phán, bản ghi cuộc họp với quyết định theo thời gian thực và các luồng tin nhắn Slack thể hiện động lực làm việc xác thực—cung cấp loại dữ liệu hội thoại hữu cơ đã trở nên khan hiếm trên web công cộng.
Một hệ sinh thái mới gồm các công ty trung gian đã mọc lên để môi giới các giao dịch nhạy cảm này. Hai cái tên xuất hiện thường xuyên nhất là Mercor và SimpleClosure .
Giá thị trường chung, do Reuters đưa tin vào năm 2024, cho thấy giá trị trên mỗi đơn vị: khoảng 0,001 USD mỗi từ cho văn bản, 1 đến 2 USD mỗi hình ảnh, 2 đến 4 USD mỗi video ngắn, và 100 đến 300 USD mỗi giờ cho phim hoặc video dài .
SimpleClosure, một công ty chuyên thanh lý startup, đã xử lý gần 100 giao dịch như vậy trong năm qua, với các khoản thanh toán từ 10.000 đến 100.000 USD cho mỗi công ty . Nền tảng "Asset Hub" của công ty này giúp các nhà sáng lập làm sạch thông tin nhận dạng cá nhân (PII) khỏi dữ liệu trước khi cấp phép—tuy nhiên, hiệu quả và tính nhất quán của quá trình ẩn danh này vẫn còn không chắc chắn và đang trở thành một điểm gây tranh cãi .
Mức độ mà các công ty AI sẵn sàng thực hiện để đảm bảo dữ liệu đào tạo đã được phơi bày trong trường hợp đặc biệt của Project Panama, một chương trình nội bộ bí mật của Anthropic nhằm xây dựng một bộ dữ liệu sách khổng lồ để đào tạo AI .
Dự án có hai hướng. Đầu tiên, Anthropic mua sách in, cắt bỏ gáy sách, và quét hủy từng trang một, chuyển đổi chúng thành các tệp PDF có thể tìm kiếm và vứt bỏ bản gốc giấy. Mục tiêu: chuyển đổi lên tới 2 triệu cuốn sách trong sáu tháng . Một bản ghi nhớ nội bộ khuyên nên sử dụng mật danh "vì chúng tôi không muốn mọi người biết rằng chúng tôi đang làm việc này" .
Thứ hai, công ty đã tải xuống hơn 7 triệu tệp sách điện tử vi phạm bản quyền từ các thư viện như LibGen và Pirate Library Mirror . Hướng này đã dẫn đến một vụ kiện tập thể được đệ trình vào năm 2024 bởi các tác giả Andrea Bartz, Kirk Wallace Johnson và Charles Graeber, những người đã cáo buộc Anthropic sử dụng gần nửa triệu cuốn sách vi phạm bản quyền để đào tạo mô hình Claude .
Vào ngày 20 tháng 7 năm 2026, một thẩm phán liên bang tại San Francisco đã phê chuẩn thỏa thuận dàn xếp trị giá 1,5 tỷ USD—khoản bồi thường bản quyền lớn nhất được biết đến trong lịch sử Hoa Kỳ . Hơn 500.000 tác giả và nhà xuất bản là một phần của vụ kiện tập thể, và họ sẽ nhận được ước tính khoảng 3.000 USD cho mỗi tác phẩm đủ điều kiện .
Điều quan trọng là, tòa án đã đưa ra sự phân biệt pháp lý có ý nghĩa lớn đối với việc đào tạo AI. Việc sử dụng sách điện tử vi phạm bản quyền là xâm phạm và gây ra thỏa thuận dàn xếp. Nhưng việc mua sách in và quét hủy nội bộ để đào tạo được tòa án cho là có khả năng thuộc diện sử dụng hợp lý, bởi vì mỗi bản sao vật lý được thay thế bằng một bản sao kỹ thuật số duy nhất trong một quy trình mà tòa án gọi là "có tính biến đổi cao độ" . Khoản 1,5 tỷ USD bao gồm trách nhiệm pháp lý từ sách vi phạm bản quyền; chương trình hủy sách in không bị phạt .
Khi các công ty đổ xô đi kiếm tiền từ dữ liệu nội bộ, những câu hỏi quan trọng vẫn còn đó. Hiệu quả của việc ẩn danh dữ liệu bởi các nhà môi giới như SimpleClosure là không chắc chắn và đang trở thành một điểm gây tranh cãi . Tin nhắn Slack và email của nhân viên chứa thông tin cá nhân sâu sắc và nhạy cảm, và không rõ liệu các kỹ thuật làm sạch hiện tại có đủ để ngăn chặn việc nhận dạng lại hay không.
Trong khi đó, chi phí đào tạo đang tăng vọt. Một lần chạy đào tạo mô hình quy mô GPT-4 có thể đã tiêu tốn 100 triệu USD hoặc hơn . Khi dữ liệu công cộng chất lượng cao cạn kiệt, chi phí kết hợp của việc cấp phép dữ liệu doanh nghiệp độc quyền, trả các khoản bồi thường mang tính bước ngoặt như 1,5 tỷ USD của Anthropic, và xây dựng các đường ống dữ liệu tổng hợp đều đang leo thang đáng kể. Thị trường bộ dữ liệu đào tạo AI rộng lớn hơn được dự báo sẽ tăng trưởng nhanh chóng, từ mức ước tính 3,6 tỷ USD vào năm 2025 lên 23 tỷ USD vào năm 2034, khi việc cấp phép văn bản con người trở thành một lớp tài sản được chính thức hóa .
Đối với người dùng cá nhân, bối cảnh đã thay đổi. Kể từ cuối năm 2025, cả OpenAI và Anthropic đã thay đổi chính sách mặc định của họ để cho phép đào tạo trên các cuộc trò chuyện ở gói người dùng phổ thông (ChatGPT Free và Plus, Claude Free, Pro, và Max) trừ khi người dùng chủ động từ chối . Khách hàng doanh nghiệp và API vẫn được loại trừ khỏi việc đào tạo theo mặc định theo các Thỏa thuận Xử lý Dữ liệu (DPA)
.
Thông điệp rất rõ ràng: trong cuộc đua nuôi dưỡng cơn đói dữ liệu vô độ của AI, ranh giới giữa công cộng và riêng tư, cá nhân và thương mại, đang được vẽ lại—từng kho lưu trữ Slack một.