Internet awam dijangka kehabisan teks manusia berkualiti tinggi antara 2026 dan 2032, mendorong OpenAI dan Anthropic membeli data komunikasi korporat. Syarikat permulaan yang gulung tikar kini menjual arkib Slack dan emel mereka dengan harga AS$10,000 hingga AS$100,000 setiap perjanjian.
Research answer

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Internet awam semakin kering dengan teks manusia yang bersih dan berkualiti untuk latihan AI, dan makmal AI terkemuka dunia kini memburu sumber bahan api baharu: komunikasi dalaman syarikat anda. OpenAI dan Anthropic dilaporkan membeli mesej Slack, emel, rakaman video, dan sejarah kod daripada syarikat permulaan—dengan bayaran sehingga AS$300,000 (kira-kira RM1.3 juta) setiap perjanjian dalam pasaran yang berkembang pesat tetapi tidak banyak didedahkan .
Desakan ini berpunca daripada masalah matematik yang mudah tetapi tidak dapat dielakkan. Anggaran paling meluas, daripada kumpulan penyelidikan Epoch AI, meletakkan jumlah stok teks awam berkualiti tinggi yang dihasilkan manusia pada kira-kira 300 trilion token (selang keyakinan 90%: 100 trilion hingga 1,000 trilion) . Pada kadar penggunaan latihan termaju semasa, bekalan itu dijangka habis antara 2026 dan 2032, dengan anggaran median pada 2028
. Sesetengah analisis mencadangkan teks manusia berkualiti tinggi di web terbuka mungkin hanya 15–20 trilion token, menjangkakan kehabisan seawal 2026
. PBS melaporkan pada akhir 2025 bahawa "gold rush" untuk data latihan AI mungkin tamat menjelang 2026
.
Apabila siling itu semakin hampir, OpenAI dan Anthropic telah mengalihkan perhatian kepada khazanah data yang sebelum ini tidak diterokai: data kolaborasi korporat dalaman . Rekod interaksi manusia secara langsung—emel yang mengandungi rundingan, transkrip mesyuarat dengan membuat keputusan masa nyata, dan utas Slack yang menunjukkan dinamik tempat kerja sebenar—menawarkan jenis data perbualan organik yang semakin sukar diperoleh di web awam.
Ekonomi perantara baharu telah muncul untuk menguruskan transaksi sensitif ini. Dua nama yang paling kerap disebut: Mercor dan SimpleClosure .
Kadar pasaran yang lebih luas, dilaporkan oleh Reuters pada 2024, memberi gambaran nilai seunit: kira-kira AS$0.001 setiap patah perkataan untuk teks, AS$1 hingga AS$2 setiap gambar, AS$2 hingga AS$4 setiap video pendek, dan AS$100 hingga AS$300 setiap jam untuk filem atau video yang lebih panjang .
SimpleClosure, sebuah firma penggulungan syarikat permulaan, telah memproses hampir 100 transaksi sedemikian sepanjang tahun lalu, dengan bayaran antara AS$10,000 hingga AS$100,000 setiap syarikat . Platform "Asset Hub" firma itu membantu pengasas membersihkan maklumat peribadi (PII) daripada data sebelum melesenkannya—walaupun keberkesanan dan konsistensi proses tanpa nama itu tidak pasti dan menjadi titik pertikaian yang semakin meningkat .
Langkah yang diambil oleh syarikat AI untuk mendapatkan data latihan terbongkar dalam kes luar biasa Projek Panama, program dalaman rahsia Anthropic untuk membina set data latihan buku yang besar .
Projek ini mempunyai dua landasan. Pertama, Anthropic membeli buku bercetak fizikal, memotong jilidnya, dan mengimbasnya secara memusnahkan halaman demi halaman, menukarkannya kepada PDF yang boleh dicari dan membuang salinan asal. Matlamatnya: menukar sehingga 2 juta buku dalam tempoh enam bulan . Nota dalaman menasihatkan menggunakan nama kod "kerana kita tidak mahu diketahui bahawa kita sedang mengerjakan ini" .
Kedua, syarikat itu memuat turun lebih daripada 7 juta fail ebook cetak rompak daripada perpustakaan bayangan termasuk LibGen dan Pirate Library Mirror . Landasan itu membawa kepada saman tindakan kelas yang difailkan pada 2024 oleh penulis Andrea Bartz, Kirk Wallace Johnson, dan Charles Graeber, yang menuduh Anthropic menggunakan hampir setengah juta buku cetak rompak untuk melatih Claude .
Pada 20 Julai 2026, seorang hakim persekutuan di San Francisco meluluskan penyelesaian AS$1.5 bilion—pembayaran hak cipta terbesar dalam sejarah AS . Lebih 500,000 penulis dan penerbit adalah sebahagian daripada tindakan kelas itu, dan mereka dijangka menerima kira-kira AS$3,000 setiap karya yang layak .
Yang penting, mahkamah membuat perbezaan undang-undang yang mempunyai implikasi besar untuk latihan AI. Menggunakan ebook cetak rompak adalah melanggar dan mencetuskan penyelesaian. Tetapi membeli buku bercetak fizikal dan mengimbasnya secara memusnahkan secara dalaman untuk latihan diperintah untuk berpotensi layak sebagai penggunaan adil, kerana setiap salinan fizikal digantikan dengan satu salinan digital dalam proses yang dipanggil mahkamah "amat transformatif" . AS$1.5 bilion meliputi liabiliti buku cetak rompak; program pemusnahan fizikal tidak dihukum .
Apabila syarikat tergesa-gesa untuk mendapatkan wang daripada data dalaman, persoalan penting kekal. Keberkesanan penyahwajahan data oleh perantara seperti SimpleClosure tidak pasti dan menjadi titik pertikaian yang semakin meningkat . Mesej dan emel Slack pekerja mengandungi maklumat peribadi dan sensitif, dan tidak jelas sama ada teknik pelucutan semasa mencukupi untuk menghalang pengenalan semula.
Sementara itu, kos latihan melambung tinggi. Satu latihan untuk model berskala GPT-4 mungkin sudah menelan kos AS$100 juta atau lebih . Apabila data awam berkualiti tinggi habis, kos gabungan untuk melesenkan data korporat proprietari, membayar penyelesaian mercu tanda seperti AS$1.5 bilion Anthropic, dan membina saluran paip data sintetik semuanya meningkat secara mendadak. Pasaran set data latihan AI yang lebih luas diunjurkan berkembang pesat, daripada anggaran AS$3.6 bilion pada 2025 kepada AS$23 bilion menjelang 2034, apabila pelesenan teks manusia menjadi kelas aset yang formal .
Bagi pengguna individu, landskap telah berubah. Sejak akhir 2025, kedua-dua OpenAI dan Anthropic menukar dasar lalai mereka untuk membenarkan latihan pada sembang peringkat pengguna (ChatGPT Free dan Plus, Claude Free, Pro, dan Max) melainkan pengguna keluar secara aktif . Pelanggan perusahaan dan API kekal dikecualikan daripada latihan secara lalai di bawah Perjanjian Pemprosesan Data kontrak
.
Maksudnya jelas: dalam perlumbaan untuk memberi makan kepada kehausan AI yang tidak pernah puas terhadap data yang dihasilkan manusia, sempadan antara awam dan peribadi, peribadi dan komersial, sedang dilukis semula—satu arkib Slack pada satu masa.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Internet awam dijangka kehabisan teks manusia berkualiti tinggi antara 2026 dan 2032, mendorong OpenAI dan Anthropic membeli data komunikasi korporat.
Internet awam dijangka kehabisan teks manusia berkualiti tinggi antara 2026 dan 2032, mendorong OpenAI dan Anthropic membeli data komunikasi korporat. Syarikat permulaan yang gulung tikar kini menjual arkib Slack dan emel mereka dengan harga AS$10,000 hingga AS$100,000 setiap perjanjian.
Anthropic menyelesaikan saman hak cipta bernilai AS$1.5 bilion—terbesar dalam sejarah AS—atas penggunaan buku cetak rompak dalam latihan AI.