Epoch AI memperkirakan stok teks publik berkualitas tinggi hanya 300 triliun token dan akan habis antara 2026 2032 [18][20]. OpenAI dan Anthropic membeli data internal startup (Slack, email, rekaman rapat) lewat perantara Mercor dan SimpleClosure dengan harga $10.000 $300.000 per deal [2][36][38].
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Internet publik kehabisan teks buatan manusia berkualitas tinggi, dan laboratorium AI terkemuka dunia berebut sumber bahan bakar baru: data komunikasi internal perusahaan Anda. OpenAI dan Anthropic kini secara agresif membeli pesan Slack karyawan, email, rekaman video rapat, dan riwayat kode dari startup—membayar hingga $300.000 (sekitar Rp4,8 miliar) per kesepakatan di pasar yang tumbuh diam-diam namun pesat untuk data interaksi manusia yang eksklusif.
Dorongan ke data perusahaan didorong oleh masalah matematika yang sederhana dan tak terhindarkan. Perkiraan paling banyak dikutip, dari kelompok riset Epoch AI, menempatkan total stok teks publik berkualitas tinggi buatan manusia pada sekitar 300 triliun token (interval kepercayaan 90%: 100 triliun hingga 1.000 triliun) . Pada tingkat konsumsi pelatihan AI generasi terdepan saat ini, pasokan itu diproyeksikan habis antara 2026 dan 2032, dengan perkiraan median 2028
. Beberapa analisis menunjukkan teks tulisan manusia berkualitas tinggi di web terbuka mungkin hanya 15–20 triliun token, mendorong kehabisan lebih awal, yaitu 2026
. PBS melaporkan pada akhir 2025 bahwa "demam emas" data pelatihan chatbot bisa habis pada 2026
.
Saat batas itu mendekat, OpenAI dan Anthropic mengalihkan perhatian ke harta karun yang sebelumnya belum tersentuh: data kolaborasi internal perusahaan . Catatan interaksi manusia secara langsung—email yang berisi negosiasi, transkrip rapat dengan pengambilan keputusan waktu nyata, dan utas Slack yang menunjukkan dinamika tempat kerja yang autentik—menawarkan jenis data percakapan organik yang kini langka di web publik yang dikeruk.
Ekosistem baru perusahaan perantara bermunculan untuk menjadi broker transaksi sensitif ini. Dua nama paling sering muncul: Mercor dan SimpleClosure .
Tingkat pasar yang lebih luas, dilaporkan oleh Reuters pada tahun 2024, memberikan gambaran nilai per unit: sekitar $0,001 per kata untuk teks, $1 hingga $2 per gambar, $2 hingga $4 per video pendek, dan $100 hingga $300 per jam untuk film atau video yang lebih panjang .
SimpleClosure, sebuah perusahaan wind-down startup, telah memproses hampir 100 transaksi semacam itu selama setahun terakhir, dengan pembayaran berkisar antara $10.000 hingga $100.000 per perusahaan . Platform "Asset Hub" perusahaan membantu pendiri membersihkan informasi identitas pribadi (PII) dari data sebelum melisensikannya—meskipun efektivitas dan konsistensi anonimisasi itu masih belum pasti dan menjadi titik pertikaian yang semakin meningkat .
Sejauh mana perusahaan AI akan mencari data pelatihan terungkap dalam kasus luar biasa Proyek Panama, program internal rahasia Anthropic untuk membangun kumpulan data pelatihan buku raksasa .
Proyek ini memiliki dua jalur. Pertama, Anthropic membeli buku cetak fisik, memotong jilidnya, dan memindainya secara destruktif halaman demi halaman, mengubahnya menjadi PDF yang dapat dicari dan membuang kertas aslinya. Targetnya: mengonversi hingga 2 juta buku dalam enam bulan . Sebuah memo internal menyarankan penggunaan nama kode "karena kami tidak ingin diketahui bahwa kami sedang mengerjakan ini" .
Kedua, perusahaan mengunduh lebih dari 7 juta file ebook bajakan dari perpustakaan bayangan termasuk LibGen dan Pirate Library Mirror . Jalur itu menyebabkan gugatan class action yang diajukan pada tahun 2024 oleh penulis Andrea Bartz, Kirk Wallace Johnson, dan Charles Graeber, yang menuduh Anthropic menggunakan hampir setengah juta buku bajakan untuk melatih Claude .
Pada 20 Juli 2026, seorang hakim federal di San Francisco menyetujui penyelesaian $1,5 miliar—pembayaran hak cipta terbesar yang diketahui dalam sejarah AS . Lebih dari 500.000 penulis dan penerbit menjadi bagian dari gugatan class action, dan mereka akan menerima perkiraan $3.000 per karya yang memenuhi syarat .
Yang penting, pengadilan menarik perbedaan hukum yang memiliki implikasi besar untuk pelatihan AI. Menggunakan ebook bajakan melanggar hukum dan memicu penyelesaian. Tetapi membeli buku cetak fisik dan memindainya secara destruktif secara internal untuk pelatihan diputuskan berpotensi memenuhi syarat sebagai penggunaan wajar (fair use), karena setiap salinan fisik diganti dengan satu salinan digital dalam proses yang disebut pengadilan "sangat transformatif" . $1,5 miliar mencakup kewajiban buku bajakan; program penghancuran fisik tidak dihukum .
Saat perusahaan bergegas memonetisasi data internal, pertanyaan signifikan tetap ada. Efektivitas anonimisasi data oleh broker seperti SimpleClosure tidak pasti dan menjadi titik pertikaian yang semakin meningkat . Pesan Slack dan email karyawan berisi informasi yang sangat pribadi dan sensitif, dan tidak jelas apakah teknik pembersihan saat ini cukup untuk mencegah identifikasi ulang.
Sementara itu, biaya pelatihan meroket. Satu kali proses pelatihan berskala GPT-4 mungkin sudah menelan biaya $100 juta atau lebih . Saat data publik berkualitas tinggi habis, biaya gabungan untuk melisensikan data perusahaan eksklusif, membayar penyelesaian penting seperti $1,5 miliar Anthropic, dan membangun jalur data sintetis semuanya meningkat secara dramatis. Pasar kumpulan data pelatihan AI yang lebih luas diproyeksikan tumbuh pesat, dari perkiraan $3,6 miliar pada tahun 2025 menjadi $23 miliar pada tahun 2034, karena lisensi teks manusia menjadi kelas aset yang diformalkan .
Bagi pengguna individu, lanskap telah berubah. Pada akhir tahun 2025, OpenAI dan Anthropic mengubah kebijakan default mereka untuk mengizinkan pelatihan pada obrolan tingkat konsumen (ChatGPT Gratis dan Plus, Claude Gratis, Pro, dan Max) kecuali pengguna secara aktif memilih keluar . Pelanggan perusahaan dan API tetap dikecualikan dari pelatihan secara default berdasarkan Perjanjian Pemrosesan Data kontraktual
.
Pesanannya jelas: dalam perlombaan untuk memberi makan nafsu makan AI yang tak pernah puas akan data buatan manusia, batas-batas antara publik dan pribadi, pribadi dan komersial, sedang digambar ulang—satu arsip Slack pada satu waktu.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Epoch AI memperkirakan stok teks publik berkualitas tinggi hanya 300 triliun token dan akan habis antara 2026 2032 [18][20].
Epoch AI memperkirakan stok teks publik berkualitas tinggi hanya 300 triliun token dan akan habis antara 2026 2032 [18][20]. OpenAI dan Anthropic membeli data internal startup (Slack, email, rekaman rapat) lewat perantara Mercor dan SimpleClosure dengan harga $10.000 $300.000 per deal [2][36][38].
Anthropic menjalankan Proyek Panama: membeli buku cetak, memotong jilidnya, memindai halaman, lalu membuangnya untuk data pelatihan AI [50].