Epoch AI ประมาณการว่าข้อความคุณภาพสูงที่มนุษย์เขียนบนอินเทอร์เน็ตสาธารณะมีอยู่ประมาณ 300 ล้านล้านโทเคน และคาดว่าจะถูกใช้หมดเกลี้ยงภายในปี 2032 หรืออาจเร็วถึงปี 2026 OpenAI และ Anthropic จ่ายเงินสูงถึง 300,000 ดอลลาร์สหรัฐฯ ต่อดีล เพื่อซื้อข้อมูลภายในของบริษัท เช่น ข้อความ Slack, อีเมล, และบันทึกการประชุมจากสตาร์ทอัพ...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
อินเทอร์เน็ตสาธารณะกำลังใกล้จะหมดข้อความที่มนุษย์เขียนอย่างมีคุณภาพแล้ว และแล็บ AI ชั้นนำของโลกกำลังเร่งหาพลังงานแหล่งใหม่ให้กับโมเดลของพวกเขา นั่นคือข้อมูลการสื่อสารภายในบริษัทของคุณ OpenAI และ Anthropic กำลังซื้อข้อความ Slack ของพนักงาน, อีเมล, บันทึกวิดีโอคอล, และประวัติการเขียนโค้ดจากสตาร์ทอัพต่างๆ ด้วยเงินสูงถึง 300,000 ดอลลาร์สหรัฐฯ ต่อดีล ในตลาดที่เงียบแต่กำลังเติบโตอย่างรวดเร็วสำหรับข้อมูลปฏิสัมพันธ์ของมนุษย์ที่มีกรรมสิทธิ์
แรงผลักดันให้เข้าไปซื้อข้อมูลภายในองค์กรเกิดจากปัญหาทางคณิตศาสตร์ที่หลีกเลี่ยงไม่ได้ การประมาณการที่ถูกอ้างถึงมากที่สุดจากกลุ่มวิจัย Epoch AI ระบุว่าปริมาณข้อความสาธารณะคุณภาพสูงที่มนุษย์สร้างขึ้นทั้งหมดมีอยู่ประมาณ 300 ล้านล้านโทเคน (ช่วงความเชื่อมั่น 90%: 100 ล้านล้านถึง 1,000 ล้านล้าน) ด้วยอัตราการบริโภคในปัจจุบันสำหรับการฝึกโมเดลระดับแนวหน้า แหล่งข้อมูลนี้คาดว่าจะหมดลง ระหว่างปี 2026 ถึง 2032 โดยมีค่ามัธยฐานที่ ปี 2028
การวิเคราะห์บางชิ้นชี้ให้เห็นว่าข้อความคุณภาพสูงบนเว็บเปิดอาจมีเพียง 15–20 ล้านล้านโทเคน ทำให้หมดลงเร็วที่สุดใน ปี 2026
PBS รายงานในปลายปี 2025 ว่า 'การตื่นทอง' สำหรับข้อมูลฝึกแชทบอทอาจหมดลงภายใน ปี 2026
เมื่อเพดานนี้ใกล้เข้ามา OpenAI และ Anthropic ก็หันมาสนใจแหล่งข้อมูลที่ไม่เคยถูกแตะต้องมาก่อน: ข้อมูลการทำงานร่วมกันภายในองค์กร บันทึกการโต้ตอบของมนุษย์แบบเรียลไทม์ เช่น อีเมลที่เต็มไปด้วยการเจรจา, บันทึกการประชุมที่มีการตัดสินใจทันที, และเธรด Slack ที่แสดงพลวัตการทำงานจริง ต่างก็เป็นข้อมูลสนทนาอินทรีย์ที่หายากบนเว็บสาธารณะที่ถูกขูดข้อมูล
ระบบนิเวศของบริษัทตัวกลางได้ผุดขึ้นมาเพื่อจัดการธุรกรรมที่ละเอียดอ่อนเหล่านี้ สองชื่อที่ปรากฏบ่อยที่สุดคือ Mercor และ SimpleClosure
อัตราตลาดในวงกว้าง ซึ่งรายงานโดย Reuters ในปี 2024 ให้ความรู้สึกถึงมูลค่าต่อหน่วย: ประมาณ 0.001 ดอลลาร์ต่อคำ สำหรับข้อความ, 1 ถึง 2 ดอลลาร์ต่อภาพ, 2 ถึง 4 ดอลลาร์ต่อวิดีโอสั้น, และ 100 ถึง 300 ดอลลาร์ต่อชั่วโมง สำหรับภาพยนตร์หรือวิดีโอที่ยาวขึ้น
SimpleClosure บริษัทเลิกกิจการสตาร์ทอัพ ได้ประมวลผลธุรกรรมดังกล่าวเกือบ 100 รายการในปีที่ผ่านมา โดยมีการจ่ายเงินตั้งแต่ 10,000 ถึง 100,000 ดอลลาร์ต่อบริษัท แพลตฟอร์ม 'Asset Hub' ของบริษัทช่วยให้ผู้ก่อตั้งล้างข้อมูลที่สามารถระบุตัวตนได้ (PII) ออกจากข้อมูลก่อนอนุญาตให้ใช้สิทธิ์ แม้ว่าประสิทธิภาพและความสม่ำเสมอของการไม่เปิดเผยตัวตนนี้จะยังไม่แน่นอนและกลายเป็นประเด็นที่ถกเถียงกันมากขึ้น
ความยาวนานที่บริษัท AI เต็มใจจะไปเพื่อรักษาความปลอดภัยให้กับข้อมูลฝึก ปรากฏให้เห็นในคดีพิเศษของ Project Panama โปรแกรมลับภายในของ Anthropic เพื่อสร้างชุดข้อมูลฝึกหนังสือขนาดใหญ่
โครงการนี้มีสองแนวทาง อย่างแรก Anthropic ซื้อหนังสือเล่มจริง ตัดสันหนังสือ และสแกนหน้าต่อหน้าอย่างทำลายล้าง แปลงเป็น PDF ที่ค้นหาได้ และทิ้งต้นฉบับกระดาษ เป้าหมาย: แปลงหนังสือได้ถึง 2 ล้านเล่มในหกเดือน บันทึกภายในแนะนำให้ใช้ชื่อรหัส "เพราะเราไม่ต้องการให้เป็นที่รู้ว่าเรากำลังทำสิ่งนี้อยู่"
ประการที่สอง บริษัทดาวน์โหลดไฟล์ ebook ละเมิดลิขสิทธิ์มากกว่า 7 ล้านไฟล์ จากห้องสมุดเงา รวมถึง LibGen และ Pirate Library Mirror แนวทางนี้นำไปสู่คดีความแบบกลุ่มที่ยื่นฟ้องในปี 2024 โดยนักเขียน Andrea Bartz, Kirk Wallace Johnson และ Charles Graeber ซึ่งกล่าวหาว่า Anthropic ใช้หนังสือละเมิดลิขสิทธิ์เกือบครึ่งล้านเล่มเพื่อฝึก Claude
เมื่อ วันที่ 20 กรกฎาคม 2026 ผู้พิพากษาของรัฐบาลกลางในซานฟรานซิสโกได้อนุมัติการยุติคดีด้วยมูลค่า 1.5 พันล้านดอลลาร์สหรัฐฯ ซึ่งเป็นการจ่ายค่าลิขสิทธิ์ที่ใหญ่ที่สุดเท่าที่เคยมีมาในประวัติศาสตร์สหรัฐฯ นักเขียนและสำนักพิมพ์มากกว่า 500,000 รายเป็นส่วนหนึ่งของคดีแบบกลุ่ม และพวกเขาจะได้รับเงินประมาณ 3,000 ดอลลาร์ต่องานที่มีสิทธิ์
ที่สำคัญ ศาลได้แยกความแตกต่างทางกฎหมายซึ่งมีนัยสำคัญต่อการฝึก AI การใช้ ebook ละเมิดลิขสิทธิ์ ถือเป็นการละเมิดและทำให้เกิดการยุติคดี แต่การซื้อ หนังสือเล่มจริงและสแกนภายในอย่างทำลายล้าง เพื่อฝึกฝน ถือว่าอาจเข้าข่ายเป็น fair use เนื่องจากหนังสือแต่ละเล่มถูกแทนที่ด้วยสำเนาดิจิทัลเพียงชุดเดียวในกระบวนการที่ศาลเรียกว่า 'เปลี่ยนแปลงอย่างยิ่ง' เงิน 1.5 พันล้านดอลลาร์ครอบคลุมความรับผิดสำหรับหนังสือละเมิดลิขสิทธิ์ โครงการทำลายหนังสือเล่มจริงไม่ถูกลงโทษ
ในขณะที่บริษัทต่าง ๆ รีบเร่งสร้างรายได้จากข้อมูลภายใน ปัญหาสำคัญยังคงอยู่ ประสิทธิผลของการไม่เปิดเผยข้อมูลโดยนายหน้าเช่น SimpleClosure ยังไม่แน่นอนและกลายเป็นประเด็นที่ถกเถียงกันมากขึ้น ข้อความ Slack และอีเมลของพนักงานมีข้อมูลส่วนบุคคลและข้อมูลที่ละเอียดอ่อน และยังไม่ชัดเจนว่าเทคนิคการลบข้อมูลในปัจจุบันเพียงพอที่จะป้องกันการระบุตัวตนซ้ำได้หรือไม่
ในขณะเดียวกัน ค่าใช้จ่ายในการฝึกก็พุ่งสูงขึ้น การฝึกโมเดลระดับ GPT-4 หนึ่งครั้งอาจมีค่าใช้จ่าย 100 ล้านดอลลาร์ขึ้นไป เมื่อข้อมูลสาธารณะคุณภาพสูงหมดลง ต้นทุนรวมของการอนุญาตให้ใช้ข้อมูลองค์กรที่มีกรรมสิทธิ์ การจ่ายค่าปรับครั้งใหญ่เช่น 1.5 พันล้านดอลลาร์ของ Anthropic และการสร้างไปป์ไลน์ข้อมูลสังเคราะห์ ล้วนเพิ่มสูงขึ้นอย่างมาก ตลาดชุดข้อมูลฝึก AI ในวงกว้างคาดว่าจะเติบโตอย่างรวดเร็ว จากประมาณ 3.6 พันล้านดอลลาร์ในปี 2025 เป็น 23 พันล้านดอลลาร์ภายในปี 2034 เนื่องจากการอนุญาตให้ใช้ข้อความของมนุษย์กลายเป็นสินทรัพย์ประเภทหนึ่งที่มีพิธีการ
สำหรับผู้ใช้ทั่วไป ภูมิทัศน์ได้เปลี่ยนไปแล้ว ณ ช่วงปลายปี 2025 ทั้ง OpenAI และ Anthropi ต่างเปลี่ยนนโยบายเริ่มต้นให้อนุญาตให้ฝึกบนแชทระดับผู้บริโภค (ChatGPT Free และ Plus, Claude Free, Pro, และ Max) เว้นแต่ผู้ใช้จะเลือกไม่ใช้ด้วยตนเอง ลูกค้าองค์กรและ API ยังคงถูกแยกออกจากการฝึกโดยค่าเริ่มต้นภายใต้ข้อตกลงการประมวลผลข้อมูล
ข้อความชัดเจน: ในการแข่งขันเพื่อป้อนข้อมูลที่มนุษย์สร้างขึ้นให้กับ AI ที่หิวโหยไม่รู้จักพอ เส้นแบ่งระหว่างสาธารณะและส่วนตัว ส่วนบุคคลและเชิงพาณิชย์ กำลังถูกวาดขึ้นใหม่—ครั้งละหนึ่งคลังข้อมูล Slack
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Epoch AI ประมาณการว่าข้อความคุณภาพสูงที่มนุษย์เขียนบนอินเทอร์เน็ตสาธารณะมีอยู่ประมาณ 300 ล้านล้านโทเคน และคาดว่าจะถูกใช้หมดเกลี้ยงภายในปี 2032 หรืออาจเร็วถึงปี 2026
Epoch AI ประมาณการว่าข้อความคุณภาพสูงที่มนุษย์เขียนบนอินเทอร์เน็ตสาธารณะมีอยู่ประมาณ 300 ล้านล้านโทเคน และคาดว่าจะถูกใช้หมดเกลี้ยงภายในปี 2032 หรืออาจเร็วถึงปี 2026 OpenAI และ Anthropic จ่ายเงินสูงถึง 300,000 ดอลลาร์สหรัฐฯ ต่อดีล เพื่อซื้อข้อมูลภายในของบริษัท เช่น ข้อความ Slack, อีเมล, และบันทึกการประชุมจากสตาร์ทอัพที่ปิดตัวหรือถูกซื้อกิจการ
SimpleClosure ตัวกลางในการเจรจาซื้อขายข้อมูล ประมวลผลดีลไปแล้วเกือบ 100 รายการในปีที่ผ่านมา โดยจ่ายเงิน 10,000 ถึง 100,000 ดอลลาร์ต่อบริษัท