研究机构Epoch AI估算,公开互联网上高质量人类生成文本总量约为300万亿个token,按目前前沿模型的消耗速度,预计在2026年至2032年间被完全消化,中位数预计在2028年。这意味着AI训练数据即将见底。 为应对数据饥荒,OpenAI和Anthropic正通过中介公司,以每笔10万至30万美元的价格,收购初创公司的内部Slack聊天记录、邮件、会议录像和GitHub代码历史。
研究答案

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
公开互联网上干净、由人类撰写的文本正在枯竭,而全球领先的AI实验室正在争相寻找新的燃料来源:你的企业内部通讯记录。OpenAI和Anthropic正以前所未有的力度从初创公司收购员工的Slack消息、电子邮件、视频录像和代码历史——每笔交易最高支付30万美元。一个围绕“专有人类交互数据”的隐秘但快速增长的市场正在形成。
AI公司转向企业数据的根本原因,是一个简单的、无法回避的数学问题。研究机构Epoch AI的估算被广泛引用:整个公开互联网上高质量、由人类生成的文本总量大约为 300万亿个token(90%置信区间:100万亿到1000万亿)。按照当前前沿模型的训练消耗速度,这个供应量预计将在 2026年至2032年间 被完全耗尽,中位数预测为 2028年
。更有分析指出,开放网络上真正高质量的人类文本可能只有15到20万亿个token,这意味着枯竭时间点可能提前至 2026年
。PBS在2025年底的报道中也指出,用于训练聊天机器人的数据“淘金热”可能在 2026年 就无以为继
。
随着这个天花板的逼近,OpenAI和Anthropic将注意力转向了一个此前未被充分开发的宝库:企业内部协作数据。真实的实时人类互动记录——包含谈判细节的邮件、记录实时决策的会议纪要、展现真实职场动态的Slack线程——提供了在已被大量爬取的公开网络上难以觅得的、有机的对话数据。
一个由中介公司组成的新生态系统已经出现,专门撮合这些敏感交易。其中最引人注目的两家公司是 Mercor 和 SimpleClosure。
更广泛的市场价格,据路透社2024年的报道,提供了单位价值的概念:文本大约是 每词0.001美元,图片 每张1到2美元,短视频 每个2到4美元,长片或视频 每小时100到300美元。
SimpleClosure,一家初创公司清算公司,在过去一年中处理了近100笔此类交易,每笔交易的支付金额从1万到10万美元不等。该公司的“资产中心”平台帮助创始人在数据授权前,先清除其中的个人身份信息——但这种匿名化的有效性和一致性仍不确定,且正成为一个日益激烈的争议点。
AI公司为获取训练数据愿意走多远,在“巴拿马计划”这个非同寻常的案件中暴露无遗。这是Anthropic为构建一个庞大的图书训练数据集而启动的秘密内部项目。
该计划有两条路径。其一,Anthropic购买实体印刷书籍,切掉书脊,逐页进行破坏性扫描,将其转换为可搜索的PDF文件,并丢弃纸质原版。其目标是:在六个月内转换多达200万本书。一份内部备忘录建议使用代号,“因为我们不想让人们知道我们正在做这件事”。
其二,该公司从包括LibGen和Pirate Library Mirror在内的影子图书馆下载了超过 700万份盗版电子书文件。这条路径直接导致了2024年由作家Andrea Bartz、Kirk Wallace Johnson和Charles Graeber提起的集体诉讼,他们指控Anthropic使用近50万本盗版书籍来训练其Claude模型。
2026年7月20日,旧金山的一名联邦法官批准了一项 15亿美元的和解协议——这是美国历史上已知的最大版权赔偿金。超过50万名作家和出版商是此次集体诉讼的一部分,他们预计每部符合条件的作品将获得 约3000美元 的赔偿。
至关重要的一点是,法院做出了一个对AI训练具有重大影响的法律区分:使用 盗版电子书 构成侵权,并触发了和解协议。但是,购买 实体印刷书籍并在内部进行破坏性扫描 用于训练,则被裁定可能符合 合理使用 原则,因为法院认为这个过程“极其具有变革性”,即每个实体副本都被替换成了一个数字副本。15亿美元涵盖了盗版图书的责任;而物理破坏扫描计划并未受到处罚。
在公司争相将内部数据变现的同时,一些重大问题也随之浮现。像SimpleClosure这样的中介机构所进行的数据匿名化效果,仍不确定且正成为争议焦点。员工的Slack消息和邮件包含极其私密和敏感的信息,目前尚不清楚现有的剥离技术是否足以防止身份重新识别。
与此同时,训练成本正在飙升。一次GPT-4规模的训练运行可能已经耗费 1亿美元或更多。随着高质量公共数据的枯竭,授权专有企业数据的成本、支付类似Anthropic 15亿美元的天价和解金,以及构建合成数据管道的费用都在急剧增加。更广泛的AI训练数据集市场预计将快速增长,从2025年估算的 36亿美元 增至2034年的 230亿美元,人类文本授权正在成为一个正式的资产类别。
对于个人用户而言,格局已经改变。从2025年底开始,OpenAI和Anthropic都修改了默认政策,允许在消费者级别的聊天上(如ChatGPT免费版和Plus版,Claude免费版、Pro版和Max版)进行训练,除非用户主动选择退出。根据合同中的数据保护协议,企业级和API客户默认仍被排除在训练之外
。
信息很明确:在满足AI对人类生成数据永无止境的渴求的竞赛中,公共与私人、个人与商业之间的界限正在被重新划定——从下一个Slack存档开始。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
研究机构Epoch AI估算,公开互联网上高质量人类生成文本总量约为300万亿个token,按目前前沿模型的消耗速度,预计在2026年至2032年间被完全消化,中位数预计在2028年。这意味着AI训练数据即将见底。
研究机构Epoch AI估算,公开互联网上高质量人类生成文本总量约为300万亿个token,按目前前沿模型的消耗速度,预计在2026年至2032年间被完全消化,中位数预计在2028年。这意味着AI训练数据即将见底。 为应对数据饥荒,OpenAI和Anthropic正通过中介公司,以每笔10万至30万美元的价格,收购初创公司的内部Slack聊天记录、邮件、会议录像和GitHub代码历史。
2026年7月,美国法官批准了Anthropic因“巴拿马计划”涉及盗版图书而达成的15亿美元和解协议,这是美国历史上最大的版权赔偿案。但法院同时裁定,购买实体书进行破坏性扫描并转化为数字副本用于AI训练,可能属于“合理使用”。