公開ウェブ上の高品質な人間執筆テキストの総量は約300兆トークンと推定され、現在のペースでは2026~2032年(中央値2028年)に枯渇するという予測 OpenAIとAnthropicは、スタートアップの社内Slack、メール、会議録、GitHubコード履歴を最大30万ドル(約4500万円)で買い取るデータ買収ラッシュを展開 SimpleClosure社は消滅スタートアップのデータ販売を仲介、1社あたり1万~10万ドルの取引を約100件成立
研究の答え

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
公開インターネット上の「きれいな人間が書いたテキスト」は急速に底をつきつつある。世界をリードするAI研究所は、新たな燃料の供給源を必死に探している。その標的は、あなたの職場の内部コミュニケーションだ。
OpenAIとAnthropicは現在、スタートアップ企業の従業員が交わしたSlackメッセージ、電子メール、ビデオ会議の録画、コード変更履歴などを積極的に買い集めており、1件あたり最大30万ドル(約4500万円)を支払う取引が、静かながら急成長している。
社内データへの急接近は、単純で避けられない数学的問題によって突き動かされている。
研究グループEpoch AIの最も広く引用される推定によれば、人間が生成した高品質な公開テキストの総在庫は約300兆トークン(90%信頼区間:100兆~1000兆)とされる。現在の最先端モデルのトレーニング消費ペースでは、この供給量は2026年から2032年の間に枯渇すると予測されており、中央値は2028年とされる
。一部の分析では、高品質な人間執筆テキストはわずか15~20兆トークンに過ぎず、枯渇は早ければ2026年に訪れる可能性も指摘されている
。PBSも2025年後半に、チャットボットのトレーニングデータを巡る「ゴールドラッシュ」が2026年までに終わる可能性があると報じている
。
この天井が迫る中、OpenAIとAnthropicはこれまで未開拓だった領域、すなわち企業内部のコラボレーションデータに注目した。交渉のやりとりを含むメール、リアルタイムの意思決定が記録された会議の文字起こし、本物の職場のダイナミクスを示すSlackスレッドなど、生の人間同士のやりとりの記録は、スクレイピングされた公開ウェブ上ではもはや入手困難な、有機的な会話データを提供する。
こうした機密性の高い取引を仲介する新たなエコシステムが出現している。最も頻繁に名前が挙がるのはMercorとSimpleClosureの2社だ。
より広範な市場レートとしては、ロイター通信が2024年に報じたところによると、テキストは1ワードあたり約0.001ドル、画像は1枚あたり1~2ドル、短尺動画は1本あたり2~4ドル、長時間の映画やビデオは1時間あたり100~300ドルが相場とされる。
スタートアップの清算を手掛けるSimpleClosure社は、過去1年間に約100件の取引を仲介し、1社あたりの報酬は1万ドルから10万ドルに及ぶ。同社の「Asset Hub」プラットフォームは、ライセンス供与前に個人を特定できる情報(PII)をデータから除去することを謳っているが、その匿名化の有効性と一貫性は不確かであり、かつてない論争の的となっている。
AI企業がトレーニングデータを確保するためにどこまでやるのかは、Anthropicの秘密内部プログラムProject Panamaの異例の事例で明らかになった。
このプロジェクトには2つの側面があった。第一に、Anthropicは物理的な印刷書籍を購入し、その製本を切り落としてページごとに破壊的にスキャンし、検索可能なPDFに変換して紙の原紙は廃棄した。目標は6ヶ月で最大200万冊の書籍を変換することだった。社内メモでは、コードネームを使う理由として「我々がこれに取り組んでいることを知られたくないから」と記されていた。
第二に、同社はLibGenやPirate Library Mirrorなどのシャドウライブラリーから700万以上の海賊版電子書籍ファイルをダウンロードしていた。この行為が発端となり、2024年に作家のAndrea Bartz、Kirk Wallace Johnson、Charles Graeber氏らが、Anthropicが約50万冊の海賊版書籍をClaudeの学習に使用したとして集団訴訟を起こした。
2026年7月20日、サンフランシスコの連邦判事は、米国史上最大の著作権和解金として知られる15億ドル(約2250億円)の和解を承認した。50万人以上の著者と出版社がこの集団訴訟の対象となり、対象作品1点あたり約3000ドルを受け取る見込みである。
重要なのは、裁判所がAIトレーニングに関して法的な線引きを行ったことだ。海賊版電子書籍の使用は侵害にあたり、今回の和解の対象となった。しかし、購入した印刷書籍を内部で破壊的にスキャンすることについては、各物理的なコピーが単一のデジタルコピーに置き換えられるプロセスであり、裁判所はこれを「極めて変形的(exceedingly transformative)」と評し、フェアユース(公正利用) に該当する可能性を認めた。15億ドルは海賊版書籍の責任をカバーするものであり、物理的な破壊プログラムは罰則の対象とはならなかった。
企業が内部データの現金化に殺到する中、重大な疑問が残る。SimpleClosureのようなブローカーによるデータ匿名化の実効性は不確かであり、かつてない論点となっている。従業員のSlackメッセージやメールには極めて個人的で機密性の高い情報が含まれており、現在のデータ削除技術が再特定を防ぐのに十分かどうかは明らかではない。
一方、トレーニングコストは高騰の一途をたどる。GPT-4規模の単一トレーニング実行にはすでに1億ドル以上かかる可能性がある。高品質な公開データが枯渇するにつれ、独占的な企業データのライセンス費用、Anthropicの15億ドル和解金のような巨額の和解金、そして合成データパイプラインの構築コストはすべて急激に上昇している。より広範なAIトレーニングデータセット市場は、人間のテキストライセンスが正式な資産クラスとして確立されるにつれ、推定2025年の36億ドルから2034年には230億ドルへと急成長する見通しである。
個人ユーザーにとって、状況は一変した。2025年後半時点で、OpenAIとAnthropicはともに、消費者向けチャット(ChatGPT Free/Plus、Claude Free/Pro/Max)のデータを、ユーザーが積極的にオプトアウトしない限りモデルトレーニングに使用するというデフォルトポリシーに変更している。エンタープライズおよびAPI顧客は、契約上のデータ処理契約(DPA)により、デフォルトではトレーニング対象から除外されている
。
メッセージは明らかだ。AIの飽くなき人間生成データへの渇望を満たす競争において、公と私、個人と商用の境界線は、1つのSlackアーカイブごと、1つの契約ごとに書き換えられているのである。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
公開ウェブ上の高品質な人間執筆テキストの総量は約300兆トークンと推定され、現在のペースでは2026~2032年(中央値2028年)に枯渇するという予測
公開ウェブ上の高品質な人間執筆テキストの総量は約300兆トークンと推定され、現在のペースでは2026~2032年(中央値2028年)に枯渇するという予測 OpenAIとAnthropicは、スタートアップの社内Slack、メール、会議録、GitHubコード履歴を最大30万ドル(約4500万円)で買い取るデータ買収ラッシュを展開
SimpleClosure社は消滅スタートアップのデータ販売を仲介、1社あたり1万~10万ドルの取引を約100件成立