隨著這個天花板逐漸逼近,OpenAI 與 Anthropic 將目光轉向一個過去未被充分利用的寶庫:內部企業協作資料。真實的人類互動紀錄——包含談判過程的電子郵件、即時決策的會議逐字稿,以及展現真實工作動態的 Slack 討論串——提供了在已遭大量爬取的公開網路上變得稀缺的有機對話資料。
根據路透社 2024 年的報導,更廣泛的市場費率顯示了每單位的價值:文字約 每字 0.001 美元,圖片 每張 1 到 2 美元,短影片 每則 2 到 4 美元,較長的電影或影片則為 每小時 100 到 300 美元。
SimpleClosure 是一家新創公司清算公司,在過去一年處理了近 100 筆這類交易,每間公司的付款金額從 1 萬到 10 萬美元不等。該公司的「Asset Hub」平台幫助創辦人在授權資料之前,先清除個人識別資訊(PII)——儘管這種匿名化的有效性和一致性仍不確定,且正成為一個日益嚴重的爭議點。
AI 公司為了取得訓練資料願意走得多遠,從 巴拿馬計畫(Project Panama)這起非同尋常的案件中可見一斑。這是 Anthropic 內部一個祕密計畫,旨在建立一個龐大的書籍訓練資料集。
該計畫有兩條路線。第一,Anthropic 購買實體印刷書籍,切開書脊,然後破壞性地逐頁掃描,將其轉換為可搜尋的 PDF 檔案,並丟棄紙本原稿。目標是在 六個月內轉換多達 200 萬本書。一份內部備忘錄建議使用代號,「因為我們不希望外界知道我們正在從事這項工作」。
第二,該公司從影子圖書館(包括 LibGen 和 Pirate Library Mirror)下載了超過 700 萬本盜版電子書檔案。這條路線導致了 2024 年由作家 Andrea Bartz、Kirk Wallace Johnson 和 Charles Graeber 提起的集體訴訟,他們指控 Anthropic 使用近 50 萬本盜版書籍來訓練 Claude。
2026 年 7 月 20 日,舊金山一名聯邦法官批准了一項 15 億美元的和解協議——這是美國史上已知最大的著作權賠償金。超過 50 萬名作者和出版商屬於此集體訴訟的一部分,他們預計每件符合資格的作品可獲得約 3,000 美元。
關鍵在於,法院做出了一項對 AI 訓練有重大影響的法律區分。使用 盜版電子書 屬於侵權行為,因此觸發了和解。但是,購買 實體印刷書籍並在內部進行破壞性掃描 以用於訓練,則被裁定可能符合 合理使用 的範圍,因為每一本實體書都被替換為單一數位拷貝,法院稱此過程「極具轉換性」。這 15 億美元涵蓋了盜版書籍的責任;實體書破壞計畫則未受處罰。
隨著各公司急於將內部資料變現,重大的問題依然存在。像 SimpleClosure 這類仲介商的資料匿名化效果仍不確定,且成為日益嚴重的爭議點。員工的 Slack 訊息和電子郵件包含極其私密和敏感的資訊,而目前的去除技術是否足以防止重新識別,尚不明朗。
與此同時,訓練成本正在飆升。一次 GPT-4 規模的訓練執行可能已經花費 1 億美元或更多。隨著高品質公開資料耗盡,授權專屬企業資料、支付像 Anthropic 的 15 億美元這類里程碑式和解金,以及建立合成資料管線的綜合成本都在急劇上升。更廣泛的 AI 訓練資料集市場預計將快速成長,從 2025 年 estimated 的 36 億美元 成長到 2034 年的 230 億美元,因為人類文字授權正成為一個正式化的資產類別。
對個別使用者而言,情況已經改變。截至 2025 年底,OpenAI 和 Anthropic 都已更改其預設政策,允許在消費者等級的聊天(ChatGPT Free 與 Plus,Claude Free、Pro 與 Max)上進行訓練,除非使用者主動選擇退出。企業和 API 客戶根據合約中的資料處理協議(DPA),預設仍被排除在訓練之外
。
訊息很明確:在滿足 AI 對人類生成資料無止境需求的競賽中,公共與私人、個人與商業之間的界線正被重新劃定——一次一個 Slack 檔案。