根據 Reuters 喺 2024 年嘅報導,整體市場價錢大約係:文字 $0.001 一個字,圖片 $1 至 $2 一張,短片 $2 至 $4 一段,長片或視頻 $100 至 $300 每小時 。
SimpleClosure 呢間專門幫初創清盤嘅公司,過去一年處理咗接近 100 宗呢類交易,每單金額由 10,000 到 100,000 美元不等 。佢哋嘅「Asset Hub」平台可以幫創辦人喺賣數據之前,刪走個人身份資料(PII),但呢種匿名化嘅效果同可靠性仲係一個大問號 。
AI 公司為咗搶訓練數據可以去到幾盡?Anthropic 嘅「巴拿馬計劃」(Project Panama)就係一個極端例子 。
呢個計劃有兩個部分。第一,Anthropic 買實體書,剪開書脊,逐頁銷毀式掃描,變成可搜尋嘅 PDF,然後丟棄紙本書。目標係 六個月內掃描 2,000 萬本書 。內部備忘錄仲提醒要用代號,「因為我哋唔想俾人知我哋做緊呢件事」。
第二,公司從 LibGen 同 Pirate Library Mirror 呢啲「影子圖書館」非法下載咗 超過 700 萬本盜版電子書 。呢個部分引發咗集體訴訟,由作家 Andrea Bartz、Kirk Wallace Johnson 同 Charles Graeber 喺 2024 年提出,指控 Anthropic 用接近 50 萬本盜版書嚟訓練 Claude 。
2026 年 7 月 20 日,三藩市聯邦法官批准咗 15 億美元 嘅和解協議,係美國版權案件入面最大嘅和解金額 。超過 50 萬名作者同出版社係集體訴訟嘅一部分,每個合資格作品預計可以獲得 約 3,000 美元 嘅賠償 。
關鍵在於,法庭劃咗一條重要界線:用 盜版電子書 係侵權,要賠錢。但係買 實體書然後銷毀掃描 嚟訓練 AI,就俾法庭裁定可能屬於「公平使用」(fair use),因為每本實體書只係被轉換成一個數碼副本,法庭形容呢個過程「極具轉化性」。15 億美元係賠畀盜版書嘅部分,個銷毀掃描計劃就冇罰 。
隨住公司爭相將內部數據變現,問題亦都浮面。數據匿名化嘅效果成疑 。員工嘅 Slack 對話同電郵入面有好多私人同敏感嘅資訊,而家嘅技術係咪足夠防止重新識別個人身份,仍然係未知之數。
另一方面,訓練成本亦都幾何級上升。一次 GPT-4 規模嘅訓練可能已經要 1 億美元或以上 。隨住高質素公開數據用晒,授權企業數據嘅費用、好似 Anthropic 15 億美元呢類鉅額和解金,同埋建立合成數據管道嘅成本,全部都喺度急升。整體 AI 訓練數據集市場預計會由 2025 年嘅 36 億美元,增長到 2034 年嘅 230 億美元,人類文字授權將會變成一個正式嘅資產類別 。
對一般用戶嚟講,情況已經唔同晒。截至 2025 年底,OpenAI 同 Anthropic 都改咗政策,預設情況下會用消費者級別嘅對話嚟訓練模型(包括 ChatGPT Free 同 Plus,Claude Free、Pro 同 Max),除非用戶主動退出 。企業同 API 客戶就唔受影響,根據合約嘅數據處理協議,佢哋嘅數據唔會用嚟訓練
。
簡單講:喺餵飽 AI 對人類數據嘅無窮渴求呢場競賽入面,公與私、個人同商業嘅界線,正正喺度重新劃分——一個 Slack 檔案庫、一個資料夾咁樣慢慢改寫緊。