Jak se tento strop blíží, OpenAI a Anthropic obrátily pozornost k dříve nevyužitému zdroji: interním firemním datům . Záznamy skutečných lidských interakcí – emaily s vyjednáváními, přepisy porad s rozhodováním v reálném čase a vlákna na Slacku ukazující autentickou dynamiku pracovního prostředí – nabízejí organická konverzační data, která na scrapovaném veřejném webu chybí.
Vznikl celý nový ekosystém zprostředkovatelských firem, které tyto citlivé transakce zprostředkovávají. Nejčastěji se objevují dvě jména: Mercor a SimpleClosure .
Širší tržní sazby, o kterých v roce 2024 informovala agentura Reuters, dávají představu o hodnotě na jednotku: přibližně 0,001 dolaru za slovo pro text, 1 až 2 dolary za obrázek, 2 až 4 dolary za krátké video a 100 až 300 dolarů za hodinu delšího filmu či videa .
SimpleClosure, firma na likvidaci startupů, za poslední rok zpracovala téměř 100 takových transakcí s platbami v rozmezí 10 000 až 100 000 dolarů za firmu . Její platforma „Asset Hub" pomáhá zakladatelům před licencováním dat očistit osobně identifikovatelné informace (PII) – účinnost a konzistence této anonymizace je však nejistá a stává se rostoucím bodem sporu .
Rozsah, do jakého jsou AI společnosti ochotny zajít, aby zajistily tréninková data, odhalil mimořádný případ projektu Panama, tajného interního programu Anthropicu na vybudování masivní datové sady knih .
Projekt měl dvě větve. Za prvé, Anthropic nakupoval fyzické tištěné knihy, řezal jejich vazby a destruktivně je skenoval stránku po stránce, čímž je převáděl na prohledávatelné PDF a papírové originály vyhazoval. Cíl: převést až 2 miliony knih za šest měsíců . Interní memorandum radilo používat kódové označení „protože nechceme, aby bylo známo, že na tom pracujeme" .
Za druhé, společnost stáhla více než 7 milionů pirátských e-knih z tieňových knihoven včetně LibGen a Pirate Library Mirror . Tato větev vedla k hromadné žalobě podané v roce 2024 autory Andreou Bartz, Kirkem Wallacem Johnsonem a Charlesem Graeberem, kteří Anthropic obvinili z použití téměř půl milionu pirátských knih k trénování modelu Claude .
20. července 2026 federální soudce v San Franciscu schválil vyrovnání ve výši 1,5 miliardy dolarů – největší známé autorskoprávní odškodné v americké historii . Součástí hromadné žaloby bylo více než 500 000 autorů a vydavatelů, kteří obdrží odhadem 3 000 dolarů za každé způsobilé dílo .
Zásadní je, že soud stanovil právní distinkci s obrovským dopadem na trénink umělé inteligence. Použití pirátských e-knih bylo porušením autorských práv a spustilo vyrovnání. Ale nákup fyzických tištěných knih a jejich destruktivní interní skenování za účelem tréninku soud označil za potenciálně kvalifikované jako fair use, protože každá fyzická kopie byla nahrazena jedinou digitální kopií v procesu, který soud nazval „mimořádně transformativním" . 1,5 miliardy dolarů pokrylo závazek z pirátských knih; program fyzického ničení nebyl sankcionován .
Jak společnosti spěchají zpeněžit interní data, objevují se významné otázky. Účinnost anonymizace dat zprostředkovateli jako SimpleClosure je nejistá a stává se rostoucím bodem sporu . Slack zprávy a emaily zaměstnanců obsahují hluboce osobní a citlivé informace a není jasné, zda současné techniky čištění stačí k zabránění re-identifikace.
Mezitím náklady na trénink raketově rostou. Jediný trénink modelu v měřítku GPT-4 může stát 100 milionů dolarů nebo více . Jak dochází kvalitní veřejná data, kombinované náklady na licencování proprietárních firemních dat, placení přelomových vyrovnání jako je Anthropicových 1,5 miliardy dolarů a budování syntetických datových pipelineí dramaticky eskalují. Širší trh s tréninkovými daty pro AI by měl rychle růst z odhadovaných 3,6 miliardy dolarů v roce 2025 na 23 miliard dolarů do roku 2034, jak se licencování lidského textu stává formalizovanou třídou aktiv .
Pro běžné uživatele se situace změnila. Od konce roku 2025 změnily OpenAI i Anthropic své výchozí zásady a umožňují trénink na spotřebitelských konverzacích (ChatGPT Free a Plus, Claude Free, Pro a Max), pokud uživatelé aktivně neodhlásí . Firemní a API zákazníci zůstávají na základě smluvních ujednání o zpracování dat z tréninku standardně vyloučeni
.
Vzkaz je jasný: v závodě o ukojení neukojitelného hladu AI po lidských datech se hranice mezi veřejným a soukromým, osobním a komerčním překreslují – jeden Slack archiv za druhým.