Kun tämä katto lähestyy, OpenAI ja Anthropic ovat kohdistaneet huomionsa aiemmin koskemattomaan aarteeseen: yritysten sisäiseen yhteistyödataan . Tosielämän ihmisvuorovaikutuksen tallenteet – neuvotteluja sisältävät sähköpostit, reaaliaikaista päätöksentekoa sisältävät kokouspöytäkirjat ja aitoja työpaikan dynamiikkoja paljastavat Slack-ketjut – tarjoavat sellaista orgaanista keskusteludataa, josta on tullut niukkaa raaputetussa julkisessa verkossa.
Uusi välittäjäyritysten ekosysteemi on syntynyt hoitamaan näitä arkaluonteisia transaktioita. Kaksi nimeä nousee useimmiten esille: Mercor ja SimpleClosure .
Laajemmat markkinahinnat, joista Reuters uutisoi vuonna 2024, antavat käsityksen arvosta yksikköä kohden: noin 0,001 dollaria per sana tekstistä, 1–2 dollaria per kuva, 2–4 dollaria per lyhyt video ja 100–300 dollaria per tunti pidempää elokuvaa tai videota .
SimpleClosure, startupien alasajoon erikoistunut yritys, on käsitellyt lähes 100 tällaista kauppaa viimeisen vuoden aikana, maksujen vaihdellessa 10 000 ja 100 000 dollarin välillä per yritys . Yrityksen "Asset Hub" -alusta auttaa perustajia poistamaan henkilötietoja datasta ennen lisensointia – vaikka anonymisoinnin tehokkuus ja johdonmukaisuus ovat edelleen epävarmoja ja kasvava kiistanaihe .
Tekoäly-yritysten valmius hankkia harjoitusdataa paljastui täysin Project Panama -tapauksessa, Anthropicin salaisessa sisäisessä ohjelmassa valtavan kirjaharjoitusdatan luomiseksi .
Hankkeella oli kaksi osaa. Ensinnäkin Anthropic osti fyysisiä painettuja kirjoja, leikkasi niiden sidokset auki ja skannasi ne tuhoavasti sivu sivulta muuntaen ne selattaviksi PDF-tiedostoiksi ja heittäen paperiversiot pois. Tavoitteena oli muuntaa jopa 2 miljoonaa kirjaa kuudessa kuukaudessa . Sisäinen muistio neuvoi käyttämään koodinimeä, "koska emme halua sen tulevan tunnetuksi, että työskentelemme tämän parissa" .
Toiseksi, yritys latasi yli 7 miljoonaa piraattista e-kirjatiedostoa varjokirjastoista, kuten LibGen ja Pirate Library Mirror . Tämä johti vuonna 2024 nostettuun ryhmäkanteeseen, jossa kirjailijat Andrea Bartz, Kirk Wallace Johnson ja Charles Graeber syyttivät Anthropicia käyttäneen lähes puolta miljoonaa piraattikirjaa Clauden kouluttamiseen .
20. heinäkuuta 2026 liittovaltion tuomari San Franciscossa hyväksyi 1,5 miljardin dollarin sovinnon – Yhdysvaltain historian suurimman tunnetun tekijänoikeuskorvauksen . Yli 500 000 kirjailijaa ja kustantajaa kuului ryhmäkanteeseen, ja he saavat arviolta 3 000 dollaria per oikeutettu teos .
Ratkaisevaa oli, että tuomioistuin teki oikeudellisen eron, jolla on suuria vaikutuksia tekoälykoulutukseen. Piraattisten e-kirjojen käyttö loukkasi tekijänoikeuksia ja laukaisi sovinnon Mutta fyysisten painettujen kirjojen ostaminen ja tuhoava skannaaminen sisäisesti koulutusta varten katsottiin mahdollisesti hyväksyttäväksi käytöksi (fair use), koska jokainen fyysinen kopio korvattiin yhdellä digitaalisella kopiolla prosessissa, jota tuomioistuin kutsui "erittäin transformatiiviseksi" . 1,5 miljardia dollaria kattoi piraattikirjojen vastuun; fyysistä tuhoamisohjelmaa ei rangaistu .
Kun yritykset ryntäävät kaupallistamaan sisäistä dataa, merkittäviä kysymyksiä jää ilmaan. Datan anonymisoinnin tehokkuus välittäjien, kuten SimpleClosuren, toimesta on epävarmaa ja kasvava kiistanaihe . Työntekijöiden Slack-viestit ja sähköpostit sisältävät syvästi henkilökohtaista ja arkaluonteista tietoa, eikä ole selvää, riittävätkö nykyiset poistotekniikat estämään uudelleentunnistamisen.
Samaan aikaan koulutuskustannukset karkaavat käsistä. Yksi GPT-4-tason koulutusajo saattaa jo maksaa 100 miljoonaa dollaria tai enemmän . Kun korkealaatuinen julkinen data loppuu, lisensointikustannukset, ennennäkemättömät sovintoratkaisut ja synteettiset dataputket nostavat kustannuksia dramaattisesti. Laajemman tekoälyn harjoitusdatamarkkinoiden arvioidaan kasvavan nopeasti arviolta 3,6 miljardista dollarista vuonna 2025 23 miljardiin dollariin vuoteen 2034 mennessä, kun ihmistekstin lisensoinnista tulee institutionalisoitunut omaisuusluokka .
Yksittäisille käyttäjille maisema on muuttunut. Loppuvuodesta 2025 sekä OpenAI että Anthropic muuttivat oletuskäytäntöjään salliakseen koulutuksen kuluttajatason chateista (ChatGPT Free ja Plus, Claude Free, Pro ja Max), ellei käyttäjä aktiivisesti kiellä . Enterprise- ja API-asiakkaat on edelleen suljettu koulutuksen ulkopuolelle oletusarvoisesti sopimuksellisten tietojenkäsittelysopimusten perusteella
.
Viesti on selvä: kilpailussa tekoälyn kyltymättömän ihmisdatan nälän ruokkimiseksi julkisen ja yksityisen, henkilökohtaisen ja kaupallisen välistä rajaa piirretään uudelleen – yksi Slack-arkisto kerrallaan.