Google testaa sisäisesti Gemini 4:n versiota, jonka koodinimi on Carbon. Yhtiön työntekijät ovat kokeilleet sitä Googlen Jetski-koodausympäristössä, ja yksi testaaja kuvaili sen koodausta sanoin ”tuntuu Opus 5.5:ltä” viitaten Anthropicin malliin. Kyse on kuitenkin alustavasta käyttäjäkokemuksesta, ei julkaistusta vertailutestistä.
29
25 Tiedossa ei ole Carbonille tehtyä julkista vertailutulosta eikä vahvistettua julkaisusuunnitelmaa.
48
Carbonista kerrottu palaute on alustavaa
Business Insider kertoi työntekijöiden testanneen Carbonia sisäisten asiakirjojen ja kuvakaappausten perusteella.
29 Palaute oli sen mukaan myönteistä: yksi työntekijä vertasi mallin koodausta Claude Opus 5.5:een. Sama testaaja kuitenkin korosti, että mallia täytyy kokeilla lisää.
29
25
Ero on olennainen. Yksittäisen testaajan myönteinen vaikutelma voi kertoa lupaavasta kehitysversiosta, mutta se ei vielä osoita, miten malli suoriutuu erilaisista tehtävistä tai pitkistä, useita vaiheita sisältävistä koodaustyönkuluista. Se ei myöskään kerro, pärjääkö Carbon kilpailijoille vertailukelpoisissa olosuhteissa. Saatavilla olevissa uutisissa ei ole Carbonia koskevia vertailutestejä.
29
48
Raportointi ei myöskään vahvista, mitä Google aikoo tehdä Carbonilla. Sen mahdollinen tuotenimi, suhde Argoniin ja se, julkaistaanko mallia lainkaan, ovat avoimia kysymyksiä.
25
48
Carbonin ja Argonin yhteys ei ole selvä
Argon, Barium ja Carbon ovat sisäisiä malliversioiden nimiä, eivät vahvistettu julkisten tuotteiden julkaisujärjestys. Business Insiderin mukaan Google on testannut Gemini 4:n versioita näillä nimillä. Sisäiseen asiakirjaan perustuvan raportin mukaan Barium-B-versio valittiin julkisuuteen tuodun Gemini 4 Argonin pohjaksi.
25
Tämä ei vielä kerro tarkasti, mihin Carbon sijoittuu. Se voi olla myöhempi kehitysversio tai toinen Gemini 4 -perheen versio, mutta raportointi ei vahvista sen täsmällistä kehityspolkua eikä sitä, julkaistaisiinko se Argon-nimellä.
25
48
Google julkisti Gemini 4 Argonin 30. syyskuuta 2026 ja aloitti sen käyttöönoton Fairwind-ohjelman kautta luotetuilla kyberturva-asiantuntijoilla.
36
4 Vielä 9. lokakuuta Argonia kuvattiin malliksi, joka ei ollut yleisesti saatavilla. Maksulliset API-asiakkaat ja Google AI Ultra -tilaajat mainittiin suunnitellun laajemman jakelun kohderyhminä, eivät ryhminä, joille olisi jo vahvistettu yleinen pääsy.
48
16
Googlen julkaisumateriaalin mukaan Argon sai DeepSWE v1.1 -testissä 77,9 prosentin tuloksen, ja sen tulostusraja nousi 64 000 tokenista miljoonaan.
4 Nämä ovat Argonin tietoja, eivät Carbonin testituloksia. Kolmannen osapuolen uutisoinnissa Argonin alustavaksi API-hinnaksi kerrottiin 2 dollaria miljoonalta syötetokenilta ja 10 dollaria miljoonalta tulostetokenilta, mutta saatavilla olevassa aineistossa ei ole virallista hinnastoa.
5
Argonin koodauskritiikki ei kerro Carbonista
Argonista erikseen julkaistuissa jutuissa on käsitelty eroa vertailutestien ja joidenkin työntekijöiden käytännön kokemusten välillä. Kritiikki koski muun muassa koodaustehtäviä ja käyttöliittymien toteutusta. Google kiisti kuvauksen, jonka mukaan Argon olisi heikko koodaamisessa.
2
9 Tätä keskustelua ei pidä tulkita näytöksi Carbonin suorituskyvystä.
Toisessa raportissa kerrottiin, että Argonin varhaiset sisäiset versiot toivat joillekin työntekijöille mieleen Anthropicin vanhemman Opus 5 -mallin tietyissä koodaustehtävissä. Carbon puolestaan sai myöhemmin myönteisemmän Opus 5.5 -vertauksen.
30 Kummassakin tapauksessa kyse on raportoituista työntekijöiden arvioista, ei kontrolloiduista testeistä. Google kuvailee virallisessa julkistuksessaan Argonia malliksi vaativiin, pitkäkestoisiin tehtäviin, mutta se ei itsessään vahvista Carbonista kerrottua suorituskykyä.
36
Varovainen johtopäätös on, että ainakin yksi testaaja pitää Carbonia lupaavana. Sen todellinen suorituskyky ja tuotestatus ovat silti selvittämättä. Ennen kuin Carbonista julkaistaan omia testituloksia tai sen julkaisusta vahvistetaan, väitettä Claude Opus 5.5:n tasosta kannattaa pitää alustavana sisäisenä palautteena, ei todennettuna mallivertailuna.
25
29
48