Google-medarbejdere afprøver angiveligt en intern udgave af Gemini 4 med kodenavnet Carbon i virksomhedens kodemiljø Jetski. En tester skal have sagt, at kodningen „føles som Opus 5.5“ – Anthropics model til længerevarende, agentbaserede kodningsopgaver. Men det er et foreløbigt indtryk, ikke resultatet af en offentlig, direkte sammenligning.
29
25 De tilgængelige omtaler indeholder ingen bekræftet benchmarktest af Carbon og heller ingen offentlig plan for, om modellen skal lanceres.
48
Det fortæller medarbejderne angiveligt om Carbon
Business Insider har skrevet, at medarbejdere tester Carbon, med henvisning til interne dokumenter og skærmbilleder.
29 Tilbagemeldingerne beskrives som positive. Én medarbejder sammenlignede forsigtigt kodningen med Claude Opus 5.5, men understregede også, at modellen skulle testes mere.
29
25
Det forbehold er vigtigt. En positiv oplevelse med kodning kan tyde på, at en model er lovende, men den viser ikke, hvordan modellen klarer sig på tværs af opgaver, hvor stabilt den arbejder i længere agentforløb, eller om den kan måle sig med en konkurrent under kontrollerede forhold. De tilgængelige omtaler indeholder ingen sammenlignende benchmarkresultater specifikt for Carbon.
29
48
Omtalerne fastslår heller ikke, hvad Google vil gøre med Carbon. Modellens eventuelle produktnavn, forhold til Argon og fremtidige tilgængelighed er fortsat uafklaret.
25
48
Hvordan Carbon hænger sammen med Gemini 4 Argon
Kodenavnene betegner interne modelversioner, ikke en bekræftet rækkefølge af produkter til offentligheden. Ifølge Business Insiders omtale har Google testet Gemini 4-versioner med navnene Argon, Barium og Carbon. En rapport med henvisning til et internt dokument siger, at Barium-B blev valgt som grundlag for den offentligt annoncerede Gemini 4 Argon.
25
Det fortæller dog ikke præcist, hvor Carbon passer ind. Det kan være et senere udviklingstrin eller en anden version i Gemini 4-familien, men omtalerne bekræfter hverken den nøjagtige forbindelse til de øvrige versioner eller, om Carbon eventuelt lanceres under Argon-navnet.
25
48
Google annoncerede Gemini 4 Argon den 30. september 2026 og begyndte i første omgang at rulle modellen ud til betroede cybersikkerhedsfolk gennem Fairwind-programmet.
36
4 Omtaler fra 9. oktober beskrev stadig ikke Argon som offentligt tilgængelig. Betalende API-kunder og Google AI Ultra-abonnenter blev nævnt som grupper, der skulle omfattes af en senere udvidelse – ikke som brugere med bekræftet, generel adgang på det tidspunkt.
48
16
I Googles lanceringsmateriale oplyses en score på 77,9 % i DeepSWE v1.1 og en forhøjelse af Argons outputgrænse fra 64.000 til 1 million tokens.
4 Det er oplysninger om Argon, ikke testresultater for Carbon. En tredjepartsomtale angav desuden en introduktionspris på 2 dollar pr. million inputtokens og 10 dollar pr. million outputtokens, men det tilgængelige materiale her omfatter ikke en officiel prisliste.
5
Uenighed om Argons kodning er ikke dokumentation for Carbon
Separat omtale af Argon har beskrevet en forskel mellem benchmarkresultaterne og nogle medarbejderes erfaring med praktiske kodningsopgaver, blandt andet arbejde med brugergrænseflader. Google har bestridt fremstillingen af, at Argon skulle være svag til kodning.
2
9 Den diskussion handler om Argon og bør ikke læses som dokumentation for, hvordan Carbon klarer sig.
En anden omtale fortæller, at tidlige interne Argon-versioner mindede en medarbejder om Anthropics ældre Opus 5 på visse kodningsopgaver, mens Carbon senere blev sammenlignet mere positivt med Opus 5.5.
30 Begge dele er gengivelser af medarbejderes indtryk, ikke kontrollerede evalueringer. I Googles officielle annoncering beskrives Argon som en avanceret model til komplekse opgaver, der strækker sig over lang tid. Det bekræfter ikke i sig selv Carbon-medarbejderens vurdering.
36
Den forsigtige konklusion er, at Carbon virker lovende for mindst én af de medarbejdere, der omtales, men at både modellens ydeevne og produktstatus fortsat er uafklaret. Indtil der foreligger resultater for Carbon selv – eller en bekræftet lancering – bør påstanden om, at modellen kan måle sig med Claude Opus 5.5, betragtes som foreløbig intern feedback, ikke som en verificeret sammenligning.
25
29
48