Kildene gir dermed et praktisk bilde av et kjøreverk rundt modellen – med verktøy, tilstand, tilbakemeldinger og grensesnitt som lar agenten utføre arbeid i flere trinn. De fastslår likevel ikke at OpenAI gjorde en ny, navngitt «Harness» tilgjengelig under Apache 2.0-lisensen 20. august.
Materialet dokumenterer ikke:
Påstanden finnes i en sekundær rapport som omtaler codex execapp-server som deler av lanseringen . De offisielle kildene som er oppgitt her, beskriver imidlertid disse funksjonene og komponentene på ulike tidspunkter og i ulike sammenhenger. Uten en tilhørende offisiell kunngjøring eller en bekreftende oppføring i et kildekodelager bør de derfor ikke regnes som bevis på den rapporterte lanseringen.
Et separat OpenAI-eksperiment gir det tydeligste kildebelagte resultatet i materialet. På GPT-5.6 Sol, testet på det offentlige oppgavesettet i ARC-AGI-3, rapporterte OpenAI en poengsum på 13,3 prosent med standard-harnessen. Da selskapet slo på bevart resonnering og kontekstkomprimering gjennom Responses API, steg resultatet til 38,3 prosent – omtrent en tredobling – samtidig som bruken av output-tokens falt med rundt seks ganger .
Sammenligningen beskriver ikke en endring i modellvektene. Det avgjørende var hvordan kjøreverket førte tilstanden videre mellom rundene:
OpenAIs veiledning for utviklere presenterer innstillingene som metoder for å gjenbruke arbeid som allerede er utført og bevare sammenheng over lengre oppgaver . Resultatet bør derfor forstås som en måling av det samlede systemet – modell og kjøreverk – ikke som bevis på at selve grunnmodellen alene ble tre ganger så kapabel.
Benchmark-resultatet har også en viktig begrensning: Det sammenligner to kjøringskonfigurasjoner på et offentlig evalueringssett. Det beviser ikke at den samme forbedringen vil dukke opp i alle agenter, modeller, arbeidsbelastninger eller produksjonsmiljøer.
Den best dokumenterte utviklerlærdommen er ikke den ubekreftede Apache 2.0-kunngjøringen. Det er at OpenAI tilbyr flere måter å bygge videre på agentisk kodearbeid:
Til sammen gjør dette det mulig å plassere en agent i et produkt eller en teknisk arbeidsflyt, i stedet for å begrense den til et generelt samtalegrensesnitt. Utviklere kan legge egne instrukser, verktøy, tillatelser, valideringssteg og regler for tilstandshåndtering rundt modellen. Det er en dokumentert integrasjonsretning. Den bredere påstanden om at én samlet Apache-lisensiert Harness-lansering formaliserer alt dette, er fortsatt ubekreftet i de offisielle kildene som er lagt frem.
Kildene oppgir ingen selskaper som har tatt i bruk det påståtte Apache-lisensierte rammeverket. De dokumenterer heller ikke selskapsresultater fra juridiske, operative, forskningsrelaterte eller andre arbeidsflyter utenfor koding.
Det finnes riktignok bredere tegn på at Codex brukes av bedriftskunder: OpenAI opplyste at Codex i juni sto for 64 prosent av de samlede output-tokenene fra Codex og ChatGPT blant bedriftskunder . Tallet viser betydelig aktivitet i bedriftsmarkedet, men dokumenterer ikke bruk av den påståtte Harness-pakken, identifiserer ingen bestemte selskaper og fastslår ikke noen forretningsmessig effekt.
Det bekreftede mønsteret peker mot et skifte fra chatbasert hjelp til delegert utførelse. Codex kombinerer en modell med verktøy, en iterativ tilbakemeldingssløyfe, varig eller komprimert tilstand og kjøre-miljøer som kan utføre arbeid over flere trinn .
For produktteam kan denne arkitekturen danne grunnlag for spesialiserte agenter for kodearkiver, interne operasjoner, forskningsoppgaver eller andre kontrollerte arbeidsflyter. Kvaliteten vil ikke bare avhenge av modellvalget, men også av hvordan utviklerne utformer verktøytilgang, lagring av tilstand, kontekstgrenser, validering og håndtering av feil.
Det er den varige lærdommen fra ARC-AGI-3-eksperimentet: Endrer man kjøreverket, kan man endre både kapasitet og effektivitet. Men med dokumentasjonen som foreligger her, er det mer presist å beskrive OpenAIs Codex-kjøreverk og API-komponenter enn å omtale Apache 2.0-lanseringen av «Harness» 20. august som et etablert faktum.