OpenAI positionerade GPT-5.6 Sol som en ny gräns inom tre nyckelområden: kodning, biologi och cybersäkerhet .
Terminal-Bench 2.1 testar kommandoradsarbetsflöden som kräver flerstegsplanering, verktygssamordning och iteration . Benchmarken har 89 komplexa programmeringsuppgifter
. Resultaten inkluderar:
| Modell | Poäng |
|---|---|
| GPT-5.6 Sol Ultra | 91,9 % |
| GPT-5.6 Sol (max) | 88,8 % |
| Claude Mythos 5 | 88,0 % |
| GPT-5.6 Terra | 84,3 % |
| Claude Fable 5 | 84,3 % |
| GPT-5.5 | 83,4 % |
| GPT-5.6 Luna | 82,5 % |
GPT-5.6 Sol Ultra satte en ny toppnotering med 91,9 % . Standardpoängen för Sol på 88,8 % slår Anthropics begränsade frontmodell Claude Mythos 5, som fick 88,0 %, med nästan en hel poäng
.
På GeneBench v1, en benchmark som utvärderar långsiktiga genomik- och kvantitativ biologi-analysuppgifter, rapporterar OpenAI att Sol uppnådde starkare resultat än GPT-5.5 samtidigt som den använde färre utdatatokens . Detta innebär en meningsfull effektivitetsförbättring för vetenskapliga forskningsarbetsflöden.
På ExploitBench, en benchmark för cybersäkerhetsforskning, matchade GPT-5.6 Sol nästan prestandan hos Anthropics Mythos Preview samtidigt som den använde ungefär en tredjedel av utdatatokensarna .
På ExploitGym, en benchmark byggd av UC Berkeley-forskare i samarbete med OpenAI och andra ledande AI-labb, visade alla tre GPT-5.6-modellerna förbättrad cybersäkerhetskapacitet i takt med att resonemangsförmågan ökade .
Viktigt att notera är att OpenAI uppger att GPT-5.6 Sol inte överskrider den kritiska cybersäkerhetströskeln enligt deras beredskapsramverk . I utvärderingar som involverade Chromium och Firefox identifierade modellen buggar och exploateringsprimitiver – byggstenarna för en exploit – men producerade inte autonomt en funktionell fullständig exploitkedja under de testade förhållandena
. Hela GPT-5.6-modellserien klassificerades internt som "Hög" risk (för cybersäkerhet och biovapenkapacitet) men inte den högsta kritiska nivån
.
OpenAI säger att GPT-5.6 Sol lanseras med sin "mest robusta säkerhetsstack hittills" . Säkerhetsstrategin inkluderar:
Under förhandsvisningen kan vissa uppmaningar saktas ner eller blockeras för extra granskning medan OpenAI finjusterar falska positiva och falska negativa frekvenser .
Utrullningen av GPT-5.6 skiljer sig från alla tidigare OpenAI-lanseringar. På begäran av USA:s regering begränsar OpenAI initialt åtkomsten till en liten grupp betrodda partners och organisationer – enligt Axios omfattar förhandsvisningen cirka 20 godkända företag – medan modellen genomgår ytterligare nationella säkerhetsgranskningar .
Förhandsvisningen är inte ett brett självbetjäningsprogram. Under denna period är GPT-5.6 Sol, Terra och Luna endast tillgängliga via OpenAI API och Codex för denna begränsade grupp . Modellerna är inte tillgängliga i ChatGPT under förhandsvisningen
. OpenAI säger att bredare tillgänglighet i ChatGPT, Codex och API:et planeras "under de kommande veckorna"
.
OpenAI uttalade tydligt att de ser den statligt styrda metoden som en tillfällig åtgärd: "Vi tror på bred tillgång, och denna process bör inte bli den långsiktiga standarden" . I ett internt meddelande sa VD Sam Altman till personalen att regeringen skulle "godkänna åtkomst kund för kund under denna förhandsvisningsperiod", med en bredare lansering förhoppningsvis några veckor senare
.
Detta kom ur samtal med Office of the National Cyber Director och Office of Science and Technology Policy , vilket återspeglar ett nytt ramverk för frontmodeller som testas av Trump-administrationen
.
| Modell | Inmatning / 1M tokens | Utmatning / 1M tokens |
|---|---|---|
| GPT-5.6 Sol | $5,00 | $30,00 |
| GPT-5.6 Terra | $2,50 | $15,00 |
| GPT-5.6 Luna | $1,00 | $6,00 |
Sols prissättning matchar GPT-5.5:s, medan Terra är ungefär 2 gånger billigare än GPT-5.5 . Som jämförelse prissätts Sol närmare Claude Opus 4.8 ($5/$25) än Anthropics begränsade Mythos 5 ($10/$50)
.
OpenAI meddelade också att GPT-5.6 Sol kommer att distribueras på Cerebras-hårdvara i juli , med slutledningshastigheter på upp till 750 tokens per sekund
.
GPT-5.6-familjen markerar en betydande avvikelse från tidigare OpenAI-lanseringar. Den trestegsindelade förpackningen (Sol, Terra, Luna) introducerar ett beständigt varumärke som frikopplar modellserier från kapacitetsnivåer. Benchmarkresultaten – särskilt Sols toppmoderna kodningspoäng på Terminal-Bench 2.1 och dess effektivitetsvinster på ExploitBench – visar på meningsfulla framsteg, särskilt inom cybersäkerhet och biologi. Men den mest avgörande egenskapen för denna lansering kan vara de statligt påkallade åtkomstbegränsningarna, som representerar ett nytt paradigm för distribution av avancerad AI.