OpenAI sier eksterne organisasjoner skal kunne vurdere sikkerheten i frontmodeller under trening, evaluering og utrulling – ikke bare rett før lansering. Rammeverket bygger på uavhengighet, vitenskapelig kvalitet, sikkerhet og tydelig ansvarsfordeling, men er frivillig og ikke et eksternt godkjenningsregime.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s new plan to allow independent organizations to conduct technical safety assessments earlier in the training, evaluation, an. Article summary: OpenAI says it will give independent organizations deeper, earlier access to frontier models so they can perform technical safety assessments during training, evaluation, and deployment—not merely shortly before release.. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
OpenAI sier at selskapet vil støtte uavhengige tekniske sikkerhetsvurderinger tidligere i utviklingen av de mest avanserte KI-modellene. Eksterne organisasjoner skal få dyptgående tilgang under trening, evaluering og utrulling – ikke bare i sluttfasen før en modell lanseres. Hensikten er å la utenforstående etterprøve selskapets sikkerhetspåstander, avdekke blindsoner og teste om tiltakene faktisk virker. 5
Dette er en utvidelse av den vanlige modellen med «red teaming» før lansering. Men ordningen er foreløpig et frivillig rammeverk, ikke en uavhengig lisensordning eller et bindende krav om å stanse utrulling. Om den får praktisk betydning, vil avhenge av hvor mye innsyn evaluatorene får, hvor frie de er, og hva som skjer når de finner alvorlige problemer.
OpenAI beskriver tredjepartsvurderinger som en måte å teste dokumentasjonen bak påstander om modellkapasiteter, risikoer og sikkerhetstiltak. Vurderingene skal kunne omfatte hele løpet fra trening og evaluering til intern og ekstern utrulling. 5
Ifølge omtale av rammeverket er en sentral oppgave å vurdere et KI-labs «sikkerhetsgrunnlag» på tvers av disse fasene. Rammeverket skisserer fire vurderingsområder og sju driftsprinsipper. Laboratoriene skal få tid til å rette opp funn før publisering, og kan be om redigeringer av sensitiv informasjon. 2
Tidlig tilgang er viktig fordi funn helt på slutten kan komme etter at tekniske og kommersielle valg er vanskelige å reversere. Samtidig kan slik tilgang eksponere følsomme modellvekter, testmateriale og farlige kapasiteter. Sikkerhetshensyn er derfor reelle – men bør ikke bli en generell begrunnelse for å holde tilbake vesentlige funn.
OpenAI trekker fram fire grunnvilkår: sterke mekanismer for uavhengighet, vitenskapelig grundighet, robuste sikkerhetsrutiner og tydelig ansvarsfordeling. 5
En vurdering er vanskelig å kalle uavhengig dersom utvikleren kan styre metodene, begrense tilgangen etter ubehagelige resultater eller avslutte finansieringen fordi konklusjonen er uønsket. Uavhengighet handler dermed om finansiering, styring, mandat og kommunikasjon – ikke bare om at evaluatorene jobber utenfor selskapet.
En sammenslutning av evaluatorer har etterlyst vern mot kontroll fra selskapene som undersøkes og rett til å publisere hovedfunn, med kun snevert avgrensede sikkerhetsredigeringer. 17
34
Vurderingene må utføres av kvalifiserte fagfolk, med holdbare metoder og dokumentasjon som kan granskes eller reproduseres. Future of Life Institute har kritisert fragmenterte tester med svak gyldighet og tatt til orde for mer troverdige, eksterne evaluatorer. 8
12
Å gi utenforstående tidligere tilgang til frontmodeller kan i seg selv skape risiko. OpenAI sier laboratoriene må legge til rette for reell gransking, samtidig som de beskytter sensitiv informasjon. 5
Det må være klart hvem som gir tilgang, velger metoder, mottar funnene og avgjør om tiltak er gode nok. Like viktig er en eskaleringsvei dersom en alvorlig risiko ikke blir løst. Uten dette kan en evaluering ende som et råd ledelsen i praksis kan ignorere.
Tredjepartsvurderinger er en kontrollmekanisme, ikke en teknisk løsning på problemet med KI-«alignment» – altså å sikre at systemene følger menneskelige mål og begrensninger. De kan teste om et selskaps påstander om risiko og sikkerhetstiltak holder vann, men løser ikke nødvendigvis risiko for feilinnretting eller tap av kontroll.
I et separat politisk rammeverk sier OpenAI at utviklere av frontmodeller bør evaluere og redusere risiko knyttet til blant annet cyberkapasiteter, CBRN-risikoer (kjemiske, biologiske, radiologiske og nukleære trusler), tap av kontroll, feilinnretting og framgang mot rekursiv selvforbedring (RSI). RSI viser her til KI-systemer som kan bidra til å forbedre egne evner gjentatte ganger. Rammeverket etterlyser også offentlige sikkerhetsrapporter, med redigeringer av sikkerhets- og forretningssensitiv informasjon. 7
Eksterne evaluatorer kan bidra til å verifisere om slike vurderinger er troverdige. De kan ikke alene løse risikoene.
Anthropic-sjef Dario Amodei har tatt til orde for en mer kontinuerlig modell: eksterne evaluatorer med løpende, «ansatt-lignende» tilgang inne i laboratoriene. De skulle ikke bare se på ferdige modeller, men også treningsløp, utrullingspraksis, interne sikkerhetstiltak og alvorlige hendelser. 18
21
Anthropic har kunngjort en ordning der Accenture-personell skal arbeide inne i selskapet for å granske modeller og praksis. Selskapet har samtidig erkjent at standarder for evaluatorenes tilgang og kommunikasjon ennå ikke er fastsatt. 19
22
OpenAIs nye rammeverk overlapper med ambisjonen om tidligere og dypere innsyn, men den offentlige beskrivelsen er mest rettet mot tekniske vurderinger i ulike utviklingsfaser. Om det gir den vedvarende tilgangen som ligger i Anthropic-modellen, er fortsatt uklart. 5
Anthropic, OpenAI og Google DeepMind skal ha diskutert et felles, frivillig organ for KI-sikkerhetsstandarder. 20 Felles standarder kan gjøre det enklere å sammenligne metoder, definere risikoterskler og stille like krav til rapportering av hendelser.
Men en bransjestandard løser ikke automatisk interessekonflikter og skaper ikke juridisk håndheving. Den blir sterkest når den kombineres med åpen måling, uavhengig verifisering og reelle følger ved manglende etterlevelse.
Kritikerne avviser ikke nødvendigvis ekstern testing. De spør om tilsynet kan være genuint uavhengig når selskapet fortsatt kan velge evaluatorer, fastsette tilgang, be om redigeringer og likevel gå videre med lansering etter negative funn.
De peker særlig på fire spørsmål:
Tidligere OpenAI-forsker Daniel Kokotajlo har kritisert ledende KI-selskaper for å «move fast and break things» i jakten på markedsandeler. 36
40 Kjernen i kritikken er strukturell: Hvis selskapene ensidig kontrollerer tilgang, publisering og beslutningen om utrulling, kan ekstern vurdering forbedre kunnskapsgrunnlaget uten å bli reelt, uavhengig tilsyn.
OpenAIs forslag flytter sikkerhetsvurderinger til et tidspunkt der de i teorien kan påvirke både trening og utrulling. De fire prinsippene er fornuftige. 5
Men den virkelige testen kommer i gjennomføringen: varig tilgang for evaluatorene, metodefrihet, beskyttet rapportering, åpen håndtering av redigeringer og en troverdig prosess for å handle på alvorlige funn. Uten slike garantier kan dette bli verdifull ekstern testing – men ikke det uavhengige tilsynet kritikerne etterlyser.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
OpenAI sier eksterne organisasjoner skal kunne vurdere sikkerheten i frontmodeller under trening, evaluering og utrulling – ikke bare rett før lansering.
OpenAI sier eksterne organisasjoner skal kunne vurdere sikkerheten i frontmodeller under trening, evaluering og utrulling – ikke bare rett før lansering. Rammeverket bygger på uavhengighet, vitenskapelig kvalitet, sikkerhet og tydelig ansvarsfordeling, men er frivillig og ikke et eksternt godkjenningsregime.
Anthropic har foreslått mer løpende, «ansatt lignende» tilgang for eksterne evaluatorer.