Evan Hubingers anslag på over 10 prosent var en personlig vurdering, ikke Anthropic politikk eller vitenskapelig konsensus. Han skiller mellom lav risiko fra dagens modeller og bekymring for fremtidige systemer som kan bidra til å forbedre seg selv.
Publisert avRedigert med GPT-5.6 TerraBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic alignment science lead Evan Hubinger’s public statement that he personally believes there is more than a 10% chance AI co. Article summary: Hubinger’s statement chiefly exposed a sharp mismatch between frontier-AI labs’ public safety posture and the private-level uncertainty described by people closest to the work: a senior alignment lead said the field may . Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Evan Hubingers offentlige uttalelse fastslår ikke at KI vil føre til menneskehetens undergang. Den sier noe mer avgrenset – og derfor oppsiktsvekkende: Lederen for Alignment Science hos Anthropic oppga at han personlig mener sannsynligheten er over 10 prosent for at KI kan drepe alle mennesker i løpet av det neste tiåret. Samtidig skrev han at Anthropic ennå ikke har en plan for å løse såkalt alignment for superintelligens, og heller ikke tydelig er på vei mot en slik løsning. 1
2
Med alignment menes her utfordringen med å sikre at svært avanserte KI-systemer forblir styrt av menneskelige mål, verdier og begrensninger. Hubingers uttalelse ga dermed konkret tyngde til bekymringen bak Jacob Coxons oppsigelse: At laboratorier i front kan utvikle langt kraftigere systemer før det er vist at de kan holdes pålitelig under menneskelig kontroll. 2
3
Tallet på «over 10 prosent» var Hubingers egen vurdering. Det ble ikke lagt fram som et offisielt risikoanslag fra Anthropic, en intern faglig enighet eller en etablert vitenskapelig prognose. 1
2
Dette forbeholdet er avgjørende. Et sannsynlighetsanslag forklarer verken nøyaktig hvordan en katastrofe skulle oppstå, når den eventuelt kan skje, eller at den er sannsynlig. Hubinger skal også ha sagt at risikoen fra modellene som finnes i dag, er lav. Bekymringen hans gjelder fremtidige systemer med vesentlig større kapasitet – blant annet dersom KI kan brukes til å bidra til å utvikle enda mer kapabel KI, ofte omtalt som rekursiv selvforbedring. 2
10
Likevel er uttalelsen bemerkelsesverdig fordi den kommer fra en person som leder arbeid med alignment i et av verdens ledende KI-laboratorier. Det sentrale er derfor ikke bare det dramatiske tallet, men avstanden mellom rask kapasitetsutvikling og sikker kunnskap om hvordan superintelligente systemer kan kontrolleres. 1
2
Coxon, som tidligere har jobbet både i OpenAI og Anthropic, sa opp mens han argumenterte for at ingen av selskapene opptrer ansvarlig, og at de kappløper mot selvforbedrende superintelligens. Hubinger ga offentlig støtte til Coxons påstand om at de som bygger systemene, oppriktig anser utfall på utryddelsesnivå som mulige. 2
3
Det beviser ikke at alle ansatte deler samme syn. Det gjør heller ikke Coxons beskrivelse til en uavhengig verifisert vurdering av begge selskapene. Men det gjør det vanskeligere å avfeie oppsigelsen som en enkeltstående protest fra en tidligere ansatt. En nåværende leder innen KI-sikkerhet bekreftet det underliggende poenget: Alvorlig intern bekymring kan eksistere samtidig som utviklingen av de mest avanserte modellene fortsetter. 1
2
Også Samuel Marks’ kommentarer må leses med samme varsomhet. Han er omtalt som å ha sagt at KI-utviklere mener teknologien kan føre til menneskelig utryddelse eller tilsvarende alvorlige utfall. Dette er imidlertid et innsideperspektiv, ikke publisert dokumentasjon på et felles risikoanslag i selskapet. 5
Debatten reduseres ofte til «KI-dommedag» mot «KI-optimisme». Det mer relevante spørsmålet er praktisk: Hvilke sikkerhetskrav bør gjelde når skadepotensialet kan være globalt og irreversibelt, mens sannsynlighet og tidshorisont er svært usikre?
Hubingers uttalelse setter flere spørsmål på spissen:
Dette er spørsmål om styring og regulering, ikke bevis for at en katastrofe er nært forestående. Men de er vanskeligere å løse etter at systemer eventuelt har fått farlige evner.
Det er rapportert at Anthropic avslo å sende inn en ny modell til testing hos Storbritannias AI Safety Institute før lansering. Opplysningen må behandles med forsiktighet: De tilgjengelige omtaler beskriver dette som medieopplysninger, ikke som en offentlig bekreftet konklusjon fra selskapet eller britiske myndigheter. 10
Likevel viser saken hvorfor frivillige sikkerhetsløfter møtes med skepsis. Når en sikkerhetsleder i selskapet selv sier at alignment-utfordringen ikke er løst, er det rimelig at utenforstående spør hvilke tester som er gjort, hvem som har vurdert dem, hvilke resultater som er delt, og hvilke kapasitetsgrenser som utløser strengere kontroll.
Et krav om å «bremse» behøver ikke bety et permanent stopp i KI-forskning eller all bruk av KI. Det politiske spørsmålet er heller om det bør finnes håndhevbare kontrollpunkter før systemer passerer kapasitetsgrenser med særlig store konsekvenser.
Mulige tiltak kan være:
Begrunnelsen er enkel: Dersom sannsynligheten er usikker, men skadevirkningene potensielt ekstreme, må sikkerhetstiltak kunne dokumenteres før – ikke etter – et mulig kontrolltap.
Hubingers innlegg synliggjør en grunnleggende spenning i utviklingen av avansert KI: Ledende utviklere kan offentlig erkjenne alvorlige langsiktige risikoer, samtidig som de fortsetter å bygge mot kapasiteten som gjør disse risikoene mer presserende. 1
2
Uttalelsen avgjør ikke hvor sannsynlig katastrofal KI-skade er, og bør ikke behandles som en offisiell prognose fra Anthropic. Men den gjør alignment-debatten mer konkret. Spørsmålet er ikke lenger bare om avansert KI kan bli farlig. Det er om selskaper og myndigheter kan vise, med uavhengig dokumentasjon, håndhevbare regler og internasjonalt samarbeid, at de er forberedt før systemene blir for kraftige til å styres forsvarlig. 1
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Evan Hubingers anslag på over 10 prosent var en personlig vurdering, ikke Anthropic politikk eller vitenskapelig konsensus.
Evan Hubingers anslag på over 10 prosent var en personlig vurdering, ikke Anthropic politikk eller vitenskapelig konsensus. Han skiller mellom lav risiko fra dagens modeller og bekymring for fremtidige systemer som kan bidra til å forbedre seg selv.
Saken dreier seg først og fremst om dokumenterbar sikkerhet, uavhengig kontroll og internasjonal samordning før KI får langt større kapasitet.