Evan Hubingers uppskattning på över 10 procent är en personlig prognos, inte Anthropics officiella hållning eller vetenskaplig konsensus. Debatten handlar mindre om en omedelbar katastrof från dagens modeller – Hubinger beskriver deras risk som låg – och mer om huruvida utvecklingen bör fortsätta mot potentiellt sjä...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Anthropic alignment science lead Evan Hubinger’s public statement that he personally believes there is more than a 10% chance AI co. Article summary: Hubinger’s statement chiefly exposed a sharp mismatch between frontier-AI labs’ public safety posture and the private-level uncertainty described by people closest to the work: a senior alignment lead said the field may . Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Evan Hubingers offentliga uttalande visar inte att AI kommer att utplåna mänskligheten. Det säger något mer avgränsat – och mer betydelsefullt för AI-säkerhetsdebatten: chefen för alignment science på Anthropic uppgav att han personligen bedömer sannolikheten till över 10 procent inom det kommande decenniet. Samtidigt skrev han att Anthropic ännu inte har någon plan för att lösa alignment – alltså problemet att få AI-system att pålitligt följa mänskliga mål och värderingar – för superintelligenta system, och inte tydligt är på väg mot en sådan lösning. 1
2
Det ger konkret stöd åt kärnan i den kritik som den tidigare Anthropic- och OpenAI-forskaren Jacob Coxon framförde när han sade upp sig: ledande AI-labb kan driva utvecklingen mot betydligt mer kapabla system trots att metoderna för att hålla dem säkert under mänsklig kontroll inte är bevisade. 2
3
Siffran ”över 10 procent” var Hubingers egen riskbedömning. Den presenterades inte som Anthropics officiella prognos, som en samsyn bland anställda eller som ett etablerat vetenskapligt resultat. 1
2
Det är en avgörande skillnad. En procentsiffra förklarar inte i sig vilken händelsekedja som skulle kunna leda till en katastrof, fastslår ingen tidslinje och bevisar inte att katastrofen är sannolik. Hubinger ska också ha sagt att risken från de modeller som finns i dag är låg. Hans oro gäller i stället framtida system som blir väsentligt mer kapabla, bland annat genom rekursiv självförbättring: att AI används för att skapa ännu kraftfullare AI. 2
10
Ändå väger uttalandet tungt eftersom det kommer från en person som leder alignment-arbete på ett stort frontier-labb, det vill säga ett företag som utvecklar modeller vid teknikens yttersta gräns. Det centrala är därför inte bara den uppseendeväckande siffran, utan glappet mellan snabbt växande kapacitet och säker kunskap om hur superintelligenta system ska kunna hållas under kontroll. 1
2
Coxon, som tidigare arbetat både på OpenAI och Anthropic, sade upp sig med argumentet att inget av företagen agerade ansvarsfullt och att båda tävlade mot självförbättrande superintelligens. Hubinger gav offentligt Coxon rätt i att personer som bygger systemen på allvar ser möjligheten till utrotningsnivåer av skada. 2
3
Det bevisar inte att alla anställda delar samma uppfattning, och det gör inte Coxons redogörelse till en oberoende verifierad bedömning av båda bolagen. Men det blir svårare att avfärda uppsägningen som en enskild före detta anställds missnöje. En nuvarande chef inom alignment bekräftade den underliggande poängen: djup intern oro kan finnas parallellt med fortsatt utveckling av allt mer avancerade AI-system. 1
2
Samuel Marks närliggande uttalanden behöver läsas med samma försiktighet. Han beskrivs i rapporteringen som att han sagt att AI-utvecklare tror att tekniken kan orsaka mänsklig utrotning eller jämförbart svåra följder. Det är dock ett insiderperspektiv, inte publicerade belägg för en företagsövergripande riskprognos. 5
Debatten framställs ofta som ”AI-domedag” mot ”AI-optimism”. Den mer användbara frågan är praktisk: vilka skyddsräcken bör krävas när möjliga skador kan bli globala och oåterkalleliga, men sannolikhet och tidshorisont är mycket osäkra?
Hubingers kommentarer gör flera frågor tydligare:
Detta är styrningsproblem, inte bevis för en nära förestående katastrof. Men just sådana problem kan bli betydligt svårare att hantera när systemen väl har fått farliga förmågor.
Enligt rapporter avböjde Anthropic att lämna in en ny modell till brittiska AI Safety Institute för tester före lansering. Uppgiften bör hanteras försiktigt: de tillgängliga redogörelserna beskriver detta som medieuppgifter, inte som ett bekräftat offentligt besked från företaget eller den brittiska staten. 10
Men uppgiften illustrerar varför frivilliga säkerhetsåtaganden möts med skepsis. Om ett företags egna säkerhetsansvariga medger att grundläggande alignment-frågor är olösta, är det rimligt att utomstående frågar vilka tester som genomfördes, vem som granskade dem, vilka resultat som delades och vid vilka kapacitetsnivåer skärpta kontrollåtgärder ska införas.
Att förespråka ett långsammare tempo behöver inte betyda ett permanent stopp för all AI-forskning eller användning av AI. Det politiska argumentet handlar snarare om bindande kontroller innan system passerar särskilt betydelsefulla kapacitetströsklar.
Möjliga åtgärder är bland annat:
Motiveringen är enkel: om risken är osäker men nedsidan kan vara extrem måste skyddsåtgärder kunna visas upp före, inte efter, en möjlig förlust av kontroll.
Hubingers inlägg blottar en spänning i centrum av utvecklingen av avancerad AI: ledande utvecklare kan öppet erkänna allvarliga långsiktiga risker och samtidigt fortsätta bygga mot de kapaciteter som gör riskerna mer angelägna. 1
2
Uttalandet avgör inte sannolikheten för katastrofal AI-skada och ska inte behandlas som Anthropics officiella förutsägelse. Däremot gör det alignment-debatten mer konkret. Frågan är inte längre bara om avancerad AI kan bli farlig, utan om företag och regeringar kan visa – med oberoende underlag, verkställbara regler och internationell samordning – att de är förberedda innan systemen blir för kraftfulla för att kunna styras säkert. 1
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Evan Hubingers uppskattning på över 10 procent är en personlig prognos, inte Anthropics officiella hållning eller vetenskaplig konsensus.
Evan Hubingers uppskattning på över 10 procent är en personlig prognos, inte Anthropics officiella hållning eller vetenskaplig konsensus. Debatten handlar mindre om en omedelbar katastrof från dagens modeller – Hubinger beskriver deras risk som låg – och mer om huruvida utvecklingen bör fortsätta mot potentiellt självförbättrande system innan robusta sä...
Händelsen riktar uppmärksamheten mot oberoende granskning, företagens transparens och internationell samordning, snarare än en förenklad konflikt mellan AI optimister och AI pessimister.