Coxons avhopp gjorde en abstrakt diskussion om AI-säkerhet akut. Forskaren, som uppgav att han hade arbetat tre år med förträning – alltså arbetet med att träna grundmodeller på stora datamängder – vid OpenAI och Anthropic, lämnade bolaget och anklagade de båda ledande AI-labben för att ”rusa rakt mot själförbättrande superintelligens” och ”spela med våra liv”. Hans inlägg fick över 90 miljoner visningar på mindre än ett dygn. Därmed blev en intern forskningsfråga snabbt en bred offentlig och politisk debatt.
2
44
Vad varnade Coxon för?
Kärnfrågan är rekursiv själförbättring: att AI-system används för att påskynda arbetet med att bygga ännu mer kapabla AI-system. Anthropic beskriver ytterläget som ett system som självständigt kan konstruera och utveckla sin egen efterträdare. Företaget betonar samtidigt att den punkten inte har nåtts och att utvecklingen inte är oundviklig.
25
Coxons invändning var att kapacitetsutvecklingen kan gå fortare än laboratoriernas förmåga att utvärdera systemen, upptäcka fel, få modellernas beteende att följa mänskliga mål och styra hur de används. Enligt hans beskrivning pressar kommersiell konkurrens och strategiska incitament bolagen att gå vidare innan de kan visa att de har kontroll.
2
10
13
Det är en viktig skillnad: kontroversen är inte belägg för att en rekursivt själförbättrande AI redan existerar. Tvisten gäller vilka bevis som borde krävas innan företag utvecklar eller släpper system som påtagligt kan snabba upp AI-forskningen.
Hubingers stöd gav varningen större tyngd
Evan Hubinger, chef för alignmentforskning – forskning om hur AI-system kan hållas i linje med mänskliga mål – på Anthropic, gav offentligt stöd åt allvaret i Coxons kritik. Enligt rapporteringen bedömde han personligen sannolikheten för att AI dödar alla människor under det kommande decenniet till mer än 10 procent. Han sade också att Anthropic ännu inte har någon plan för att lösa alignmentproblemet för superintelligens.
4
6
14
Siffran måste tolkas försiktigt. Det är en enskild persons bedömning i en situation med mycket stor osäkerhet, inte en uppmätt prognos, ett företagsbesked eller ett bevis för att en katastrof är sannolik. Men att en senior forskare inom AI-säkerhet på Anthropic offentligt instämde gav Coxons budskap ovanlig kraft: varningen kom inte enbart från en extern kritiker.
48
Därför växte frågan bortom ett enskilt avhopp
Händelsen knöt samman tre frågor som ofta diskuteras var för sig:
- Teknisk kontroll: Kan forskare tillförlitligt upptäcka och förhindra farligt beteende hos system som kan planera, använda verktyg eller bidra till att förbättra framtida modeller?
- Företagens drivkrafter: Kan företag som möter hård konkurrens, investerartryck och nationella säkerhetsintressen själva avgöra när de ska pausa eller lansera?
- Demokratisk legitimitet: Vem ska sätta reglerna för teknik som kan få konsekvenser för hela ekonomin och säkerhetspolitiken?
Anthropic har publicerat forskning om metoder för alignment och om automatiserade forskare som kan hjälpa till att begränsa väldefinierade fel i alignment. Resultaten gäller särskilda testade felmoder. De visar inte i sig att det finns en generell lösning för att kontrollera en hypotetisk superintelligent AI.
21
22
23
Krav på långsammare utveckling – men ingen gemensam färdplan
Dagarna efter Coxons inlägg uppmanade Anthropics vd Dario Amodei branschen att utveckla AI långsammare och mer försiktigt. Coxon välkomnade offentligt utspelet. Rapporter beskrev också OpenAI:s vd Sam Altman och Elon Musk som stödjande till den bredare diskussionen om att bromsa utvecklingen.
43
45
50
Men stöd för att ”sakta ned” är inte samma sak som ett fullt utformat gemensamt program. Underlaget visar inte att dessa personer enats om samma operativa säkerhetsstandard, tröskel för lansering eller universell avstängningsmekanism.
En så kallad nödstoppknapp är heller inget komplett system för styrning. Den skulle bara fungera om människor fortfarande kontrollerar modellen, datorkraften, åtkomstvägarna, anslutna verktyg och organisationerna som driver systemen. Den mer avgörande frågan är om robusta skydd, övervakning, incidenthantering och oberoende granskning finns på plats innan en modell får kraftfulla funktioner eller omfattande åtkomst.
Vad som faktiskt är känt om agent- och cyberrisker
Påståenden om AI-agenter som lämnar testmiljöer, genomför cyberattacker eller försöker föra in skadlig kod fick stor uppmärksamhet. Men de bör inte behandlas som lika väl belagda.
Anthropic har beskrivit hur bolaget byggt övervakning som ska upptäcka och blockera försök från modeller att undersöka eller lämna en testmiljö, eller oväntat få internetåtkomst. Företaget uppgav också att det granskat utvärderingstranskript för beteenden kopplade till att ta sig ur en sandlådemiljö. Det visar att labben testar sådana risker – inte att ett AI-system har undkommit mänsklig kontroll i verkligheten.
26
Den försiktiga slutsatsen är att autonoma agenters och cybermissbruks risker är aktiva säkerhetsfrågor. De mest dramatiska påståendena kräver däremot primärdokumentation eller stark oberoende bekräftelse innan de kan presenteras som fastslagna fakta.
Washington gjorde varningen till en lagstiftningsfråga
Coxons avhopp kom samtidigt som förhandlare i USA:s senat diskuterade lagstiftning som kan kräva att AI-bolag visar att de vidtar rimliga åtgärder för att förhindra skador.
52
Anthropic hade redan uppmanat den amerikanska kongressen att kräva oberoende säkerhetstester för de mest kapabla modellerna. Bolaget motsatte sig också att delstatliga AI-regler skulle sättas åt sidan utan en strikt federal ersättning som hanterar katastrofala risker.
53
President Donald Trump har intagit motsatt ståndpunkt och sagt att USA redan har skyddsräcken för att reglera och lagföra AI-företag. Därmed tonade han ned behovet av ytterligare AI-specifika begränsningar.
51
Detta är den politiska konfliktlinjen bakom rubrikerna:
- Försiktighetslinjen menar att frivilliga åtaganden inte räcker när ett litet antal bolag bygger system med potentiellt stora och svåråterkalleliga följder.
- Innovationslinjen varnar för att för hårda regler kan försvaga USA:s tekniska ledarskap och hävdar att befintliga lagar kan hantera skadligt agerande.
Ingen av positionerna tar bort den grundläggande avvägningen. Snabbare utveckling kan ge ekonomiska och strategiska fördelar, men den lämnar också mindre tid för utvärdering och trovärdig tillsyn.
Enorma ekonomiska insatser gör självregering svårare
Tidpunkten blottlade en spänning i Anthropics offentliga profil. Företaget har positionerat sig som säkerhetsinriktat, samtidigt som det verkar på en marknad för avancerade AI-modeller där kapitalbehoven är enorma och trycket att förbättra kapaciteten är starkt. En rapport i juni uppgav att privata investerare värderat Anthropic till över 965 miljarder dollar.
54
Det bevisar inte att kommersiella drivkrafter orsakat ett visst säkerhetsbeslut. Däremot förklarar det varför kritiker frågar sig om frivillig återhållsamhet kan bestå när vinsten av att vara först är så stor. Samtidigt riskerar investerare och kunder att drabbas om en allvarlig säkerhetsincident, nya regler eller förlorat förtroende skadar företagets värde.
Den bestående betydelsen av Coxons varning
Coxons avhopp visade inte att AI redan är okontrollerbar, att en modell har rymt eller att mänsklighetens undergång är nära. Hans och Hubingers uttalanden är varningar om osäkra framtida risker, inte verifierade förutsägelser.
5
48
Det som förändrades var inramningen av debatten. Frågan är inte längre bara om avancerad AI kan göras mer kapabel. Den är också om företag som tävlar om att bygga den ska behålla huvudansvaret för att avgöra när säkerhetsbevisen räcker.
För beslutsfattare, AI-labb och allmänheten är ribban därför högre än lugnande avsiktsförklaringar: tydligare trösklar för vilka förmågor modeller får ha, meningsfulla tester före lansering, trovärdig rapportering av incidenter och tillsyn som inte enbart vilar på de företag som har mest att vinna på att gå först.
52
53