Forskare från Tübingen, Max Planck, MATS Research och Snyk utvecklade en replay attack som extraherar dolda resonemangskedjor från Claude, GPT och Gemini genom att mata krypterade block till svagare syskonmodeller. Resonemangen från Kimi K3 uppvisade 'onormala sannolikhetsfenomen' som nära matchade mönster i Claude...
Research answer

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
I augusti 2026 publicerade en forskargrupp från Tübingen universitet, Max Planck-institutet för intelligenta system, MATS Research, ELLIS Institute Tübingen och säkerhetsföretaget Snyk en artikel som beskrev en förvånansvärt enkel attack på de krypterade resonemangsspår som används av de främsta AI-modellerna . Attacken fungerade mot alla tre stora leverantörer – Anthropic, OpenAI och Google – och krävde inte att en enda frontlinjemodell jailbreakades
. Istället utnyttjade den ett grundläggande arkitekturval: dessa företag returnerar krypterade "resonemangsblock" till API-klienten snarare än att lagra dem på serversidan, och dessa block är portabla mellan sessioner, användare och till och med olika modeller från samma leverantör
. Forskarna tog helt enkelt ett krypterat resonemangsblock från en frontlinjemodell och spelade upp det i en svagare syskonmodell, som sedan avkodade och matade ut resonemanget i klartext
. Denna teknik, som tidningen kallar en "dekrypterings-jailbreak," beskrivs i förhandspublikationen Stealing Reasoning Traces from Proprietary LLM APIs, som lades upp på arXiv den 10 augusti 2026
.
När en användare ställer en fråga till en frontlinjemodell som Claude Opus 4.8 eller GPT-5.6 Sol via ett API, utför modellen ett internt steg-för-steg-resonemang – dess "chain-of-thought" – och returnerar detta resonemang till klienten som ett ogenomskinligt block av krypterad text. Vid efterföljande anrop skickar klienten tillbaka detta block till API:et, vilket gör att modellen kan fortsätta sitt resonemang utan att leverantören lagrar det mellanliggande tillståndet på servern .
Vad forskarna upptäckte är att dessa krypterade block inte är bundna till en specifik session, användare eller modell. De delar en enda global krypteringsnyckel över alla sessioner och användare . Detta innebär att ett block som fångats från en konversation kan spelas upp i ett annat sammanhang. Den viktiga insikten: mata ett block från en kraftigt skyddad frontlinjemodell till en svagare, mindre anpassad syskonmodell från samma leverantör (t.ex. Claude Haiku), och den svagare modellen – med färre vägranskyddsräcken – kommer att avkoda och mata ut blockets innehåll ordagrant
.
Det krävs bara två API-anrop för att utföra attacken: ett för att fånga det krypterade blocket och ett för att mata det till den svagare modellen. Forskarna visade att attacken fungerar i stor skala .
Attacken avslöjade inte bara frontlinjemodellernas resonemang – den gav också nya bevis i den pågående debatten om huruvida det kinesiska AI-företaget Moonshot AI tränade sin Kimi K3-modell genom att distillera (i huvudsak kopiera) resonemanget från amerikanska modeller.
Efter att ha extraherat resonemangsspår från Claude Opus 4.8 och GPT-5.6 Sol jämförde forskarna dem med utdata från öppna viktmodeller, inklusive Kimi K3. De fann att Kimi K3:s utdata uppvisade vad de beskrev som "onormala sannolikhetsfenomen" som nära matchade mönster som hittades i Claude- och GPT-resonemangen .
Bevisen är indicier, inte definitiva. Oberoende forskare säger att resultaten "ger viss evidens – om än inte slutgiltigt bevis – för att vissa kinesiska modeller kan ha tränats genom att distillera resonemangsinformation från amerikanska modeller" . Ytterligare ett suggestivt fynd: när Kimi K3 ombads att identifiera sig själv, identifierade den sig initialt som "Claude" av Anthropic, vilket spädde på anklagelserna
.
Kimi K3 är en 2,8 biljoner parameter tung öppen viktmodell som släpptes av Moonshot AI den 16 juli 2026. Den överträffar Claude Opus 4.8 på flera riktmärken, men den är inte en entydig ledare. På det oberoende Artificial Analysis Intelligence Index får K3 57 poäng jämfört med Claude Fable 5:s 60 och GPT-5.6 Sol:s 59. Moonshot har själva varit ovanligt ärliga med att K3 fortfarande ligger efter GPT-5.6 Sol och Claude Fable 5 totalt sett .
Distilleringsanklagelsen är inte ny – både Anthropic och OpenAI har tidigare anklagat kinesiska företag för att systematiskt distillera sina modeller. En granskning av kinesiska akademiska artiklar och patent avslöjade att kinesiska militärforskare använder utdata från OpenAI- och Anthropic-modeller för att träna inhemska AI-system för försvarsändamål .
Kimi K3:s lansering väckte omedelbar kontrovers. Inom några timmar efter lanseringen den 16 juli anklagade Anthropic Moonshot för att ha byggt K3 genom att distillera Claude, och påståendet nådde Vita huset, vilket väckte frågan om sanktioner .
Men kritiker av distilleringspåståendet pekar på ett tidsproblem. Claude Opus 4.8 släpptes strax före Kimi K3:s lansering. Oberoende forskare säger att tidslinjen gör enkel kopiering "osannolik" eftersom det helt enkelt inte fanns tillräckligt med tid för att träna en 2,8-biljoner-parameters modell med hjälp av distillering från en modell som bara nyligen hade släppts . Moonshot hävdar att K3 byggdes på oberoende forskning
.
Samma arkitekturfel avslöjade ett praktiskt säkerhetsproblem. Eftersom frontlinjemodeller ibland införlivar autentiseringsuppgifter och personlig data i sina resonemangsprocesser, innehöll de krypterade resonemangsblock som utvecklare delade offentligt – till exempel i agentloggar – känslig information som kunde läsas av alla som kände till tricket.
Genom att skanna cirka 7 000 offentligt delade agentsessionsloggar som publicerades före augusti 2026, hittade forskarna 62 levande API-nycklar, 33 lösenord och annan känslig användardata – totalt 704 integritetsartefakter – gömda inuti de krypterade resonemangsblocken . Varje utvecklare som publicerade råa agentloggar kan omedvetet ha exponerat API-nycklar, lösenord och personligt identifierbar information i block som de trodde att ingen kunde läsa
. Detta inkluderade loggar som lagrats på offentliga GitHub-repositories .
Forskarna identifierade fyra distinkta missbruksvägar som möjliggjordes av sårbarheten: rekonstruktion av dolda resonemang, återställning av hemligheter inbäddade i agentspår, injicering av instruktioner genom en oinspekterbar kanal, och replay av icke-utgångna block över sessioner .
Alla tre företagen distribuerade server-sidans begränsningar efter att forskargruppen följde ansvarsfulla rapporteringsprocedurer .
Forskarna rapporterade sina resultat till OpenAI, Anthropic, Google, Microsoft och Hugging Face. Efter att leverantörerna implementerade ändringar bekräftade reproducerbarhetskontroller att den huvudsakliga extraktionstekniken inte längre fungerar mot nuvarande API-byggen . Dokumentationen rekommenderar nu att man tar bort resonemangsblock innan man delar loggar eller byter modell mitt i en konversation
.
Anmärkningsvärt nog hade kryptografiforskaren Matthew Green separat rapporterat replay-sårbarheten över sessioner till både OpenAI och Anthropic via deras bug bounty-program i maj 2026, men fick avfärdande svar innan den akademiska artikeln publicerades .
Patcharna är live från och med augusti 2026, men historiska sessionsloggar med avkodade resonemangsblock som redan har skrapats från det offentliga nätet förblir tillgängliga .
Attacken "stulna tankar" avslöjar en grundläggande spänning i designen av moderna AI-API:er. Leverantörer vill avlasta resonemangsstatus till klienten för skalbarhet och latens, men den kryptografiska bindning som krävs för att hålla den statusen säker över sessioner, användare och modeller kräver noggrann design. Tillvägagångssättet med en enda global krypteringsnyckel som används av Anthropic, OpenAI och Google var en genväg som skapade en säkerhets- och integritetssårbarhet som påverkar alla användare och utvecklare som interagerade med dessa API:er.
Attacken landar också mitt i en eskalerande USA-Kina-konflikt om AI-distillering. Även om bevisen angående Kimi K3 är indicier, ger de de starkaste tekniska bevisen hittills för att distillering kan ske i stor skala, och det ger beslutsfattare och forskare ett nytt verktyg för att undersöka ursprunget till AI-modeller.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Forskare från Tübingen, Max Planck, MATS Research och Snyk utvecklade en replay attack som extraherar dolda resonemangskedjor från Claude, GPT och Gemini genom att mata krypterade block till svagare syskonmodeller.
Forskare från Tübingen, Max Planck, MATS Research och Snyk utvecklade en replay attack som extraherar dolda resonemangskedjor från Claude, GPT och Gemini genom att mata krypterade block till svagare syskonmodeller. Resonemangen från Kimi K3 uppvisade 'onormala sannolikhetsfenomen' som nära matchade mönster i Claude och GPT – ett indicium men inte slutgiltigt bevis för distillering.
Sårbarheten exponerade 62 aktiva API nycklar, 33 lösenord och 704 integritetsartefakter från cirka 7 000 offentligt delade agentloggar.