Onderzoekers van de Universiteit van Tübingen, het Max Planck Instituut, MATS Research en Snyk ontwikkelden een replay aanval die versleutelde redeneerstappen (chain of thought) van Claude, GPT en Gemini ontsluiert do... De aanval legde 'abnormale waarschijnlijkheidspatronen' bloot in de uitvoer van Kimi K3 van Moon...
Research answer

Create a landscape editorial hero image for this Studio Global article: What technique did researchers from the University of Tübingen, the Max Planck Institute, MATS Research, and Snyk develop to extract hidden. Article summary: ## The Technique: "Replay Attack" on Encrypted Reasoning Traces. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
In augustus 2026 publiceerde een team van onderzoekers van de Universiteit van Tübingen, het Max Planck Instituut voor Intelligente Systemen, MATS Research, het ELLIS Instituut Tübingen en het beveiligingsbedrijf Snyk een paper over een verrassend eenvoudige aanval op de versleutelde redeneerstappen van AI-modellen. De aanval werkte bij alle drie de grote aanbieders – Anthropic, OpenAI en Google – en vereiste geen jailbreak van een enkel topmodel. In plaats daarvan maakte het misbruik van een fundamentele architectuurkeuze: deze bedrijven sturen versleutelde 'redeneerblokken' terug naar de API-client in plaats van ze server-side op te slaan, en die blokken zijn overdraagbaar tussen sessies, gebruikers en zelfs verschillende modellen van dezelfde aanbieder . De onderzoekers namen simpelweg een versleuteld redeneerblok van een topmodel en speelden het af op een zwakker zustermodel, dat het blok decodeerde en de inhoud in platte tekst weergaf
. Deze techniek, die in het paper een 'decryptie-jailbreak' wordt genoemd, staat beschreven in de preprint Stealing Reasoning Traces from Proprietary LLM APIs, ingediend bij arXiv op 10 augustus 2026
.
Wanneer een gebruiker via een API een query uitvoert op een topmodel zoals Claude Opus 4.8 of GPT-5.6 Sol, voert het model interne stapsgewijze redeneringen uit – zijn 'chain of thought' – en stuurt die redenering terug naar de client als een ondoorzichtig blok versleutelde tekst. Bij volgende aanroepen stuurt de client dit blok terug naar de API, zodat het model zijn redenering kan voortzetten zonder dat de aanbieder de tussentijdse status server-side hoeft op te slaan .
Wat de onderzoekers ontdekten, is dat deze versleutelde blokken niet gebonden zijn aan een specifieke sessie, gebruiker of zelfs model. Ze delen een enkele globale encryptiesleutel voor alle sessies en gebruikers . Dit betekent dat een blok uit een gesprek kan worden hergebruikt in een andere context. De kern van de truc: voer een blok van een zwaar beveiligd topmodel in een zwakker, minder streng zustermodel van dezelfde aanbieder (bijv. Claude Haiku), en het zwakkere model – dat minder weigeringsmechanismen heeft – decodeert en geeft de inhoud van het blok letterlijk weer
.
Er zijn slechts twee API-aanroepen nodig om de aanval uit te voeren: één om het versleutelde blok te onderscheppen en één om het aan het zwakkere model te voeren. De onderzoekers toonden aan dat de aanval op grote schaal werkt .
De aanval legde niet alleen de redeneringen van topmodellen bloot, maar leverde ook nieuw bewijs in het voortdurende debat of het Chinese AI-bedrijf Moonshot AI zijn Kimi K3-model heeft getraind door distillatie (het in feite kopiëren van de redenering van Amerikaanse modellen).
Na het extraheren van redeneerstappen uit Claude Opus 4.8 en GPT-5.6 Sol, vergeleken de onderzoekers deze met de uitvoer van open-gewichtsmodellen, waaronder Kimi K3. Ze ontdekten dat de uitvoer van Kimi K3 vertoonde wat zij beschreven als 'abnormale waarschijnlijkheidsverschijnselen' die sterk overeenkwamen met patronen in de Claude- en GPT-redeneerstappen .
Het bewijs is indirect, niet definitief. Onafhankelijke onderzoekers zeggen dat de bevindingen 'enig bewijs leveren – hoewel geen sluitend bewijs – dat bepaalde Chinese modellen mogelijk zijn getraind door redeneerinformatie van Amerikaanse modellen te distilleren' . Een andere opvallende aanwijzing: toen Kimi K3 werd gevraagd zichzelf te identificeren, stelde het zich aanvankelijk voor als 'Claude' van Anthropic, wat de beschuldigingen verder aanwakkerde
.
Kimi K3 is een open-gewichts model met 2,8 biljoen parameters, uitgebracht door Moonshot AI op 16 juli 2026. Het presteert beter dan Claude Opus 4.8 op verschillende benchmarks, maar is geen onbetwiste koploper. Op de onafhankelijke Artificial Analysis Intelligence Index scoort K3 57, tegenover Claude Fable 5 met 60 en GPT-5.6 Sol met 59. Moonshot zelf is ongewoon openhartig geweest dat K3 nog steeds achterloopt op GPT-5.6 Sol en Claude Fable 5 .
De distillatiebeschuldiging is niet nieuw – zowel Anthropic als OpenAI hebben eerder Chinese bedrijven beschuldigd van het systematisch distilleren van hun modellen. Uit een analyse van Chinese academische papers en patenten bleek dat Chinese militaire onderzoekers uitvoer van OpenAI- en Anthropic-modellen gebruikten om eigen AI-systemen voor defensiecapaciteiten te trainen .
De lancering van Kimi K3 leidde direct tot controverse. Binnen enkele uren na de release op 16 juli beschuldigde Anthropic Moonshot ervan K3 te hebben gebouwd door Claude te distilleren, en de claim bereikte het Witte Huis, wat het vooruitzicht van sancties opriep .
Critici van de distillatieclaim wijzen echter op een probleem met de tijdlijn. Claude Opus 4.8 werd kort voor de lancering van Kimi K3 uitgebracht. Onafhankelijke onderzoekers zeggen dat de tijdlijn eenvoudig kopiëren 'onwaarschijnlijk' maakt, omdat er simpelweg niet genoeg tijd was om een model met 2,8 biljoen parameters te trainen via distillatie van een model dat pas recent was uitgebracht . Moonshot stelt dat K3 is gebouwd op basis van onafhankelijk onderzoek
.
Dezelfde architectuurfout legde een praktisch beveiligingsrisico bloot. Omdat topmodellen soms inloggegevens en persoonlijke gegevens in hun redeneerproces verwerken, bevatten de versleutelde redeneerblokken die ontwikkelaars openbaar deelden – bijvoorbeeld in agent-sessielogs – gevoelige informatie die door iedereen met kennis van de truc kon worden gelezen.
Door ongeveer 7.000 openbaar gedeelde agent-sessielogs te scannen die vóór augustus 2026 waren gepubliceerd, vonden onderzoekers 62 actieve API-sleutels, 33 wachtwoorden en andere gevoelige gebruikersgegevens – in totaal 704 privacyartefacten – verborgen in de versleutelde redeneerblokken . Elke ontwikkelaar die onbewerkte agentlogs had gepubliceerd, had onbedoeld API-sleutels, wachtwoorden en persoonlijk identificeerbare informatie blootgelegd in blokken waarvan men dacht dat ze onleesbaar waren
. Dit omvatte logs die waren opgeslagen in openbare GitHub-repositories .
De onderzoekers identificeerden vier verschillende misbruikpaden die door de kwetsbaarheid mogelijk werden gemaakt: reconstructie van verborgen redeneringen, terugwinning van geheimen die in agentsporen waren ingebed, injectie van instructies via een niet-inspecteerbaar kanaal, en replay van niet-verlopen blokken over sessies heen .
Alle drie de bedrijven hebben server-side mitigerende maatregelen doorgevoerd nadat het onderzoeksteam de procedure voor verantwoorde openbaarmaking had gevolgd .
De onderzoekers meldden hun bevindingen aan OpenAI, Anthropic, Google, Microsoft en Hugging Face. Nadat de aanbieders wijzigingen hadden doorgevoerd, bevestigden reproduceerbaarheidscontroles dat de belangrijkste extractietechniek niet langer werkt tegen de huidige API-builds . De documentatie adviseert nu om redeneerblokken te verwijderen voordat logs worden gedeeld of modellen halverwege een gesprek worden gewisseld
.
Opvallend is dat cryptografie-onderzoeker Matthew Green de kwetsbaarheid voor replay over sessies heen in mei 2026 apart had gemeld bij zowel OpenAI als Anthropic via hun bug bounty-programma's, maar afwijzende reacties kreeg voordat het academische paper werd gepubliceerd .
De patches zijn sinds augustus 2026 actief, maar historische sessielogs met gedecodeerde redeneerblokken die al van het openbare web zijn geschraapt, blijven toegankelijk .
De 'gestolen gedachten'-aanval onthult een fundamentele spanning in het ontwerp van moderne AI-API's. Aanbieders willen de redeneerstatus naar de client verplaatsen voor schaalbaarheid en lage latentie, maar de cryptografische koppeling die nodig is om die status veilig te houden over sessies, gebruikers en modellen heen, vereist een zorgvuldig ontwerp. De aanpak met een enkele globale encryptiesleutel die door Anthropic, OpenAI en Google werd gebruikt, was een shortcut die een beveiligings- en privacykwetsbaarheid creëerde die elke gebruiker en ontwikkelaar trof die met deze API's werkte.
De aanval valt ook middenin een escalerend conflict tussen de VS en China over AI-distillatie. Hoewel het bewijs met betrekking tot Kimi K3 indirect is, levert het tot nu toe het sterkste technische bewijs dat distillatie op grote schaal plaatsvindt, en het geeft beleidsmakers en onderzoekers een nieuw instrument om de herkomst van AI-modellen te onderzoeken.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Onderzoekers van de Universiteit van Tübingen, het Max Planck Instituut, MATS Research en Snyk ontwikkelden een replay aanval die versleutelde redeneerstappen (chain of thought) van Claude, GPT en Gemini ontsluiert do...
Onderzoekers van de Universiteit van Tübingen, het Max Planck Instituut, MATS Research en Snyk ontwikkelden een replay aanval die versleutelde redeneerstappen (chain of thought) van Claude, GPT en Gemini ontsluiert do... De aanval legde 'abnormale waarschijnlijkheidspatronen' bloot in de uitvoer van Kimi K3 van Moonshot AI, die sterk overeenkomen met die van Claude Opus 4.8 en GPT 5.6 Sol – een sterke, maar niet definitieve aanwijzing...
Uit openbaar gedeelde logs bleken 62 actieve API sleutels, 33 wachtwoorden en 704 privacygevoelige gegevens te lekken via dezelfde versleutelde blokken, die ontwikkelaars als veilig beschouwden.