Keines der 21 getesteten Open Weight Modelle war gegenüber allen untersuchten Manipulationsangriffen robust genug. Bei jedem Modell ließ sich die Bereitschaft zu schädlichen Antworten deutlich erhöhen, während ein großer Teil der Denkfähigkeit erhalten blieb.
Veröffentlicht vonBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Die auf der ACM KDD ’26 vorgestellte Studie TamperBench kommt zu einem ernüchternden Ergebnis: Keines der 21 untersuchten Open-Weight-Sprachmodelle verfügte über Schutzmechanismen, die allen getesteten Manipulationsbedrohungen standhielten. Bei jedem Modell ließ sich die Neigung zu schädlichen Ausgaben deutlich steigern, ohne die grundlegenden Fähigkeiten – insbesondere die Leistung bei anspruchsvollen Denkaufgaben – vollständig zu verlieren. 2
5
Für Modelle, deren Gewichte öffentlich verfügbar und veränderbar sind, seien die derzeitigen Sicherheitsvorkehrungen deshalb keine verlässliche Garantie. Die untersuchten Systeme deckten Größen von 600 Millionen bis 8 Milliarden Parametern ab und umfassten unter anderem Modelle aus den Reihen Llama, Qwen3 und Mistral. 2
8
TamperBench bündelt neun Methoden, die entweder die Modellgewichte per Finetuning oder interne Repräsentationen im sogenannten latenten Raum verändern. Das Spektrum reichte von scheinbar unbedenklichem Finetuning und offen schädlichem Training bis zu verdecktem, vergiftungsähnlichem Jailbreak-Tuning, mehrsprachigem Tuning sowie Angriffen auf Einbettungen und latente Repräsentationen. 2
Am schwersten wogen meist verdeckte Jailbreak-Tuning-Varianten. Dazu gehörten Verfahren mit konkurrierenden Zielen, Backdoors und Stilmodulation. Sie wurden überwiegend mit harmlosen Daten trainiert, enthielten aber einen kleinen schädlichen Anteil – und konnten die Sicherheitsausrichtung dadurch besonders effektiv unterlaufen. 2
Die Forschenden suchten für jedes Modell-Angriffs-Paar nach Einstellungen, die den Wert für schädliche Antworten maximierten. Gleichzeitig durfte die Genauigkeit im Reasoning-Benchmark MMLU-Pro höchstens um 10 Prozentpunkte gegenüber dem unangetasteten Modell sinken. Das zentrale Ergebnis lautet damit nicht nur, dass Schutzmechanismen entfernt werden konnten, sondern dass dies häufig bei weitgehend erhaltener Leistungsfähigkeit möglich war. 2
Konkrete Zuwachswerte für die Schädlichkeit einzelner Modelle wie Llama-3-8B-Instruct oder Qwen3-8B-Instruct liegen in den vorliegenden Belegen allerdings nicht vor. Belastbare Einzelzahlen lassen sich daraus daher nicht ableiten.
Auch die fünf getesteten Modelle mit nachträglich ergänzten Verteidigungsmechanismen – darunter Varianten mit ReFAT und Circuit Breaking – waren angreifbar. Zwar verbesserten solche Verfahren die Widerstandsfähigkeit in bestimmten Konstellationen. Über die gesamte Angriffspalette hinweg verhinderten sie jedoch nicht zuverlässig, dass Sicherheitsvorkehrungen entfernt oder umgangen wurden. 2
5
Das ist bei Open-Weight-Modellen besonders relevant: Sobald die Gewichte veröffentlicht sind, können sie kopiert, weitertrainiert und neu verteilt werden. Der ursprüngliche Entwickler hat dann nur begrenzte Möglichkeiten, Sicherheitskontrollen bei nachgelagerten Nutzern oder Anbietern durchzusetzen. 2
Die Studie stellt den Nutzen offener Modelle nicht grundsätzlich infrage. Offene Gewichte können Forschung, Überprüfbarkeit und Rechenschaft fördern. Die Autoren warnen jedoch davor, ein Modell allein deshalb als sicher einzustufen, weil es herkömmliche Sicherheitstests vor der Veröffentlichung bestanden hat. 5
Auch geschlossene Modelle und API-Dienste könnten ähnlichen Manipulationsrisiken ausgesetzt sein. Anbieter, die Finetuning und Bereitstellung kontrollieren, haben allerdings zusätzliche Möglichkeiten für Schutzmaßnahmen während des Finetunings oder nach der Anpassung – Möglichkeiten, die bei frei weitergegebenen Gewichten weitgehend fehlen. 2
5
Besonders problematisch wäre eine Entfernung der Schutzmechanismen, wenn die Fähigkeiten des Modells dabei erhalten bleiben. Dann könnten nicht nur einzelne Nutzer mit hohem manuellen Aufwand Schaden anrichten. Denkbar wären vielmehr skalierbare Anwendungen wie massenhafte Desinformation, ausgefeilte Phishing- und Betrugskampagnen oder schädliche technische Anleitungen. 5
Die Forschenden fordern deshalb mehr Forschung zur Manipulationsresistenz, standardisierte adversarielle Tests wie TamperBench vor der Veröffentlichung sowie eine stärker evidenzbasierte Bewertung und Beschaffung von KI-Systemen. Das gilt insbesondere für Behörden und andere Organisationen, die KI in Bereichen wie Gesundheitsversorgung, Betrugserkennung oder Bildung einsetzen. 2
5
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Keines der 21 getesteten Open Weight Modelle war gegenüber allen untersuchten Manipulationsangriffen robust genug.
Keines der 21 getesteten Open Weight Modelle war gegenüber allen untersuchten Manipulationsangriffen robust genug. Bei jedem Modell ließ sich die Bereitschaft zu schädlichen Antworten deutlich erhöhen, während ein großer Teil der Denkfähigkeit erhalten blieb.
Besonders wirksam waren verdeckte Jailbreak Finetunings mit konkurrierenden Zielen, Backdoors und Stilmodulation.
Keines der 21 getesteten Open Weight Modelle war gegenüber allen untersuchten Manipulationsangriffen robust genug. Bei jedem Modell ließ sich die Bereitschaft zu schädlichen Antworten deutlich erhöhen, während ein großer Teil der Denkfähigkeit erhalten blieb.
Veröffentlicht vonBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general web, ai safety, llm, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with f
Die auf der ACM KDD ’26 vorgestellte Studie TamperBench kommt zu einem ernüchternden Ergebnis: Keines der 21 untersuchten Open-Weight-Sprachmodelle verfügte über Schutzmechanismen, die allen getesteten Manipulationsbedrohungen standhielten. Bei jedem Modell ließ sich die Neigung zu schädlichen Ausgaben deutlich steigern, ohne die grundlegenden Fähigkeiten – insbesondere die Leistung bei anspruchsvollen Denkaufgaben – vollständig zu verlieren. 2
5
Für Modelle, deren Gewichte öffentlich verfügbar und veränderbar sind, seien die derzeitigen Sicherheitsvorkehrungen deshalb keine verlässliche Garantie. Die untersuchten Systeme deckten Größen von 600 Millionen bis 8 Milliarden Parametern ab und umfassten unter anderem Modelle aus den Reihen Llama, Qwen3 und Mistral. 2
8
TamperBench bündelt neun Methoden, die entweder die Modellgewichte per Finetuning oder interne Repräsentationen im sogenannten latenten Raum verändern. Das Spektrum reichte von scheinbar unbedenklichem Finetuning und offen schädlichem Training bis zu verdecktem, vergiftungsähnlichem Jailbreak-Tuning, mehrsprachigem Tuning sowie Angriffen auf Einbettungen und latente Repräsentationen. 2
Am schwersten wogen meist verdeckte Jailbreak-Tuning-Varianten. Dazu gehörten Verfahren mit konkurrierenden Zielen, Backdoors und Stilmodulation. Sie wurden überwiegend mit harmlosen Daten trainiert, enthielten aber einen kleinen schädlichen Anteil – und konnten die Sicherheitsausrichtung dadurch besonders effektiv unterlaufen. 2
Die Forschenden suchten für jedes Modell-Angriffs-Paar nach Einstellungen, die den Wert für schädliche Antworten maximierten. Gleichzeitig durfte die Genauigkeit im Reasoning-Benchmark MMLU-Pro höchstens um 10 Prozentpunkte gegenüber dem unangetasteten Modell sinken. Das zentrale Ergebnis lautet damit nicht nur, dass Schutzmechanismen entfernt werden konnten, sondern dass dies häufig bei weitgehend erhaltener Leistungsfähigkeit möglich war. 2
Konkrete Zuwachswerte für die Schädlichkeit einzelner Modelle wie Llama-3-8B-Instruct oder Qwen3-8B-Instruct liegen in den vorliegenden Belegen allerdings nicht vor. Belastbare Einzelzahlen lassen sich daraus daher nicht ableiten.
Auch die fünf getesteten Modelle mit nachträglich ergänzten Verteidigungsmechanismen – darunter Varianten mit ReFAT und Circuit Breaking – waren angreifbar. Zwar verbesserten solche Verfahren die Widerstandsfähigkeit in bestimmten Konstellationen. Über die gesamte Angriffspalette hinweg verhinderten sie jedoch nicht zuverlässig, dass Sicherheitsvorkehrungen entfernt oder umgangen wurden. 2
5
Das ist bei Open-Weight-Modellen besonders relevant: Sobald die Gewichte veröffentlicht sind, können sie kopiert, weitertrainiert und neu verteilt werden. Der ursprüngliche Entwickler hat dann nur begrenzte Möglichkeiten, Sicherheitskontrollen bei nachgelagerten Nutzern oder Anbietern durchzusetzen. 2
Die Studie stellt den Nutzen offener Modelle nicht grundsätzlich infrage. Offene Gewichte können Forschung, Überprüfbarkeit und Rechenschaft fördern. Die Autoren warnen jedoch davor, ein Modell allein deshalb als sicher einzustufen, weil es herkömmliche Sicherheitstests vor der Veröffentlichung bestanden hat. 5
Auch geschlossene Modelle und API-Dienste könnten ähnlichen Manipulationsrisiken ausgesetzt sein. Anbieter, die Finetuning und Bereitstellung kontrollieren, haben allerdings zusätzliche Möglichkeiten für Schutzmaßnahmen während des Finetunings oder nach der Anpassung – Möglichkeiten, die bei frei weitergegebenen Gewichten weitgehend fehlen. 2
5
Besonders problematisch wäre eine Entfernung der Schutzmechanismen, wenn die Fähigkeiten des Modells dabei erhalten bleiben. Dann könnten nicht nur einzelne Nutzer mit hohem manuellen Aufwand Schaden anrichten. Denkbar wären vielmehr skalierbare Anwendungen wie massenhafte Desinformation, ausgefeilte Phishing- und Betrugskampagnen oder schädliche technische Anleitungen. 5
Die Forschenden fordern deshalb mehr Forschung zur Manipulationsresistenz, standardisierte adversarielle Tests wie TamperBench vor der Veröffentlichung sowie eine stärker evidenzbasierte Bewertung und Beschaffung von KI-Systemen. Das gilt insbesondere für Behörden und andere Organisationen, die KI in Bereichen wie Gesundheitsversorgung, Betrugserkennung oder Bildung einsetzen. 2
5
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Keines der 21 getesteten Open Weight Modelle war gegenüber allen untersuchten Manipulationsangriffen robust genug.
Keines der 21 getesteten Open Weight Modelle war gegenüber allen untersuchten Manipulationsangriffen robust genug. Bei jedem Modell ließ sich die Bereitschaft zu schädlichen Antworten deutlich erhöhen, während ein großer Teil der Denkfähigkeit erhalten blieb.
Besonders wirksam waren verdeckte Jailbreak Finetunings mit konkurrierenden Zielen, Backdoors und Stilmodulation.