TamperBench fand bei allen 21 getesteten Open Weight Modellen mindestens eine anfällige Stelle unter neun Manipulationsbedrohungen – häufig bei einem Rückgang der MMLU Pro Leistung von höchstens 10 Prozent. Verdecktes Jailbreak Tuning, insbesondere Varianten mit konkurrierenden Zielen, Backdoors und Stilmodulation,...
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Das zentrale Ergebnis von TamperBench fällt deutlich aus: Keines der 21 untersuchten Open-Weight-Sprachmodelle verfügte über Sicherheitsvorkehrungen, die den getesteten Manipulationsangriffen zuverlässig standhielten. Die Modelle umfassten Größenordnungen von rund 600 Millionen bis 8 Milliarden Parametern – darunter auch Varianten mit zusätzlichen Schutzmechanismen. Bei jedem Modell konnte mindestens ein Angriff die Bereitschaft zu schädlichen Antworten erhöhen, während ein großer Teil der allgemeinen Fähigkeiten erhalten blieb. 2
5
6
Das ist vor allem deshalb relevant, weil Open-Weight-Modelle nach ihrer Veröffentlichung kopiert, feinjustiert und weiterverbreitet werden können. Eine Sicherheitsschicht, die während der ursprünglichen Prüfung durch den Entwickler funktioniert, ist daher nicht automatisch ein dauerhafter Schutz, sobald Nutzer die Modellgewichte verändern dürfen.
TamperBench misst nicht in erster Linie die Widerstandsfähigkeit gegen gewöhnliche, promptbasierte Jailbreaks. Das Framework kombiniert Angriffe durch Feinjustierung im Gewichtsraum mit Angriffen, die latente Repräsentationen manipulieren. Anschließend werden sowohl das Sicherheitsverhalten als auch die verbleibenden Fähigkeiten des Modells bewertet. Für jede Kombination aus Modell und Angriff nutzten die Forschenden systematische Suchen über mehrere Hyperparameter, statt sich auf eine einzelne Angriffskonfiguration zu verlassen. 2
Die Studie deckte neun Manipulationsregime ab, darunter:
Entscheidend war dabei nicht nur die Frage, ob sich ein Modell unsicher machen ließ. Die Forschenden suchten nach Angriffen, die schädliche Antworten verstärkten, während der Rückgang der MMLU-Pro-Genauigkeit beim logischen Schlussfolgern höchstens 10 Prozent gegenüber dem unangetasteten Modell betrug. 2
Die schwerwiegendsten Ergebnisse gingen im Allgemeinen auf Jailbreak-Tuning zurück. Zu den untersuchten Varianten gehörten Ansätze mit konkurrierenden Zielsetzungen, Backdoors und Stilmodulation. Auffällig war, dass diese Angriffe überwiegend mit harmlosen Trainingsdaten und nur einem kleineren schädlichen Anteil auskommen konnten. Sie ähneln damit weniger einem groben Versuch, ein Modell vollständig auf unsicheres Verhalten umzuschulen, sondern eher einer gezielten Veränderung seines Sicherheitsverhaltens bei weitgehend erhaltener Nutzbarkeit. 2
6
Die weitergehende Schlussfolgerung der Studie: Sicherheit und Leistungsfähigkeit können sich in eine ungünstige Richtung voneinander entkoppeln. Manipulationen können die Verweigerung schädlicher Anfragen schwächen, ohne die Schlussfolgerungsleistung im gleichen Maß zu zerstören. Ein Modell kann auf herkömmlichen Benchmarks daher weiterhin leistungsfähig wirken und zugleich deutlich riskanter einsetzbar sein.
TamperBench untersuchte 21 Open-Weight-Modelle mit 0,6 bis 8 Milliarden Parametern, darunter Modellfamilien wie Llama, Qwen3 und Mistral. Die vorliegenden Studienbelege stützen die benchmarkweite Aussage, dass jedes getestete Modell gegenüber mindestens einem der untersuchten Angriffe verwundbar war. 5
6
Das verfügbare Quellenmaterial nennt allerdings keine exakten, modellbezogenen Zuwächse bei schädlichen Antworten für Llama-3-8B-Instruct oder Qwen3-8B-Instruct unter der Bedingung, dass der MMLU-Pro-Leistungsverlust höchstens 10 Prozent beträgt. Solche Prozentwerte lassen sich aus dem Gesamtergebnis nicht zuverlässig ableiten.
Die belastbare Aussage ist deshalb qualitativ: Die Angriffe konnten schädliches Verhalten deutlich verstärken und zugleich einen großen Teil der Schlussfolgerungsfähigkeiten erhalten. Für die beiden genannten Modelle belegt das bereitgestellte Material jedoch keinen präzisen prozentualen Anstieg.
Zudem folgten Basis- und nachtrainierte Varianten keinem einheitlichen Muster. Ihre Widerstandsfähigkeit gegen Manipulation konnte sich je nach Modellfamilie unterscheiden; für Varianten von Llama 3 und Qwen3 wurden sogar gegenläufige Entwicklungen berichtet. 6
Nein. Auch die fünf getesteten Modelle mit zusätzlichen Schutzverfahren – darunter Varianten mit ReFAT und Circuit Breaking – waren gegenüber der Angriffssuite verwundbar. Die Maßnahmen erhöhten die Widerstandsfähigkeit in bestimmten Szenarien, verhinderten das Entfernen der Sicherheitsvorkehrungen über alle getesteten Bedrohungen hinweg aber nicht zuverlässig. 2
5
Triplet erwies sich in den untersuchten Vergleichen als eines der robusteren und zugleich leistungsfähigeren Schutzverfahren. Das ist ein vielversprechendes Forschungssignal, aber keine Garantie: Das zentrale Ergebnis der Benchmark bleibt, dass kein getesteter Schutz das Manipulationsproblem über die gesamte Angriffssuite hinweg beseitigte. 6
Die Studie besagt nicht, dass Open-Weight-Modelle grundsätzlich keinen Wert haben. Ihre Offenheit kann Forschung, unabhängige Prüfungen und Nachvollziehbarkeit fördern. Die engere Schlussfolgerung lautet: Das Bestehen einer herkömmlichen Alignment- oder Sicherheitsprüfung vor der Veröffentlichung sollte nicht als Beleg dafür gelten, dass ein Modell auch nach einer freien Veränderung seiner Gewichte sicher bleibt. 5
Geschlossene kommerzielle Modelle und API-Angebote stehen ebenfalls vor Fragen rund um Feinjustierung und Sicherheit nach einer Anpassung. Ihre Anbieter behalten jedoch mehr Kontrolle über Trainingspipeline und Betriebsumgebung. Dadurch können sie Schutzmaßnahmen während oder nach einer Anpassung anwenden – Optionen, die deutlich schwieriger durchzusetzen sind, sobald die Modellgewichte öffentlich verbreitet wurden. 2
5
Das von TamperBench hervorgehobene Risiko besteht nicht nur darin, dass eine einzelne Person mit einem bestimmten Prompt eine Verweigerung umgehen kann. Wenn nützliche Fähigkeiten erhalten bleiben, könnte ein manipuliertes Modell wiederholt für schädliche Aufgaben eingesetzt werden – etwa für Desinformation in großem Maßstab, Phishing und Betrug oder gefährliche technische Hilfestellung. Die Forschenden beschreiben dies als mögliche Folge eines leistungsfähigkeitsbewahrenden Entfernens von Schutzmechanismen; die Benchmark selbst misst keinen tatsächlich durchgeführten Missbrauch. 5
Für Organisationen, die KI-Modelle auswählen, ergibt sich daraus eine wichtige Unterscheidung:
Die Forschenden fordern robustere Methoden zur Manipulationsabwehr, standardisierte adversariale Prüfungen wie TamperBench vor der Veröffentlichung sowie eine stärker evidenzbasierte Bewertung und Beschaffung von KI-Systemen. Besonders relevant sei dies in Bereichen mit hoher Wirkung, darunter Gesundheitsversorgung, Betrugserkennung, Bildung und öffentliche Dienstleistungen. Dort kann das Verhalten eines Modells nach der Veröffentlichung ebenso wichtig sein wie sein ursprünglicher Sicherheitsnachweis. 2
5
TamperBench zeigt nicht, dass jedes Open-Weight-Modell zwangsläufig missbraucht wird. Die Studie zeigt vielmehr: Bei allen 21 getesteten Modellen waren Sicherheitsvorkehrungen keine verlässliche Garantie mehr, sobald ein Angreifer das Modell manipulieren konnte. Verdecktes Jailbreak-Tuning war typischerweise die stärkste Angriffskategorie. Zusätzliche Schutzmaßnahmen halfen in einzelnen Fällen, schlossen die Lücke aber nicht. Präzise Prozentwerte für den Anstieg schädlicher Antworten bei einzelnen Llama- oder Qwen3-Modellen lassen sich aus den vorliegenden Quellen nicht ableiten.
Bei Open-Weight-Veröffentlichungen sollte eine Sicherheitsprüfung deshalb nicht nur fragen, was ein Modell zum Start kann – sondern auch, wie viel von seinem Sicherheitsverhalten nach einer Veränderung erhalten bleibt.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
TamperBench fand bei allen 21 getesteten Open Weight Modellen mindestens eine anfällige Stelle unter neun Manipulationsbedrohungen – häufig bei einem Rückgang der MMLU Pro Leistung von höchstens 10 Prozent.
TamperBench fand bei allen 21 getesteten Open Weight Modellen mindestens eine anfällige Stelle unter neun Manipulationsbedrohungen – häufig bei einem Rückgang der MMLU Pro Leistung von höchstens 10 Prozent. Verdecktes Jailbreak Tuning, insbesondere Varianten mit konkurrierenden Zielen, Backdoors und Stilmodulation, erwies sich typischerweise als wirksamste Angriffskategorie.
Erweiterte Schutzverfahren wie ReFAT und Circuit Breaking verbesserten die Widerstandsfähigkeit in einzelnen Szenarien, verhinderten das Aushebeln der Sicherheitsmechanismen aber nicht zuverlässig.
TamperBench fand bei allen 21 getesteten Open Weight Modellen mindestens eine anfällige Stelle unter neun Manipulationsbedrohungen – häufig bei einem Rückgang der MMLU Pro Leistung von höchstens 10 Prozent. Verdecktes Jailbreak Tuning, insbesondere Varianten mit konkurrierenden Zielen, Backdoors und Stilmodulation,...
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did the TamperBench study presented at ACM KDD ’26 find about the robustness of safety protections in 21 open-weight AI models—includin. Article summary: TamperBench found that none of the 21 tested open-weight models had safety protections robust enough to withstand the evaluated tampering threats: every model could be made substantially more willing to produce harmful o. Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Das zentrale Ergebnis von TamperBench fällt deutlich aus: Keines der 21 untersuchten Open-Weight-Sprachmodelle verfügte über Sicherheitsvorkehrungen, die den getesteten Manipulationsangriffen zuverlässig standhielten. Die Modelle umfassten Größenordnungen von rund 600 Millionen bis 8 Milliarden Parametern – darunter auch Varianten mit zusätzlichen Schutzmechanismen. Bei jedem Modell konnte mindestens ein Angriff die Bereitschaft zu schädlichen Antworten erhöhen, während ein großer Teil der allgemeinen Fähigkeiten erhalten blieb. 2
5
6
Das ist vor allem deshalb relevant, weil Open-Weight-Modelle nach ihrer Veröffentlichung kopiert, feinjustiert und weiterverbreitet werden können. Eine Sicherheitsschicht, die während der ursprünglichen Prüfung durch den Entwickler funktioniert, ist daher nicht automatisch ein dauerhafter Schutz, sobald Nutzer die Modellgewichte verändern dürfen.
TamperBench misst nicht in erster Linie die Widerstandsfähigkeit gegen gewöhnliche, promptbasierte Jailbreaks. Das Framework kombiniert Angriffe durch Feinjustierung im Gewichtsraum mit Angriffen, die latente Repräsentationen manipulieren. Anschließend werden sowohl das Sicherheitsverhalten als auch die verbleibenden Fähigkeiten des Modells bewertet. Für jede Kombination aus Modell und Angriff nutzten die Forschenden systematische Suchen über mehrere Hyperparameter, statt sich auf eine einzelne Angriffskonfiguration zu verlassen. 2
Die Studie deckte neun Manipulationsregime ab, darunter:
Entscheidend war dabei nicht nur die Frage, ob sich ein Modell unsicher machen ließ. Die Forschenden suchten nach Angriffen, die schädliche Antworten verstärkten, während der Rückgang der MMLU-Pro-Genauigkeit beim logischen Schlussfolgern höchstens 10 Prozent gegenüber dem unangetasteten Modell betrug. 2
Die schwerwiegendsten Ergebnisse gingen im Allgemeinen auf Jailbreak-Tuning zurück. Zu den untersuchten Varianten gehörten Ansätze mit konkurrierenden Zielsetzungen, Backdoors und Stilmodulation. Auffällig war, dass diese Angriffe überwiegend mit harmlosen Trainingsdaten und nur einem kleineren schädlichen Anteil auskommen konnten. Sie ähneln damit weniger einem groben Versuch, ein Modell vollständig auf unsicheres Verhalten umzuschulen, sondern eher einer gezielten Veränderung seines Sicherheitsverhaltens bei weitgehend erhaltener Nutzbarkeit. 2
6
Die weitergehende Schlussfolgerung der Studie: Sicherheit und Leistungsfähigkeit können sich in eine ungünstige Richtung voneinander entkoppeln. Manipulationen können die Verweigerung schädlicher Anfragen schwächen, ohne die Schlussfolgerungsleistung im gleichen Maß zu zerstören. Ein Modell kann auf herkömmlichen Benchmarks daher weiterhin leistungsfähig wirken und zugleich deutlich riskanter einsetzbar sein.
TamperBench untersuchte 21 Open-Weight-Modelle mit 0,6 bis 8 Milliarden Parametern, darunter Modellfamilien wie Llama, Qwen3 und Mistral. Die vorliegenden Studienbelege stützen die benchmarkweite Aussage, dass jedes getestete Modell gegenüber mindestens einem der untersuchten Angriffe verwundbar war. 5
6
Das verfügbare Quellenmaterial nennt allerdings keine exakten, modellbezogenen Zuwächse bei schädlichen Antworten für Llama-3-8B-Instruct oder Qwen3-8B-Instruct unter der Bedingung, dass der MMLU-Pro-Leistungsverlust höchstens 10 Prozent beträgt. Solche Prozentwerte lassen sich aus dem Gesamtergebnis nicht zuverlässig ableiten.
Die belastbare Aussage ist deshalb qualitativ: Die Angriffe konnten schädliches Verhalten deutlich verstärken und zugleich einen großen Teil der Schlussfolgerungsfähigkeiten erhalten. Für die beiden genannten Modelle belegt das bereitgestellte Material jedoch keinen präzisen prozentualen Anstieg.
Zudem folgten Basis- und nachtrainierte Varianten keinem einheitlichen Muster. Ihre Widerstandsfähigkeit gegen Manipulation konnte sich je nach Modellfamilie unterscheiden; für Varianten von Llama 3 und Qwen3 wurden sogar gegenläufige Entwicklungen berichtet. 6
Nein. Auch die fünf getesteten Modelle mit zusätzlichen Schutzverfahren – darunter Varianten mit ReFAT und Circuit Breaking – waren gegenüber der Angriffssuite verwundbar. Die Maßnahmen erhöhten die Widerstandsfähigkeit in bestimmten Szenarien, verhinderten das Entfernen der Sicherheitsvorkehrungen über alle getesteten Bedrohungen hinweg aber nicht zuverlässig. 2
5
Triplet erwies sich in den untersuchten Vergleichen als eines der robusteren und zugleich leistungsfähigeren Schutzverfahren. Das ist ein vielversprechendes Forschungssignal, aber keine Garantie: Das zentrale Ergebnis der Benchmark bleibt, dass kein getesteter Schutz das Manipulationsproblem über die gesamte Angriffssuite hinweg beseitigte. 6
Die Studie besagt nicht, dass Open-Weight-Modelle grundsätzlich keinen Wert haben. Ihre Offenheit kann Forschung, unabhängige Prüfungen und Nachvollziehbarkeit fördern. Die engere Schlussfolgerung lautet: Das Bestehen einer herkömmlichen Alignment- oder Sicherheitsprüfung vor der Veröffentlichung sollte nicht als Beleg dafür gelten, dass ein Modell auch nach einer freien Veränderung seiner Gewichte sicher bleibt. 5
Geschlossene kommerzielle Modelle und API-Angebote stehen ebenfalls vor Fragen rund um Feinjustierung und Sicherheit nach einer Anpassung. Ihre Anbieter behalten jedoch mehr Kontrolle über Trainingspipeline und Betriebsumgebung. Dadurch können sie Schutzmaßnahmen während oder nach einer Anpassung anwenden – Optionen, die deutlich schwieriger durchzusetzen sind, sobald die Modellgewichte öffentlich verbreitet wurden. 2
5
Das von TamperBench hervorgehobene Risiko besteht nicht nur darin, dass eine einzelne Person mit einem bestimmten Prompt eine Verweigerung umgehen kann. Wenn nützliche Fähigkeiten erhalten bleiben, könnte ein manipuliertes Modell wiederholt für schädliche Aufgaben eingesetzt werden – etwa für Desinformation in großem Maßstab, Phishing und Betrug oder gefährliche technische Hilfestellung. Die Forschenden beschreiben dies als mögliche Folge eines leistungsfähigkeitsbewahrenden Entfernens von Schutzmechanismen; die Benchmark selbst misst keinen tatsächlich durchgeführten Missbrauch. 5
Für Organisationen, die KI-Modelle auswählen, ergibt sich daraus eine wichtige Unterscheidung:
Die Forschenden fordern robustere Methoden zur Manipulationsabwehr, standardisierte adversariale Prüfungen wie TamperBench vor der Veröffentlichung sowie eine stärker evidenzbasierte Bewertung und Beschaffung von KI-Systemen. Besonders relevant sei dies in Bereichen mit hoher Wirkung, darunter Gesundheitsversorgung, Betrugserkennung, Bildung und öffentliche Dienstleistungen. Dort kann das Verhalten eines Modells nach der Veröffentlichung ebenso wichtig sein wie sein ursprünglicher Sicherheitsnachweis. 2
5
TamperBench zeigt nicht, dass jedes Open-Weight-Modell zwangsläufig missbraucht wird. Die Studie zeigt vielmehr: Bei allen 21 getesteten Modellen waren Sicherheitsvorkehrungen keine verlässliche Garantie mehr, sobald ein Angreifer das Modell manipulieren konnte. Verdecktes Jailbreak-Tuning war typischerweise die stärkste Angriffskategorie. Zusätzliche Schutzmaßnahmen halfen in einzelnen Fällen, schlossen die Lücke aber nicht. Präzise Prozentwerte für den Anstieg schädlicher Antworten bei einzelnen Llama- oder Qwen3-Modellen lassen sich aus den vorliegenden Quellen nicht ableiten.
Bei Open-Weight-Veröffentlichungen sollte eine Sicherheitsprüfung deshalb nicht nur fragen, was ein Modell zum Start kann – sondern auch, wie viel von seinem Sicherheitsverhalten nach einer Veränderung erhalten bleibt.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
TamperBench fand bei allen 21 getesteten Open Weight Modellen mindestens eine anfällige Stelle unter neun Manipulationsbedrohungen – häufig bei einem Rückgang der MMLU Pro Leistung von höchstens 10 Prozent.
TamperBench fand bei allen 21 getesteten Open Weight Modellen mindestens eine anfällige Stelle unter neun Manipulationsbedrohungen – häufig bei einem Rückgang der MMLU Pro Leistung von höchstens 10 Prozent. Verdecktes Jailbreak Tuning, insbesondere Varianten mit konkurrierenden Zielen, Backdoors und Stilmodulation, erwies sich typischerweise als wirksamste Angriffskategorie.
Erweiterte Schutzverfahren wie ReFAT und Circuit Breaking verbesserten die Widerstandsfähigkeit in einzelnen Szenarien, verhinderten das Aushebeln der Sicherheitsmechanismen aber nicht zuverlässig.