GLM 5.3 übertrifft Mythos 5 knapp bei der Erkennung von Sicherheitslücken (84,5 % vs. Die Veröffentlichung der offenen Modellgewichte von GLM 5.3 wurde aus Sicherheitsbedenken um mindestens zwei Wochen verschoben – ein Novum für Z.ai.
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: How does Chinese AI startup Z.ai's open source GLM 5.3 model compare to Anthropic's restricted Mythos 5 model in cybersecurity vulnerability. Article summary: GLM-5.3 claims a narrow lead over Mythos 5 on vulnerability *detection* (84.5% vs 83.8% on CyberGym), but trails significantly on *exploitation* (54.4% vs 78.0% on ExploitBench). Its open-weight release is delayed for sa. Topic tags: general web, ai safety, openai, llm, agents. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Am 14. August 2026 veröffentlichte Z.ai GLM-5.3, ein Open-Source-Modell auf Basis eines 743 Milliarden Parameter umfassenden Grundmodells. Das Modell erzielte mit 84,5 % einen Spitzenwert auf dem CyberGym-Benchmark zur Erkennung von Sicherheitslücken und übertraf damit knapp Anthropics restriktiven Mythos 5 (83,8 %) sowie OpenAI's GPT-5.6 Sol (83,6 %) . Allerdings liegt GLM-5.3 bei der tatsächlichen Entwicklung von Exploits (54,4 % vs. 78,0 % auf ExploitBench) deutlich hinter Mythos 5 zurück, und die Veröffentlichung der offenen Modellgewichte wurde bis zu einer Sicherheitsüberprüfung verschoben
. Der Vergleich zeichnet ein komplexes Bild einer knappen Führung bei der Erkennung versus deutlicher Lücken bei der Ausnutzung, den Zugangskontrollen, der Sicherheitshaltung und dem regulatorischen Umfeld.
| Benchmark | GLM-5.3 | GLM-5.2 (Vorgängergeneration) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Interner Code-Bench | ~50 % Verbesserung | Basislinie |
Hinweis: Mythos 5 erreicht 80,3 % auf SWE-bench Pro (agentisches Programmieren), aber direkte Vergleiche auf diesen spezifischen Benchmarks sind für beide Modelle nicht verfügbar . Alle Verbesserungen von GLM-5.3 kamen ausschließlich durch ein erweitertes Post-Training – das Basis-743B-Modell wurde nicht neu trainiert
.
GLM-5.3 beansprucht eine knappe Führung gegenüber Mythos 5 bei der Erkennung von Schwachstellen (84,5 % vs. 83,8 % auf CyberGym), liegt aber bei der Ausnutzung deutlich zurück (54,4 % vs. 78,0 % auf ExploitBench). Die Veröffentlichung der offenen Gewichte ist zur Sicherheitsüberprüfung verzögert, und der Vorgänger GLM-5.2 wurde als nahezu weigerungsfrei gegenüber Cyberangriffsanweisungen bewertet. Mythos 5 bleibt wesentlich stärker eingeschränkt – nie öffentlich verfügbar, auf etwa 200 geprüfte Partner begrenzt – aber auch deutlich leistungsfähiger bei der gefährlichsten offensiven Aufgabe: der Generierung funktionsfähiger Exploits. Die breitere Implikation ist, dass Modelle mit offenen Gewichten die Fähigkeitslücke zu den restriktiven Frontier-Modellen bei Cyber-Aufgaben schnell schließen, während die Sicherheitsvorkehrungen wesentlich schwächer bleiben. Die regulatorische Unsicherheit in China bezüglich des Exports von Spitzen-KI-Modellen fügt eine weitere Komplexitätsebene hinzu, ob die Gewichte von GLM-5.3 jemals so frei verfügbar sein werden, wie Z.ais Marketing es suggeriert.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
GLM 5.3 übertrifft Mythos 5 knapp bei der Erkennung von Sicherheitslücken (84,5 % vs.
GLM 5.3 übertrifft Mythos 5 knapp bei der Erkennung von Sicherheitslücken (84,5 % vs. Die Veröffentlichung der offenen Modellgewichte von GLM 5.3 wurde aus Sicherheitsbedenken um mindestens zwei Wochen verschoben – ein Novum für Z.ai.
Eine unabhängige Bewertung des Vorgängermodells GLM 5.2 ergab eine fast vollständige Abwesenheit von Sicherheitsvorkehrungen gegenüber Cyber Angriffen, was die Debatte um Open Source KI anheizt.