| Riktmärke | GLM-5.3 | GLM-5.2 (föregångare) |
|---|---|---|
| Terminal-Bench 3.0 | 28,3 | 4,6 |
| DeepSWE v1.1 | 66,9 | 46,2 |
| Agents' Last Exam (CLI) | 28,5 | 23,8 |
| Z.ai Internt Kodriktmärke | ~50% förbättring | baslinje |
Observera: Mythos 5 når 80,3% på SWE-bench Pro (agentbaserad kodning), men direkta jämförelser på just dessa riktmärken finns inte för båda modellerna . Alla GLM-5.3:s förbättringar kommer enbart från utökad efterträning – basmodellen på 743 miljarder parametrar tränades inte om
.
GLM-5.3 tar en knapp ledning över Mythos 5 i sårbarhetsdetektering (84,5% mot 83,8% på CyberGym), men ligger betydligt efter i exploatering (54,4% mot 78,0% på ExploitBench). Den öppna viktutgåvan är försenad för säkerhetsgranskning, och föregångaren GLM-5.2 bedömdes ha nästan noll motstånd mot cyberattackinstruktioner. Mythos 5 förblir långt mer begränsad – aldrig allmänt tillgänglig, begränsad till cirka 200 godkända partners – men också långt mer kapabel på den farligaste offensiva uppgiften: att generera fungerande attacker. Den bredare innebörden är att öppna modeller snabbt minskar kapacitetsglappet mot de främsta begränsade modellerna inom cybersäkerhet, samtidigt som säkerhetsspärrarna fortfarande är betydligt svagare. Kinesisk regleringsosäkerhet kring export av toppmodeller lägger ytterligare ett lager av komplexitet kring huruvida GLM-5.3:s vikter någonsin kommer att bli lika fritt tillgängliga som Z.ai:s marknadsföring antyder.