| 54,4 % |
| Mer än dubbelt så högt rapporterat resultat som för GLM-5.2 |
Siffrorna bör läsas som rapporterade resultat, inte som oberoende bekräftade mätningar. Den detaljerade jämförelsen kommer från ett inlägg på X av en tredjepartsbedömare. Z.ai:s officiella dokumentation bekräftar de övergripande påståendena om kodning, långvariga agentuppgifter och cybersäkerhet, men återger inte alla siffror i det underlag som finns här.
Ökningen från 4,6 till 28,3 procent i Terminal-Bench 3.0 är den mest dramatiska jämförelsen i resultattabellen. Testet är relevant för kodningsagenter eftersom det utvärderar arbete i en kommandoradsmiljö. Modellen behöver vanligtvis hantera verktyg, undersöka systemets tillstånd, göra ändringar och fortsätta genom flera steg – i stället för att bara skriva ett fristående kodexempel.
Resultatet stöder bilden av att GLM-5.3 är betydligt starkare i just detta test. Det bevisar däremot inte att modellen kommer att slå GLM-5.2 i varje kodbas, utvecklingsmiljö eller verkligt projekt.
GLM-5.3 är tänkt för uthålligt utvecklingsarbete: planering, implementation, felsökning och upprepade ändringar i en större mängd kontext. I Z.ai:s modellöversikt anges ett kontextfönster på 1 miljon token, och modellen positioneras uttryckligen för långvariga, komplexa uppgifter.
Det skiljer lanseringen från en vanlig uppdatering som främst optimerats för korta kodfrågor. Z.ai rapporterar resultat på toppnivå bland open source-modeller i Terminal-Bench 3.0 och Agents’ Last Exam (CLI), samtidigt som det interna Code Bench-testet uppges visa en förbättring på 50 procent jämfört med GLM-5.2.
I praktiken innebär det att GLM-5.3 är byggd för att behålla och använda mer projektkontext medan den arbetar sig igenom fler steg. Benchmarkresultat säger dock inte allt om driftsäkerhet, kostnad, svarstid eller hur väl verktygsanvändningen fungerar i en viss utvecklingsmiljö. Team som överväger att byta modell bör därför testa representativa kodbaser och arbetsflöden i stället för att anta att hela benchmarklyftet automatiskt följer med in i produktion.
Z.ai uppger att GLM-5.3 nådde sitt bästa resultat hittills i CyberGym, ett test av förmågan att upptäcka sårbarheter. Företaget säger också att modellens resultat inom exploatering av sårbarheter överträffade det för GLM-5.2 med mer än det dubbla.
Tredjepartstabellen anger en ökning i CyberGym från 77,2 till 84,5 procent och i ExploitBench från 24,4 till 54,4 procent. De exakta siffrorna är inte oberoende verifierade i det officiella materialet som ingår här och bör därför betraktas som rapporterade lanseringsuppgifter, inte som slutgiltiga branschmätningar.
Säkerhetsresultaten är betydelsefulla av två skäl. De antyder att modellens förbättrade agentförmåga kan sträcka sig bortom vanlig applikationskod och även omfatta analys av säkerhetsbrister. Samtidigt ökar kraven på säkerhetsutvärdering innan modellen släpps brett. En modell som blivit bättre på att hitta och exploatera sårbarheter kan hjälpa säkerhetsteam i defensivt arbete, men också öka risken för missbruk om den distribueras utan tillräckliga kontroller.
Z.ai tillskriver framför allt förbättringarna en uppskalad efterträning. Enligt företagets förklaring har man utökat de uppgiftsmiljöer som används under träningen så att de bättre liknar verkliga, fler dagar långa arbetsflöden inom ingenjörsarbete och forskning – i stället för att främst fokusera på korta och avgränsade kodövningar.
Med andra ord presenteras förbättringen som en förändring av träningen och uppgiftsmiljöerna, inte bara som ett resultat av ett större kontextfönster eller en ny basarkitektur. Det kan förklara varför de största rapporterade lyften syns i långvariga och agentbaserade utvärderingar: efterträningen har varit inriktad på att lära modellen att planera, använda verktyg, återhämta sig efter bakslag och fortsätta genom längre uppgifter.
Detta är fortfarande Z.ai:s egen förklaring. Oberoende tester behövs för att avgöra hur väl resultaten generaliseras mellan olika modeller, agentramverk, promptar och mjukvaruprojekt.
GLM-5.3 finns i Z.ai:s GLM Coding Plan, som stöder modellen i de listade abonnemangen, och i utvecklingsmiljön ZCode.
Modellvikterna var inte tillgängliga enligt det underlag som finns här. En tredjepartsrapport uppgav att Z.ai räknade med att släppa dem ungefär två veckor efter lanseringen den 14 augusti 2026, efter ytterligare säkerhetsutvärdering. Det pekar mot slutet av augusti 2026, men tidsplanen är preliminär och ska inte ses som ett bekräftat releasedatum.
För utvecklare som överväger GLM-5.3 nu är skillnaden mellan åtkomst och reproducerbarhet viktig. Modellen kan testas via Z.ai:s egna kodningsprodukter, men lanseringsresultaten går ännu inte att återskapa fullt ut lokalt med de modellvikter som beskrivs i källorna.
GLM-5.3 framstår som en riktad uppgradering för kodningsagenter, snarare än ett vanligt versionslyft. Z.ai rapporterar 50 procent bättre resultat i sitt interna kodningstest, starkare prestation i långvariga agentutvärderingar och tydliga förbättringar inom cybersäkerhet jämfört med GLM-5.2.
Den viktigaste brasklappen gäller bevisläget. Z.ai bekräftar riktningen på förbättringarna, medan de exakta offentliga benchmarkjämförelserna och tidsplanen på ungefär två veckor för modellvikterna kommer från tredjepartsrapportering och fortfarande behöver verifieras oberoende.
Tills bredare tester har genomförts och modellvikterna har släppts bör GLM-5.3 därför ses som en lovande, redan tillgänglig uppgradering för kodningsagenter – men ännu inte som en fullt oberoende reproducerbar open source-modell.