Zhipu ska ha släppt GLM 5.3 bara timmar efter att chefsforskaren Tang Jie svarade ”sooooooon” på en fråga om modellen. De största rapporterade lyften gäller långsiktiga kodningsuppgifter, terminalanvändning och upptäckt av sårbarheter – inte en större modellbas.
Research answer

Create a landscape editorial hero image for this Studio Global article: What happened when Zhipu AI chief scientist Tang Jie responded “sooooooon” to a user asking about GLM-5.3, and what did Zhipu’s subsequently. Article summary: Tang Jie’s “sooooooon” proved unusually literal: Zhipu released GLM-5.3 only hours later, positioning it as a coding, agentic, and cyber-defence upgrade built on GLM-5.2’s base rather than a larger pretrained model. [1][. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Tang Jies utdragna ”sooooooon” visade sig vara ovanligt bokstavligt. Bara timmar efter svaret rapporterades Zhipu ha släppt GLM-5.3 – en modell som framför allt är utvecklad för programmering, AI-agenter och cybersäkerhet. 12
Det intressanta ligger dock inte bara i den snabba lanseringen. GLM-5.3 bygger enligt Zhipu vidare på ungefär samma basmodell på 743 miljarder parametrar som GLM-5.2. De rapporterade förbättringarna ska i stället främst komma från mer omfattande efterträning, alltså träning som sker efter den ursprungliga modellträningen. 1
4
20
GLM-5.3 lanseras som ett exempel på hur efterträning kan ge stora prestandavinster utan att modellen först måste göras större. Det är en anmärkningsvärd strategi i en bransch där nya resultat ofta kopplas till fler parametrar eller en helt ny förtränad modell.
Zhipus jämförelser visar särskilt stora framsteg på krävande uppgifter där modellen måste använda verktyg, arbeta i en terminal och lösa problem i flera steg:
Siffrorna kommer från Zhipus publicerade jämförelser och sekundära analyser av resultaten. 1
3
6
7
Resultatet i Terminal-Bench är särskilt iögonfallande räknat i procentenheter. En stor ökning från en låg utgångsnivå betyder dock inte automatiskt att modellen är bäst på alla typer av programvaruutveckling. I SWE-Marathon låg det rapporterade resultatet 42,5 exempelvis fortfarande under Kimi K3 på 48,1 och Opus 4.8 på 48,8. 6
9
Det mest uppmärksammade resultatet var 84,5 i CyberGym, ett test som fokuserar på att hitta och validera sårbarheter i källkod. I Zhipus jämförelse låg GLM-5.3 precis före Mythos 5 på 83,8 och GPT-5.6 Sol på 83,6. 2
5
6
CyberGym handlar inte bara om att föreslå säkrare kod. Uppgiften innebär enligt rapporteringen att modellen ska identifiera svagheter, konstruera angrepp och kontrollera deras effekter. Det ligger närmare sårbarhetsjakt och resonemang kring kompletta exploateringskedjor än vanlig kodkomplettering. 12
17
Det är också förklaringen till att resultatet fick uppmärksamhet i cybersäkerhetsmedier. The Register återgav Zhipus påstående att förbättringen inte stannade vid att upptäcka enskilda fel, utan även omfattade resonemang över flera steg i en exploateringskedja. 17
Påståendet att modellen är ”ledande” behöver samtidigt sättas i perspektiv. De tillgängliga jämförelserna är i huvudsak leverantörsrapporterade, och någon omfattande oberoende replikering finns ännu inte. 2
4
6
Utöver CyberGym uppgav Zhipu att man samarbetat med säkerhetsteam för att testa modeller mot verkliga kodbaser. Företagets rapporterade sammanställning innehöll 2 436 säkerhetsfynd i 269 projekt med öppen källkod, varav 1 097 bedömdes som kritiska eller allvarliga. Rapporter uppgav också att det äldsta fyndet gick tillbaka till 1981 och att sårbarheterna i genomsnitt hade förblivit oupptäckta i 26,6 år. 21
31
Siffrorna visar vilken typ av säkerhetsarbete Zhipu vill förknippa med GLM-5.3, men de ska inte läsas som oberoende granskade mätningar. Den tillgängliga rapporteringen tillskriver sammanställningen Zhipu, och det bredare benchmarkunderlaget bygger fortfarande till stor del på uppgifter från företaget självt.
Zhipus lansering handlar inte bara om en modell som skriver kodstycken. GLM-5.3 marknadsförs för långvariga AI-agenter som kan använda verktyg, arbeta i terminaler och genomföra tekniska uppgifter i flera steg.
De rapporterade resultaten omfattar 73,0 i Toolathlon Verified, upp från 59,9 för GLM-5.2, samt 48,2 i AutomationBench, upp från 26,2. Andra publicerade jämförelser anger 28,5 i Agents’ Last Exam. 1
7
11
Det pekar mot en praktisk skillnad: modellens tänkta styrka är inte enbart att skapa ett trovärdigt kodexempel, utan att utföra en hel följd av handlingar i ett kodförråd, en terminal eller en verktygsmiljö. Om det fungerar tillförlitligt i produktion beror dock även på verktygsbehörigheter, testtäckning, mänsklig granskning och hur ofta modellen misslyckas i en viss kodbas.
Det starkaste underlaget stöder en mer avgränsad slutsats än att ”GLM-5.3 slår alla ledande modeller”. Zhipus resultat visar ett betydande rapporterat lyft jämfört med GLM-5.2 på flera kodnings- och agentbenchmark, samt ett ledande CyberGym-resultat i de jämförelsetabeller som Zhipu publicerat och andra medier återgett. 2
5
6
Resultaten visar däremot inte att GLM-5.3 är överlägsen i alla programmerings-, resonemangs-, säkerhets- eller allmänna uppgifter. Konkurrerande modeller låg fortfarande före på enskilda kodningstest, och resultaten har ännu inte reproducerats i stor skala av oberoende utvärderare. 6
9
Den viktigaste lärdomen kan därför vara metodmässig. GLM-5.3 presenterar omfattande efterträning som ett sätt att frigöra specialiserad förmåga ur en befintlig stor modellbas. Om oberoende tester bekräftar lyften kan investeringar i efterträning – och noggrann utvärdering på verkliga arbetsflöden inom mjukvara och säkerhet – bli minst lika betydelsefulla som jämförelser av antalet parametrar.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu ska ha släppt GLM 5.3 bara timmar efter att chefsforskaren Tang Jie svarade ”sooooooon” på en fråga om modellen.
Zhipu ska ha släppt GLM 5.3 bara timmar efter att chefsforskaren Tang Jie svarade ”sooooooon” på en fråga om modellen. De största rapporterade lyften gäller långsiktiga kodningsuppgifter, terminalanvändning och upptäckt av sårbarheter – inte en större modellbas.
Zhipu uppger att modellen hittat 2 436 säkerhetsproblem i 269 projekt med öppen källkod, men siffrorna är företagets egna och ännu inte brett oberoende verifierade.