Zhipu AI har lanceret GLM 5.3, en model med 743 milliarder parametre, som ifølge virksomheden forbedrer kodningen med omkring 50 procent primært gennem eftertræning – ikke en større grundmodel. GLM 5.3 scorede 28,3 i Terminal Bench 3.0 og 66,9 i DeepSWE 1.1 mod henholdsvis 4,6 og 46,2 for GLM 5.2.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Zhipu AI har annonceret GLM-5.3, en open-weights-grundmodel med 743 milliarder parametre. Modellen er mindre fokuseret på almindelig chat og mere på kodning, softwareudvikling og såkaldt agentisk arbejde, hvor en AI selv kan gennemføre flere trin i en opgave. Zhipus hovedbudskab er, at fremskridtene især skyldes eftertræning: GLM-5.3 skulle have samme rapporterede størrelse som GLM-5.2, men præstere markant bedre i test af langvarige kodnings- og værktøjsopgaver.
De mest opsigtsvækkende tal er en rapporteret forbedring på 50 procent i forhold til GLM-5.2 på Z.ai Code Bench, en score på 28,3 i Terminal-Bench 3.0 og 66,9 i DeepSWE 1.1. Tallene peger på en model, der skal kunne håndtere komplette udviklingsforløb frem for blot at foreslå enkeltstående kodestykker. De bør dog stadig efterprøves af uafhængige tests og i praktisk brug.
GLM-5.3's rapporterede størrelse på 743 milliarder parametre er bemærkelsesværdig, fordi Zhipu beskriver lanceringen som et kapabilitetsløft, der i høj grad er opnået gennem eftertræning frem for en større grundmodel. I praksis præsenterer virksomheden modellen som et eksempel på, at bedre træningsmetoder kan gøre en eksisterende model langt mere effektiv til specialiserede opgaver.
Det er relevant for udviklingen af AI-modeller, fordi flere parametre ikke er den eneste vej til bedre resultater. Eftertræning kan påvirke, hvordan en model planlægger, bruger værktøjer, følger instruktioner og fortsætter gennem komplekse arbejdsgange. De tilgængelige kilder understøtter Zhipus beskrivelse af træningsmetoden, men viser ikke uafhængigt, hvor stor en del af forbedringerne der skyldes bestemte eftertræningsteknikker.
Zhipu siger, at GLM-5.3 forbedrer kodningen med omkring 50 procent i forhold til GLM-5.2 på virksomhedens egen Z.ai Code Bench. De største spring ses på tests, hvor modellen skal arbejde sig gennem en længerevarende softwareopgave:
Terminal-Bench 3.0 er særlig relevant for påstanden om agentisk kodning, fordi testen måler softwarearbejde med terminal- og shell-interaktioner – ikke kun statiske svar. DeepSWE 1.1 fokuserer på softwareudviklingsopgaver og kan derfor sige noget om modellens evne til at indgå i mere komplette udviklingsforløb.
Zhipu oplyser, at resultatet på 28,3 i Terminal-Bench 3.0 var det højeste blandt open-source-modeller ved lanceringen og lå foran Moonshot AI's Kimi K3. Det er dog en rangliste oplyst af virksomheden selv. Sammenligninger bør derfor ses i lyset af testversioner, prompts og de betingelser, modellerne blev evalueret under.
Retningen bag GLM-5.3 er et AI-system, der skal kunne mere end at foreslå kode. Zhipu fremstiller modellen som i stand til at betjene software, bruge værktøjer og gennemføre længere handlingsforløb med mindre menneskelig indblanding.
Forskellen er den samme som mellem en kodningsassistent, der svarer på et afgrænset spørgsmål, og en agent, der kan undersøge et kodebibliotek, køre kommandoer, finde årsagen til fejl, ændre filer og fortsætte mod et bestemt mål. Forbedringerne i Terminal-Bench og DeepSWE passer til den ambition. En høj benchmark-score kan dog ikke i sig selv dokumentere, at agenten fungerer stabilt i ukendte produktionsmiljøer.
Zhipu siger også, at GLM-5.3's kodnings- og agentegenskaber nærmer sig Claude Fable 5, samtidig med at virksomheden placerer modellen som praktisk stærkere end andre kinesiske modeller til virkelige kodningsopgaver. Det er positionering fra Zhipu og bør ikke læses som en endelig, uafhængig rangliste.
Zhipus annoncering kobler desuden modellens bedre ræsonnering og værktøjsbrug til cybersikkerhed, blandt andet muligheden for at finde sårbarheder i software. Offentligt rapporterede testresultater omfatter en score på 84,5 procent i CyberGym på opgaver med at opdage og validere sårbarheder.
Det har en klar dobbelt anvendelse. De samme evner til ræsonnering og softwarebetjening, som kan hjælpe forsvarere med at finde svagheder, kan også gøre usikker autonom adfærd mere alvorlig. Det tilgængelige materiale understøtter derfor, at sårbarhedsopdagelse er et rapporteret anvendelsesområde – ikke at GLM-5.3 er en pålidelig sikkerhedsrevisor eller sikkert kan gennemføre autonome angreb.
Det vigtigste signal fra GLM-5.3 er ikke alene antallet af parametre. Det er Zhipus fokus på eftertræning og på tests, der måler, om en model kan fastholde en softwareopgave over flere trin.
Udviklere, der vil vurdere modellen, bør især undersøge:
GLM-5.3 er en model med 743 milliarder parametre, som ifølge Zhipu AI har hentet en stor del af sit løft fra eftertræning frem for en større grundmodel. Springet fra 4,6 til 28,3 i Terminal-Bench 3.0 og fra 46,2 til 66,9 i DeepSWE 1.1 gør modellens stærkeste salgsargument tydeligt: mere kapable kodningsagenter, der kan håndtere længere softwareopgaver.
Resultaterne er markante nok til at fortjene nærmere afprøvning – især inden for open-model-kodning og agentiske arbejdsgange. Men de er fortsat leverandørens egne benchmarkpåstande. Afstanden mellem et stærkt testresultat og pålidelig autonom drift kræver stadig uafhængig dokumentation.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI har lanceret GLM 5.3, en model med 743 milliarder parametre, som ifølge virksomheden forbedrer kodningen med omkring 50 procent primært gennem eftertræning – ikke en større grundmodel.
Zhipu AI har lanceret GLM 5.3, en model med 743 milliarder parametre, som ifølge virksomheden forbedrer kodningen med omkring 50 procent primært gennem eftertræning – ikke en større grundmodel. GLM 5.3 scorede 28,3 i Terminal Bench 3.0 og 66,9 i DeepSWE 1.1 mod henholdsvis 4,6 og 46,2 for GLM 5.2.
Modellen er målrettet længere softwareforløb, værktøjsbrug og AI agentopgaver, herunder at betjene software med mindre menneskelig indblanding og identificere mulige sårbarheder.