Zhipu AI har presenterat GLM 5.3, en modell med 743 miljarder parametrar som enligt företaget förbättrar kodningen med omkring 50 procent jämfört med GLM 5.2, främst genom efterträning. GLM 5.3 fick 28,3 i Terminal Bench 3.0 och 66,9 i DeepSWE 1.1, jämfört med 4,6 respektive 46,2 för GLM 5.2.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Zhipu AI har presenterat GLM-5.3, en modell med 743 miljarder parametrar som är inriktad mindre på vanlig chatt och mer på kodning, programvaruutveckling och så kallade agentiska arbetsflöden. Företagets huvudbudskap är att lyftet framför allt kommer från efterträning – inte från en större basmodell. GLM-5.3 uppges därför ha samma rapporterade storlek som GLM-5.2, men betydligt bättre resultat på tester av långvarig kodning och användning av verktyg.
De mest uppmärksammade siffrorna är en rapporterad förbättring på 50 procent jämfört med GLM-5.2 i Z.ai Code Bench, 28,3 poäng i Terminal-Bench 3.0 och 66,9 i DeepSWE 1.1. Det pekar mot en modell som ska kunna ta sig igenom fler stegen i ett utvecklingsarbete – inte bara skriva ett isolerat kodstycke. Samtidigt återstår oberoende tester och praktisk användning innan man vet hur tillförlitlig modellen är i verkliga miljöer.
GLM-5.3:s rapporterade storlek på 743 miljarder parametrar är anmärkningsvärd eftersom Zhipu beskriver lanseringen som ett kapabilitetslyft byggt främst genom efterträning, snarare än genom att basmodellen har skalats upp. I praktiken vill företaget visa att förbättrade träningsmetoder kan göra en befintlig grundmodell bättre på specialiserade uppgifter.
Det är viktigt eftersom fler parametrar inte är den enda vägen till högre prestanda. Efterträning kan påverka hur en modell planerar, använder verktyg, följer instruktioner och fortsätter arbeta genom komplexa uppgifter. De tillgängliga rapporterna stöder Zhipus beskrivning av träningsupplägget, men fastslår inte oberoende exakt hur stor del av förbättringen som kommer från en viss teknik.
Zhipu uppger att GLM-5.3 förbättrar kodningsförmågan med ungefär 50 procent jämfört med GLM-5.2 i företagets Z.ai Code Bench. De tydligaste skillnaderna syns i tester där modellen måste arbeta sig igenom en längre programvaruuppgift:
Terminal-Bench 3.0 är särskilt relevant för påståendet om agentisk kodning eftersom testet mäter programvaruarbete med terminal- och skalverktyg, inte bara statiska svar. DeepSWE 1.1 fokuserar på uppgifter inom programvaruutveckling och kan därför ge en indikation på hur modellen klarar mer kompletta utvecklingsflöden.
Zhipu säger att resultatet 28,3 i Terminal-Bench var högst bland öppna modeller vid lanseringen och före Moonshot AI:s Kimi K3. Det är dock en ranking som företaget självt har rapporterat. Jämförelserna bör därför läsas tillsammans med information om testversion, promptar och vilka åtkomstförhållanden som användes för respektive modell.
Riktningen bakom GLM-5.3 är ett AI-system som ska kunna göra mer än att föreslå kod. Zhipu beskriver modellen som kapabel att använda programvara, arbeta med verktyg och slutföra längre handlingskedjor med mindre mänsklig inblandning.
Skillnaden är ungefär den mellan en kodassistent som svarar på en avgränsad fråga och en agent som kan granska ett kodarkiv, köra kommandon, felsöka, ändra filer och fortsätta mot ett mål. Förbättringarna i Terminal-Bench och DeepSWE ligger i linje med den ambitionen. Ett benchmarkresultat kan däremot inte ensamt visa att agenten fungerar stabilt i obekanta produktionsmiljöer.
Zhipu uppger också att GLM-5.3:s kodnings- och agentförmåga närmar sig Claude Fable 5 och att modellen i praktisk kodning är starkare än andra kinesiska modeller. Det är positioneringspåståenden från Zhipu, inte en slutgiltig och oberoende topplista.
I sin kommunikation kopplar Zhipu dessutom GLM-5.3:s förbättrade slutledningsförmåga och verktygsanvändning till cybersäkerhet, bland annat möjligheten att hitta sårbarheter i programvara. Offentligt rapporterade testresultat omfattar 84,5 procent i CyberGym, som mäter uppgifter för att upptäcka och validera sårbarheter.
Det området har en tydlig dubbla-användningsproblematik. Samma förmågor som kan hjälpa försvarare att hitta svagheter kan också göra osäkert autonomt beteende mer konsekvensrikt. Det tillgängliga underlaget räcker för att beskriva sårbarhetsanalys som ett rapporterat användningsområde – men inte som bevis för att GLM-5.3 är en tillförlitlig säkerhetsgranskare eller säkert kan genomföra autonoma angrepp.
Den viktigaste signalen från GLM-5.3 är inte bara antalet parametrar. Det är Zhipus fokus på efterträning och på tester som mäter om en modell kan hålla ihop ett programvaruuppdrag över flera steg.
För utvecklare som vill utvärdera modellen är följande frågor centrala:
GLM-5.3 är en modell med 743 miljarder parametrar som enligt Zhipu AI har fått mycket av sitt prestandalyft genom efterträning snarare än en större basmodell. Ökningen från 4,6 till 28,3 i Terminal-Bench 3.0 och från 46,2 till 66,9 i DeepSWE 1.1 gör modellens huvudbudskap tydligt: kraftfullare kodningsagenter som kan hantera längre och mer sammansatta programvaruuppgifter.
Resultaten är tillräckligt intressanta för att motivera närmare tester, särskilt inom öppen modellkodning och agentbaserade utvecklingsflöden. Men siffrorna är fortfarande leverantörsrapporterade. Steget från ett starkt benchmarkresultat till pålitlig autonom drift kräver fortfarande oberoende verifiering.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI har presenterat GLM 5.3, en modell med 743 miljarder parametrar som enligt företaget förbättrar kodningen med omkring 50 procent jämfört med GLM 5.2, främst genom efterträning.
Zhipu AI har presenterat GLM 5.3, en modell med 743 miljarder parametrar som enligt företaget förbättrar kodningen med omkring 50 procent jämfört med GLM 5.2, främst genom efterträning. GLM 5.3 fick 28,3 i Terminal Bench 3.0 och 66,9 i DeepSWE 1.1, jämfört med 4,6 respektive 46,2 för GLM 5.2.
Modellen är utformad för längre arbetsflöden inom programvaruutveckling, verktygsanvändning och AI agentuppgifter – men resultaten är fortfarande huvudsakligen företagsrapporterade.