Zhipu skal ha lansert GLM 5.3 bare timer etter at sjefsforsker Tang Jie svarte «sooooooon» på et spørsmål om modellen. De største rapporterte fremskrittene gjelder langsiktige kodeoppgaver, terminalbruk og oppdagelse av programvaresårbarheter – ikke en større modellbase.
Research answer

Create a landscape editorial hero image for this Studio Global article: What happened when Zhipu AI chief scientist Tang Jie responded “sooooooon” to a user asking about GLM-5.3, and what did Zhipu’s subsequently. Article summary: Tang Jie’s “sooooooon” proved unusually literal: Zhipu released GLM-5.3 only hours later, positioning it as a coding, agentic, and cyber-defence upgrade built on GLM-5.2’s base rather than a larger pretrained model. [1][. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Tang Jies langstrakte «sooooooon» viste seg å være mer bokstavelig enn mange hadde ventet. Ifølge rapportene lanserte Zhipu GLM-5.3 bare noen timer etter svaret fra selskapets sjefsforsker. 12
Men lanseringstempoet er ikke det mest interessante ved modellen. GLM-5.3 er først og fremst utviklet for programmering, AI-agenter som kan utføre flertrinnsoppgaver, og cybersikkerhet. Det spesielle er at Zhipu hevder å ha beholdt den samme grunnmodellen på rundt 743 milliarder parametre som i GLM-5.2, mens mye av ytelsesløftet skal komme fra utvidet ettertrening. 1
4
20
I stedet for å fremheve en ny og større forhåndstrent modell, presenterte Zhipu ettertrening som selve motoren bak forbedringene. Det er en interessant strategi i en bransje der fremskritt ofte kobles til flere parametre eller nye, kostbare treningsrunder.
Selskapets sammenligninger viser særlig store løft i krevende programvareoppgaver der modellen må bruke verktøy og jobbe over lengre tid:
Tallene stammer fra Zhipus publiserte sammenligninger og sekundære analyser av resultatene. 1
3
6
7
Terminal-Bench-resultatet er spesielt oppsiktsvekkende målt i prosentpoeng. Samtidig bør et stort hopp fra et lavt utgangspunkt ikke automatisk tolkes som at modellen er best på alle typer programvareutvikling. På SWE-Marathon var resultatet på 42,5 for eksempel fortsatt lavere enn de rapporterte resultatene til Kimi K3 og Opus 4.8. 6
9
Det mest oppsiktsvekkende tallet var 84,5 i CyberGym, en test som måler hvor godt en modell kan finne og bekrefte sårbarheter i kildekode. I Zhipus sammenligning lå resultatet så vidt foran Mythos 5 på 83,8 og GPT-5.6 Sol på 83,6. 2
5
6
CyberGym handler ikke bare om å foreslå sikrere kode. Oppgaven innebærer å identifisere svakheter, konstruere angrep og kontrollere at angrepene faktisk virker. Det ligger nærmere sårbarhetsjakt og analyse av komplette utnyttelseskjeder enn vanlig kodegenerering. 12
17
Det forklarer hvorfor resultatet fikk oppmerksomhet i sikkerhetsmedier. The Register gjenga Zhipus påstand om at forbedringen ikke bare gjelder isolerte feil, men også modellens evne til å resonnere gjennom flere trinn i en utnyttelseskjede. 17
Påstanden om at modellen «leder», trenger likevel en viktig fotnote. De tilgjengelige sammenligningene er i hovedsak oppgitt av leverandøren, og det finnes foreløpig ingen omfattende, uavhengig replikering av resultatene. 2
4
6
Ved siden av CyberGym har Zhipu opplyst at selskapet samarbeidet med sikkerhetsteam om å teste modellene mot reelle kodebaser. Selskapets oversikt skal inneholde 2 436 sikkerhetsfunn i 269 åpen kildekode-prosjekter, der 1 097 funn var klassifisert som kritiske eller høyrisiko. Rapporter sier også at det eldste funnet stammet fra 1981, og at sårbarhetene i gjennomsnitt hadde vært uoppdaget i 26,6 år. 21
31
Tallene illustrerer hvilken type sikkerhetsarbeid Zhipu ønsker å knytte til GLM-5.3. De bør imidlertid ikke leses som uavhengig reviderte målinger. Opplysningene er tilskrevet Zhipu, og den øvrige dokumentasjonen av modellens sikkerhetsytelse bygger i stor grad på selskapsoppgitte resultater.
Zhipus presentasjon handlet ikke bare om en modell som produserer kodebiter. GLM-5.3 markedsføres for langvarige agentoppgaver der modellen kan bruke verktøy, operere i en terminal og gjennomføre flere steg i et utviklingsprosjekt.
Blant de rapporterte resultatene var 73,0 i Toolathlon Verified, opp fra 59,9 for GLM-5.2, og 48,2 i AutomationBench, opp fra 26,2. Andre publiserte sammenligninger oppga 28,5 i Agents’ Last Exam. 1
7
11
Forskjellen er praktisk: Ambisjonen er ikke bare å lage et plausibelt kodeforslag, men å navigere i et prosjekt, kjøre kommandoer, bruke verktøy og fullføre en hel kjede av oppgaver. Om dette fungerer stabilt i produksjon, vil likevel avhenge av blant annet hvilke tilganger agenten får, hvor gode testene er, hvor grundig koden blir gjennomgått, og hvor ofte modellen gjør feil i den aktuelle kodebasen.
Det sterkeste kunnskapsgrunnlaget støtter en mer avgrenset konklusjon enn at GLM-5.3 «slår alle» avanserte modeller. Zhipus resultater viser et betydelig rapportert løft fra GLM-5.2 på flere tester av programmering og agentoppgaver. De viser også en ledende CyberGym-score i sammenligningstabellene Zhipu publiserte, og som flere medier har gjengitt. 2
5
6
Resultatene beviser ikke at GLM-5.3 er best på all programmering, resonnering, sikkerhet eller generell tekstbehandling. Konkurrerende modeller ligger fortsatt foran på enkelte kodeoppgaver, og resultatene er ikke bredt bekreftet av uavhengige evaluatører. 6
9
Den viktigste lærdommen kan derfor ligge i metoden. GLM-5.3 er et eksempel på hvordan omfattende ettertrening kan brukes til å hente ut mer spesialisert kapasitet fra en eksisterende stor grunnmodell. Dersom uavhengige tester bekrefter løftene, kan investeringer i ettertrening – og grundig testing mot ekte arbeidsflyter innen programvare og sikkerhet – bli minst like viktig som rene sammenligninger av parametertall.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu skal ha lansert GLM 5.3 bare timer etter at sjefsforsker Tang Jie svarte «sooooooon» på et spørsmål om modellen.
Zhipu skal ha lansert GLM 5.3 bare timer etter at sjefsforsker Tang Jie svarte «sooooooon» på et spørsmål om modellen. De største rapporterte fremskrittene gjelder langsiktige kodeoppgaver, terminalbruk og oppdagelse av programvaresårbarheter – ikke en større modellbase.
Zhipu oppgir 2 436 sikkerhetsfunn i 269 åpen kildekode prosjekter, men tallene er ikke uavhengig revidert.