Zhipu AI:n mukaan GLM 5.3 parantaa koodaustulosta noin 50 prosenttia GLM 5.2:een verrattuna pääasiassa jälkikoulutuksen, ei suuremman perusmallin, ansiosta. GLM 5.3 sai Terminal Bench 3.0 testissä tuloksen 28,3 ja DeepSWE 1.1 testissä 66,9, kun GLM 5.2:n tulokset olivat vastaavasti 4,6 ja 46,2.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Kiinalainen tekoäly-yhtiö Zhipu AI on julkistanut GLM-5.3:n, 743 miljardin parametrin open-weights-perusmallin, joka on suunnattu ennen kaikkea koodaukseen, ohjelmistokehitykseen ja tekoälyagenttien käyttöön. Yhtiön keskeinen viesti on, että kehitys ei perustu mallin kasvattamiseen: GLM-5.3 käyttää tiettävästi samaa mittakaavaa kuin GLM-5.2, mutta sen tulokset ovat parantuneet erityisesti pitkäkestoisissa koodaus- ja työkalunkäyttötehtävissä.
Zhipu raportoi omassa Z.ai Code Bench -testissään noin 50 prosentin parannuksen GLM-5.2:een verrattuna. Julkisissa testeissä malli sai Terminal-Bench 3.0 -arvion 28,3 ja DeepSWE 1.1 -arvion 66,9. Luvut viittaavat malliin, joka on suunniteltu ratkaisemaan monivaiheisia ohjelmistotehtäviä yksittäisten koodinpätkien tuottamisen sijaan. Tulokset ovat kuitenkin toistaiseksi pääosin yhtiön raportoimia, joten niiden merkitys todellisissa tuotantoympäristöissä vaatii riippumatonta testausta.
GLM-5.3:n 743 miljardin parametrin koko on huomionarvoinen siksi, että Zhipu kuvaa julkaisua ennen kaikkea jälkikoulutuksella saavutetuksi kyvykkyyspäivitykseksi. Jälkikoulutuksella tarkoitetaan perusmallin julkaisun jälkeistä opettamista, jolla voidaan hioa esimerkiksi tehtävien suunnittelua, työkalujen käyttöä, ohjeiden noudattamista ja virheistä palautumista.
Tämä on merkittävä kehityssuunta, sillä suurempi parametrimäärä ei ole ainoa tapa parantaa mallin suorituskykyä. Jälkikoulutus voi tehdä mallista tehokkaamman erikoistuneissa työnkuluissa ilman, että perustaa tarvitsee kasvattaa. Saatavilla olevat lähteet tukevat Zhipun kuvausta lähestymistavasta, mutta eivät itsenäisesti osoita, kuinka suuri osuus kustakin parannuksesta johtuu tietystä jälkikoulutustekniikasta.
Zhipu ilmoittaa GLM-5.3:n koodaustuloksen parantuneen noin 50 prosenttia GLM-5.2:een verrattuna yhtiön omassa Z.ai Code Bench -arviossa. Suurimmat erot näkyvät testeissä, joissa mallin on työskenneltävä ohjelmisto-ongelman parissa usean vaiheen ajan:
Terminal-Bench 3.0 on erityisen olennainen agenttimaisen koodauksen kannalta, koska siinä arvioidaan päätteen ja komentotulkin käyttöä ohjelmistotehtävissä – ei vain valmiin vastauksen tai staattisen koodin tuottamista. DeepSWE 1.1 puolestaan keskittyy ohjelmistosuunnittelutehtäviin ja antaa viitteitä siitä, miten malli selviytyy laajemmista kehitystyönkuluista.
Zhipun mukaan 28,3 oli julkaisuhetkellä avoimien mallien korkein tulos Terminal-Bench 3.0 -testissä ja ylitti Moonshot AI:n Kimi K3:n tuloksen. Kyseessä on kuitenkin yhtiön ilmoittama vertailu. Mallien tuloksia pitäisi tarkastella yhdessä testiversioiden, käytettyjen kehotteiden ja arviointiolosuhteiden kanssa.
GLM-5.3:n taustalla oleva tuotesuunta on järjestelmä, joka tekee muutakin kuin ehdottaa koodia. Zhipu esittelee mallin kykenevänä käyttämään työkaluja, toimimaan ohjelmistoympäristössä ja viemään pidempiä tehtäväketjuja loppuun vähäisemmällä ihmisen puuttumisella.
Ero on käytännössä sama kuin yksittäiseen kysymykseen vastaavan koodiavustajan ja varsinaisen ohjelmistoagentin välillä. Agentti voi esimerkiksi tutkia koodivarastoa, suorittaa komentoja, selvittää virheilmoituksia, muokata tiedostoja ja jatkaa työskentelyä tavoitteen saavuttamiseksi.
Terminal-Benchin ja DeepSWE:n parannukset sopivat tähän kuvaukseen, mutta testitulos ei vielä kerro, toimiiko agentti luotettavasti vieraissa tuotantoympäristöissä. Zhipu sanoo myös GLM-5.3:n koodaus- ja agenttikyvykkyyksien lähestyvän Claude Fable 5:n tasoa ja pitää sitä käytännön koodaustehtävissä vahvempana kuin muita kiinalaisia malleja. Nämä ovat Zhipun asemointiin liittyviä väitteitä, eivät riippumattoman vertailutaulukon lopullisia johtopäätöksiä.
Zhipu yhdistää GLM-5.3:n paremman päättelyn ja työkalujen käytön myös kyberturvallisuuteen, kuten ohjelmistojen haavoittuvuuksien tunnistamiseen. Julkisuudessa raportoiduissa arvioissa mallin CyberGym-tulos oli 84,5 prosenttia haavoittuvuuksien löytämistä ja varmentamista mittaavissa tehtävissä.
Kyse on kaksikäyttöisestä kyvykkyydestä. Samat päättely- ja ohjelmistojen käyttötaidot voivat auttaa puolustajia löytämään heikkouksia, mutta ne voivat myös tehdä vaarallisesta autonomisesta toiminnasta aiempaa merkityksellisempää. Saatavilla oleva näyttö tukee haavoittuvuuksien etsimisen kuvaamista raportoiduksi kyvykkyysalueeksi – ei väitteeksi siitä, että GLM-5.3 olisi luotettava tietoturvatarkastaja tai että se pystyisi turvallisesti toteuttamaan autonomisia hyökkäyksiä.
Julkaisun tärkein viesti ei ole pelkkä parametrimäärä. Olennaisempaa on Zhipun painotus jälkikoulutukseen sekä testeihin, joissa arvioidaan, pystyykö malli viemään ohjelmistotehtävän läpi usean vaiheen ajan.
Mallia arvioivien kehittäjien kannattaa kiinnittää huomiota ainakin näihin kysymyksiin:
GLM-5.3 on 743 miljardin parametrin malli, jonka Zhipu AI sanoo saaneen suuren osan suorituskykyparannuksestaan jälkikoulutuksesta suuremman perusmallin sijaan. Terminal-Bench 3.0 -tuloksen nousu 4,6:sta 28,3:een ja DeepSWE 1.1 -tuloksen nousu 46,2:sta 66,9:ään kiteyttävät julkaisun vahvimman lupauksen: aiempaa kyvykkäämmät koodausagentit, jotka pystyvät käsittelemään pidempiä ohjelmistotehtäviä.
Tulokset ovat riittävän merkittäviä ansaitakseen tarkemman seurannan, erityisesti avoimien mallien koodaus- ja agenttikäytössä. Vahvan testituloksen ja luotettavan autonomisen toiminnan välinen kuilu on silti edelleen todistamatta riippumattomissa kokeissa.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI:n mukaan GLM 5.3 parantaa koodaustulosta noin 50 prosenttia GLM 5.2:een verrattuna pääasiassa jälkikoulutuksen, ei suuremman perusmallin, ansiosta.
Zhipu AI:n mukaan GLM 5.3 parantaa koodaustulosta noin 50 prosenttia GLM 5.2:een verrattuna pääasiassa jälkikoulutuksen, ei suuremman perusmallin, ansiosta. GLM 5.3 sai Terminal Bench 3.0 testissä tuloksen 28,3 ja DeepSWE 1.1 testissä 66,9, kun GLM 5.2:n tulokset olivat vastaavasti 4,6 ja 46,2.
Mallia markkinoidaan pidempiin ohjelmistokehityksen työnkulkuihin, työkalujen käyttöön ja tekoälyagenttitehtäviin, joissa järjestelmä voi toimia ohjelmistoympäristössä vähäisemmällä ihmisen valvonnalla.