Zhipu AI zapowiedziało GLM 5.3 — model z 743 mld parametrów, którego deklarowana poprawa programowania o około 50 proc. GLM 5.3 uzyskał 28,3 pkt w teście Terminal Bench 3.0 oraz 66,9 pkt w DeepSWE 1.1 — odpowiednio wobec 4,6 i 46,2 pkt dla GLM 5.2.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Chinese AI startup Zhipu AI announce about its next-generation open-source foundation model GLM-5.3, including its 743-billion-para. Article summary: Zhipu AI announced GLM-5.3, a 743-billion-parameter open-weights foundation model positioned as a major capability upgrade achieved primarily through post-training rather than a larger base model. The company says it sub. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Zhipu AI zaprezentowało GLM-5.3 — model bazowy z otwartymi wagami, przeznaczony przede wszystkim do programowania, inżynierii oprogramowania i pracy agentowej, a nie tylko do prowadzenia rozmów. Model ma 743 mld parametrów, czyli według deklaracji firmy tyle samo co GLM-5.2. Najważniejsza zmiana ma dotyczyć post-treningu: dodatkowego etapu szkolenia, który kształtuje sposób planowania, korzystania z narzędzi i realizowania złożonych zadań.
Zhipu podaje, że GLM-5.3 poprawił wynik w wewnętrznym Z.ai Code Bench o około 50 proc. względem poprzednika. W testach wymagających dłuższej, wieloetapowej pracy programistycznej model osiągnął 28,3 pkt w Terminal-Bench 3.0 oraz 66,9 pkt w DeepSWE 1.1. To sugeruje ambicję stworzenia systemu, który nie tylko wygeneruje fragment kodu, ale także przejrzy repozytorium, uruchomi polecenia, znajdzie błąd i będzie kontynuował pracę nad rozwiązaniem. Deklaracje te nadal wymagają jednak niezależnej weryfikacji w praktyce.
743 mld parametrów to imponująca skala, ale Zhipu przedstawia GLM-5.3 przede wszystkim jako przykład tego, że poprawa możliwości modelu nie musi wynikać z jego dalszego powiększania. Firma twierdzi, że GLM-5.3 korzysta z tej samej bazowej skali co GLM-5.2, a znaczna część zysków pochodzi z post-treningu.
W praktyce post-trening może wpływać na to, jak model rozbija problem na kroki, reaguje na nieudane polecenia, używa narzędzi, interpretuje instrukcje i utrzymuje kierunek działania podczas długiego procesu. Dostępne materiały potwierdzają, że Zhipu tak opisuje strategię szkolenia GLM-5.3, ale nie rozstrzygają niezależnie, jaki udział w każdym wzroście miała konkretna technika.
Według Zhipu GLM-5.3 osiąga około 50-procentową poprawę w programowaniu względem GLM-5.2 w teście Z.ai Code Bench. Jeszcze wyraźniejsza różnica pojawia się w benchmarkach, które sprawdzają realizację całych, wieloetapowych zadań:
Terminal-Bench 3.0 ma szczególne znaczenie dla deklaracji dotyczących programistycznych agentów, ponieważ sprawdza pracę z terminalem i powłoką systemową, a nie tylko udzielanie statycznych odpowiedzi. DeepSWE 1.1 koncentruje się na zadaniach inżynierii oprogramowania, dlatego jego wynik jest bardziej zbliżony do oceny kompletnego procesu deweloperskiego.
Zhipu twierdzi, że wynik 28,3 w Terminal-Bench 3.0 był w momencie ogłoszenia najwyższy wśród modeli open source i wyprzedzał Kimi K3 firmy Moonshot AI. To jednak ranking podany przez producenta. Porównując modele, trzeba brać pod uwagę wersję benchmarku, sposób formułowania promptów oraz warunki dostępu do każdego systemu.
Kierunek rozwoju GLM-5.3 jest wyraźny: Zhipu chce, by model robił więcej niż tylko podpowiadał kod. Firma przedstawia go jako system zdolny do korzystania z narzędzi, obsługi oprogramowania i wykonywania dłuższych sekwencji działań przy mniejszym udziale człowieka.
Różnica przypomina przejście od asystenta odpowiadającego na pojedyncze pytanie do agenta, który może samodzielnie przejrzeć repozytorium, wykonać polecenie, zdiagnozować problem, zmienić pliki i ponowić próbę. Wyniki w Terminal-Bench i DeepSWE są zgodne z takim kierunkiem, ale sam wynik benchmarku nie dowodzi jeszcze, że agent będzie niezawodny w nieznanym środowisku produkcyjnym.
Zhipu twierdzi również, że możliwości programistyczne i agentowe GLM-5.3 zbliżają się do poziomu Claude Fable 5, a w praktycznych zadaniach programistycznych model ma przewyższać inne chińskie modele. Są to deklaracje pozycjonujące producenta, a nie ostateczny, niezależny ranking.
W komunikacie Zhipu łączy lepsze rozumowanie i korzystanie z narzędzi z zastosowaniami w cyberbezpieczeństwie, w tym z możliwością wykrywania luk w oprogramowaniu. W publicznie opisywanych wynikach model uzyskał 84,5 proc. w CyberGym w zadaniach związanych z identyfikacją i walidacją podatności.
To obszar o podwójnym zastosowaniu. Te same zdolności, które mogą pomóc obrońcom szybciej znajdować słabe punkty, mogą również zwiększać konsekwencje niebezpiecznego działania autonomicznego systemu. Dostępne dowody uzasadniają opisanie wykrywania podatności jako deklarowanego obszaru możliwości — nie jako dowodu, że GLM-5.3 jest niezawodnym audytorem bezpieczeństwa lub może bezpiecznie prowadzić autonomiczne działania ofensywne.
Najważniejszym sygnałem nie jest sama liczba parametrów, lecz nacisk Zhipu na post-trening oraz testy mierzące, czy model potrafi utrzymać się na właściwym torze podczas wieloetapowej pracy nad oprogramowaniem.
Deweloperzy rozważający wykorzystanie modelu powinni sprawdzić przede wszystkim:
GLM-5.3 to model z 743 mld parametrów, który według Zhipu AI zawdzięcza dużą część poprawy post-treningowi, a nie większej bazie. Skok z 4,6 do 28,3 pkt w Terminal-Bench 3.0 oraz z 46,2 do 66,9 pkt w DeepSWE 1.1 jasno pokazuje główną obietnicę modelu: bardziej kompetentnych agentów programistycznych zdolnych do pracy nad dłuższymi zadaniami.
Wyniki są wystarczająco interesujące, by dokładniej przetestować GLM-5.3 w projektach wykorzystujących otwarte modele, programowanie i agentów AI. Na razie pozostają jednak przede wszystkim deklaracjami producenta. Różnica między mocnym wynikiem benchmarkowym a niezawodnym, autonomicznym działaniem w prawdziwym środowisku wciąż wymaga niezależnego sprawdzenia.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zhipu AI zapowiedziało GLM 5.3 — model z 743 mld parametrów, którego deklarowana poprawa programowania o około 50 proc.
Zhipu AI zapowiedziało GLM 5.3 — model z 743 mld parametrów, którego deklarowana poprawa programowania o około 50 proc. GLM 5.3 uzyskał 28,3 pkt w teście Terminal Bench 3.0 oraz 66,9 pkt w DeepSWE 1.1 — odpowiednio wobec 4,6 i 46,2 pkt dla GLM 5.2.
Zhipu pozycjonuje model jako narzędzie do dłuższych procesów inżynierii oprogramowania, korzystania z narzędzi i pracy agentowej, w tym obsługi programów przy mniejszym nadzorze człowieka oraz wykrywania potencjalnych...