Tang Jie’nin uzatılmış “sooooooon” yanıtı, teknoloji dünyasında nadir görülen bir hızla gerçeğe dönüştü: Raporlara göre Zhipu, başbilim insanının bu mesajından yalnızca birkaç saat sonra GLM-5.3’ü yayımladı.
12
Ancak lansmanı ilginç kılan yalnızca zamanlaması değildi. Zhipu AI’ın yeni modeli; kodlama, araç kullanan yapay zekâ ajanları ve siber güvenlik görevleri için tasarlandı. Teknik açıdan en dikkat çekici nokta ise GLM-5.3’ün, GLM-5.2 ile aynı yaklaşık 743 milyar parametreli temel modeli koruması. Zhipu, performans artışını daha büyük bir ön-eğitim çalışmasından ziyade kapsamı genişletilmiş son-eğitime bağlıyor.
1
4
20
Aynı temel modelden daha fazla yetenek
GLM-5.3’ün lansmanı, son-eğitimi model performansındaki sıçramanın ana kaynağı olarak öne çıkarıyor. Yapay zekâ sektöründe ilerleme çoğu zaman daha büyük modeller veya baştan eğitilmiş yeni temel modellerle ilişkilendirilirken, Zhipu farklı bir yolun mümkün olduğunu savunuyor.
Şirketin yayımladığı karşılaştırmalara göre en belirgin ilerleme, araç kullanımının ve birden fazla adımın gerektiği zor yazılım görevlerinde görüldü:
- SWE-Marathon: 19,4’ten 42,5’e
- FrontierSWE: 67,5’ten 78,1’e
- Terminal-Bench 3.0: 4,6’dan 28,3’e
- DeepSWE v1.1: 46,2’den 66,9’a
Bu rakamlar Zhipu’nun yayımladığı karşılaştırmalara ve bu sonuçları inceleyen ikincil analizlere dayanıyor.
1
3
6
7
Terminal-Bench sonucundaki artış, puan farkı açısından özellikle çarpıcı. Yine de düşük bir başlangıç puanından gelen büyük sıçrama, modelin her yazılım mühendisliği görevinde en iyi olduğu anlamına gelmiyor. Örneğin SWE-Marathon’da açıklanan 42,5 puan, aynı tabloda Kimi K3’ün 48,1 ve Opus 4.8’in 48,8 puanlık sonuçlarının gerisinde kaldı.
6
9
Manşeti CyberGym attı
GLM-5.3’ün en çok ses getiren sonucu, kaynak kodundaki güvenlik açıklarını bulup doğrulamaya odaklanan CyberGym testindeki 84,5 puan oldu. Zhipu’nun karşılaştırmasında bu sonuç, 83,8 puan alan Mythos 5’in ve 83,6 puan alan GPT-5.6 Sol’un önünde yer aldı.
2
5
6
CyberGym yalnızca modelin güvenli kod önermesini ölçmüyor. Bildirilen görev; zayıflıkları tespit etmeyi, saldırılar oluşturmayı ve bunların etkilerini doğrulamayı içeriyor. Bu nedenle test, sıradan kod tamamlamadan çok güvenlik açığı keşfi ve istismar zincirinin farklı aşamalarını planlama becerisine yakın.
12
17
Sonuçların ilgi çekmesinin nedeni de bu. The Register, Zhipu’nun modeldeki ilerlemenin tek tek hataları bulmanın ötesine geçerek birden fazla aşamadan oluşan istismar zincirleri üzerinde akıl yürütmeyi kapsadığı yönündeki açıklamasını aktardı.
17
Bununla birlikte “lider” ifadesini bağlamından koparmamak gerekiyor. Mevcut karşılaştırmalar büyük ölçüde şirket tarafından raporlandı ve sonuçların geniş ölçekli bağımsız tekrarları henüz bulunmuyor.
2
4
6
Gerçek kod tabanlarında güvenlik testi iddiası
Zhipu, CyberGym sonuçlarının yanı sıra modellerini gerçek dünyadaki kod tabanlarında güvenlik ekipleriyle birlikte test ettiğini de açıkladı. Şirketin bildirdiği kayıtlara göre 269 açık kaynak projede 2.436 güvenlik bulgusu tespit edildi; bunların 1.097’si Kritik veya Yüksek önem derecesine sahipti. Raporlarda en eski bulgunun 1981’e dayandığı ve söz konusu açıkların ortalama 26,6 yıl boyunca keşfedilmeden kaldığı belirtildi.
21
31
Bu rakamlar, Zhipu’nun GLM-5.3’ü ilişkilendirmek istediği güvenlik çalışma akışının kapsamına dair fikir veriyor. Ancak bağımsız olarak denetlenmiş ölçümler gibi okunmamalı. Sunulan haberlerde bu kayıtların kaynağı doğrudan Zhipu olarak gösteriliyor ve genel benchmark tablosu da ağırlıklı olarak şirket açıklamalarına dayanıyor.
Hedef yalnızca kod yazmak değil
Zhipu’nun konumlandırması, tek başına kod üretmenin ötesine geçiyor. GLM-5.3; araçları kullanabilen, terminal ortamında çalışabilen ve bir yazılım projesinde birden fazla adımı tamamlayabilen uzun süreli yapay zekâ ajanları için pazarlandı.
Açıklanan sonuçlar arasında Toolathlon Verified’da 73,0 (GLM-5.2’de 59,9) ve AutomationBench’te 48,2 (26,2) bulunuyor. Diğer yayımlanmış karşılaştırmalarda Agents’ Last Exam sonucu 28,5 olarak verildi.
1
7
11
Bu testler pratik bir ayrımı öne çıkarıyor: GLM-5.3’ün hedeflenen avantajı yalnızca kulağa doğru gelen bir kod parçası yazmak değil; bir depo, terminal veya araç ortamında art arda eylemler gerçekleştirerek görevi tamamlamak. Bunun üretim ortamlarında güvenilir yazılım mühendisliğine dönüşüp dönüşmeyeceği ise araç izinleri, test kapsamı, insan incelemesi ve modelin belirli bir kod tabanındaki hata oranı gibi etkenlere bağlı.
Lansman neyi gösteriyor, neyi göstermiyor?
Eldeki en güçlü kanıtlar, “GLM-5.3 tüm öncü modelleri geride bıraktı” gibi geniş bir sonuca değil, daha sınırlı bir değerlendirmeye izin veriyor. Zhipu’nun sonuçları; GLM-5.2’ye kıyasla çeşitli kodlama ve ajan benchmark’larında belirgin bir artışa, ayrıca şirketin yayımladığı ve lansman haberlerinde aktarılan karşılaştırma tablolarında CyberGym’de lider bir puana işaret ediyor.
2
5
6
Bu sonuçlar GLM-5.3’ün tüm programlama, akıl yürütme, güvenlik veya genel amaçlı görevlerde eşit biçimde üstün olduğunu kanıtlamıyor. Bazı rakip modeller tek tek kodlama testlerinde daha yüksek puan aldı; mevcut sonuçlar da bağımsız değerlendiriciler tarafından kapsamlı biçimde tekrarlanmış değil.
6
9
Daha önemli çıkarım yöntemle ilgili olabilir: GLM-5.3, özel yetenekleri mevcut ve büyük bir temel modelden çıkarmak için ölçeklendirilmiş son-eğitimi öne çıkarıyor. Bağımsız testler bu kazanımları doğrularsa, yapay zekâ geliştirmede son-eğitime yapılan yatırım ve gerçek yazılım-güvenlik iş akışları üzerindeki dikkatli ölçümler, parametre sayısı karşılaştırmaları kadar önemli hâle gelebilir.