| Platform operasyonunun önemli bölümü sağlayıcı tarafından üstlenilir |
TrueForge’un farkı yalnızca model seçimi değil, mimari yaklaşım. Ekipler aynı çalışma katmanını farklı model uç noktalarıyla kullanabilir; çalışma ortamının, verinin ve kontrol mekanizmalarının nerede bulunacağına kendileri karar verebilir. Claude Managed Agents ise daha dikey ve bütünleşik bir yol sunuyor: kurulacak altyapı daha az, ancak Anthropic’in platformuna ve model ekosistemine bağımlılık daha fazla.
TrueFoundry, iki sistemi DevRev’in Enterprise-Bench testindeki 14 birinci ve ikinci seviye görev üzerinde karşılaştırdığını söylüyor. Görevler; kurumsal sistemler arasında çalışmayı, MCP sunucularını çağırmayı ve farklı kaynaklardan gelen bilgileri tek bir yanıtta birleştirmeyi gerektiriyordu. Şirket, her yapılandırmaya aynı görevlerin verildiğini ve her yapılandırma için üç deneme yapıldığını belirtiyor.
Bildirilen sonuçlar şöyle:
Bu rakamlar, TrueFoundry’nin testinin sonuçlarını aktarması bakımından anlamlı; ancak evrensel bir fiyat garantisi olarak okunmamalı. Test küçük bir görev setine dayanıyor. Ayrıca yüzde 75’lik karşılaştırmada hem çalışma katmanı hem de model değişiyor. Dolayısıyla farkın ne kadarının TrueForge’dan, ne kadarının Opus 4.8 yerine GLM-5.2 kullanılmasından kaynaklandığı ayrıştırılamıyor. Bağımsız bir değerlendirme de toplam işletme maliyetindeki düşüş iddiasının altyapı, çalışan ve diğer kurumsal giderleri otomatik olarak kapsamadığına dikkat çekti.
TrueFoundry’nin yaklaşımı iki temel kaldıraç üzerine kuruluyor: ajanın gereksiz iş yapmasını engellemek ve her göreve uygun modeli seçebilmek.
Bu ayrım bütçe hesabında kritik. Bir kurum kendi testini yaparken yalnızca token fiyatını değil; girdi ve çıktı token’larını, bağlamın büyümesini, araç çağrılarını, tekrar denemeleri, gecikmeyi, model barındırma giderlerini ve insan denetimini de ölçmeli. Mevcut kanıtlar TrueFoundry’nin benchmark sonuçlarını şirketin bildirdiği sonuçlar olarak destekliyor; aynı oranın her ajan, model, iş yükü veya eşzamanlılık düzeyinde tekrarlanacağını göstermiyor.
Kendi altyapınızda çalıştırma modeli, ajanın yürütme ortamı üzerindeki kontrolü müşteriye taşır. TrueForge ile kurum; çalışma katmanını yönettiği altyapının içine yerleştirebilir, ağ sınırlarını belirleyebilir ve istemlerin, belgelerin, araç çıktılarının ve izlerin nasıl ele alınacağını kendisi tasarlayabilir. Bu yaklaşım veri yerleşimi ve kurum içi erişim gereksinimlerini karşılamayı kolaylaştırabilir; ancak kendi sunucunuzda çalıştırmak tek başına mevzuata uyum sağlamaz. Erişim kontrolü, saklama süreleri, denetim kayıtları, model yönetişimi ve araç izinleri yine kurum tarafından tasarlanıp işletilmelidir.
Kontrol arttıkça operasyon sorumluluğu da artar. TrueForge kullanan bir kurumun şu alanları üstlenmesi gerekebilir:
Yönetilen hizmetler bu işlerin önemli bölümünü ortadan kaldırarak prototipten üretime geçişi hızlandırabilir. Bunun karşılığında kurum, çalışma katmanı üzerindeki kontrolünün bir kısmından ve model taşınabilirliğinden vazgeçer. Yönetilen ve kendi kendine barındırılan ajanlar arasındaki değerlendirmeler de kararı yalnızca yazılım fiyatına değil; uyumluluk, veri sahipliği, model yönlendirme, operasyon kapasitesi ve iş yükü uyumuna bağlamayı öneriyor.
TrueForge şu ihtiyaçları olan kurumlar için daha güçlü bir aday olabilir:
Claude Managed Agents şu önceliklere sahip ekipler için daha uygun olabilir:
Kendi altyapınızda çalıştırmak otomatik olarak daha ucuz değildir. Düşük veya öngörülemeyen hacimlerde yönetilen hizmetler, atıl kapasiteyi ve platform işçiliğinin önemli bölümünü sağlayıcının üstlenmesi sayesinde ekonomik olabilir. Kendi kendine barındırma; kullanımın sürekli olduğu, model seçiminin anlamlı tasarruf sağladığı ve kurumun mevcut altyapı yetkinliğinden yararlanabildiği durumlarda daha cazip hale gelir.
TrueFoundry, 2021’de eski Meta mühendisleri Nikunj Bajaj, Abhishek Choudhary ve Anuraag Gutgutia tarafından kuruldu. Şirket, Intel Capital liderliğinde Peak XV, Eniac Ventures ve Jump Capital’ın katıldığı 19 milyon dolarlık Seri A yatırımını duyurdu. Tura melek yatırımcılar da katıldı.
TrueForge’un erken dönem üretim kullanıcıları arasında NetApp, Automatiq ve TrueFoundry’nin kurum içi Ask TFY sistemi gösteriliyor. Bu örnekler erken kurumsal kullanıma işaret ediyor; ancak farklı üretim ortamlarında geniş kapsamlı ve bağımsız güvenilirlik kanıtı anlamına gelmiyor.
TrueForge, temel dil modelinden ve ağırlıklı olarak geliştiricilerin ajan mantığı kurmasına yardım eden çerçevelerden farklı olan ajan çalışma zamanı katmanında yer alıyor.
TrueForge’un en inandırıcı vaadi, yönetilen ajanların artık gereksiz olduğu değil. Bazı kurumların; model seçimini, dağıtım ortamını ve ajan döngüsünü kendi yönetişim gereksinimleri doğrultusunda kontrol etmek isteyebileceği fikri.
Aynı Opus modeliyle yaklaşık yüzde 30, GLM-5.2’ye geçildiğinde ise yüzde 75’e varan maliyet düşüşü iddiası test edilmeye değer. Ancak bu oranlar, kurumun kendi görevlerinde yeniden üretilene kadar hipotez olarak ele alınmalı.
En sağlıklı değerlendirme, gerçek araçlar ve verilerle yapılacak sınırlı bir pilot olur. Başarı oranı, hata türleri, uçtan uca gecikme, token ve bağlam tüketimi, model ve altyapı maliyeti, güvenlik kontrolleri, operasyon emeği ve insan incelemesi birlikte ölçülmeli.
Bu yığını işletecek kapasitesi veya ihtiyacı olmayan ekipler için Claude Managed Agents hâlâ daha iyi ürün tercihi olabilir. Kontrol, taşınabilirlik ve sürekli iş yüklerinde ekonomi öncelikliyse TrueForge, üretim güvenilirliğini garanti eden sihirli bir çözüm değil; kapsamı sınırlandırılmış bir kurumsal pilot için makul bir aday.