Benchmark AA AgentPerf dari Artificial Analysis, diumumkan 12 Juni 2026, adalah benchmark hardware terbuka pertama yang khusus mengukur beban kerja agen AI—bukan sekadar chatbot biasa [4]. Menggunakan model DeepSeek V4 Pro, platform Nvidia GB300 NVL72 (Blackwell Ultra) mencatat performa tertinggi, menjalankan hingga...

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
Ajang unjuk performa di dunia AI kembali memanas. Kali ini, bukan sekadar kecepatan merangkai kata, melainkan kecerdasan buatan yang bisa 'bekerja' secara mandiri. Pada 12 Juni 2026, Artificial Analysis merilis hasil perdana benchmark terbaru mereka, AA-AgentPerf, dan hasilnya menempatkan Nvidia di puncak klasemen .
AA-AgentPerf hadir sebagai benchmark hardware multi-vendor pertama di industri yang secara spesifik dirancang untuk mengukur beban kerja inferensi AI agentic . Ini berbeda jauh dengan benchmark yang ada saat ini, yang umumnya hanya menguji kemampuan model AI dalam merespons satu kali percakapan (single-turn chat).
Lantas, apa yang diukur? Bayangkan Anda memiliki tim asisten virtual yang bisa menulis kode, mencari informasi, dan menjalankan perintah secara berurutan untuk menyelesaikan satu tugas kompleks. AgentPerf mengukur berapa banyak 'asisten kode' AI seperti itu yang bisa berjalan dalam satu waktu secara bersamaan, sambil memenuhi standar kecepatan minimal yang sudah ditentukan (Service-Level Objectives atau SLO) .
Untuk menciptakan skenario realistis, benchmark ini menggunakan rekam jejak agen kode (coding agent trajectories) sungguhan dari repositori publik, mencakup lebih dari 12 bahasa pemrograman. Pengujiannya pun kompleks, melibatkan rangkaian panggilan LLM, panggilan alat (tool calls) dengan simulasi jeda CPU, dan konteks percakapan yang terus bertambah . Semua hasil kinerjanya dinormalisasikan per akselerator (GPU) dan per megawatt (MW)—menyoroti aspek efisiensi daya
.
Hasilnya? Keunggulan Nvidia sangat telak. Platform rakitan teranyar mereka, Nvidia GB300 NVL72 dengan arsitektur Blackwell Ultra, berhasil menyalip semua platform lain dalam pengujian menggunakan model DeepSeek V4 Pro. Model ini adalah model mixture-of-experts (MoE) besar yang mewakili kelas model agen AI frontier canggih .
Jika dibandingkan dengan sistem Nvidia HGX H200 (arsitektur Hopper) generasi sebelumnya, lompatan efisiensinya sangat signifikan:
Untuk gambaran lebih jelas, berikut perbandingan performanya:
Hasil gemilang ini bukanlah kejutan tanpa sebab. Ini adalah bagian dari kampanye agresif Nvidia untuk memposisikan platform Blackwell Ultra sebagai fondasi utama bagi era agen AI berskala besar. Beberapa pilar strategi mereka terlihat jelas:
Cerita Optimasi Full-Stack. Nvidia mengklaim peningkatan 20x lipat ini bukan hanya berkat perangkat keras baru, tetapi hasil dari desain bersama (co-design) yang ekstrem: teknologi NVLink yang menghubungkan 72 GPU menjadi satu sistem tunggal, kernel CUDA yang mampu menumpang-tindihkan komunikasi dan komputasi untuk model MoE, serta pustaka TensorRT LLM (seperti WideEP/DeepEP, DeepGEMM, dan fused MoE) yang menjaga efisiensi tetap tinggi seiring bertambahnya jumlah agen .
Dominasi di Semua Lini Benchmark. AgentPerf hanyalah tambahan terbaru dalam portofolio benchmark Nvidia. Sebelumnya, Blackwell Ultra sudah memecahkan rekor di MLPerf Inference v5.1 (1,4x throughput DeepSeek-R1 dibandingkan Blackwell generasi pertama) dan menyapu bersih tujuh benchmark di MLPerf Training v5.1
.
Bukti di Dunia Nyata. Nvidia menekankan bahwa mitra mereka, seperti Together AI (yang menggerakkan fitur kode agen di aplikasi Cursor) dan DeepInfra (yang mendukung tenaga kerja AI Pam.ai), sudah menggunakan infrastruktur Blackwell untuk beban kerja agen nyata. Ini adalah sinyal kuat bahwa perangkat ini bukan sekadar jawara benchmark, tetapi sudah siap pakai untuk produksi .
Peta Jalan Masa Depan. Di akhir pengumuman, Nvidia sudah melirik ke depan. Mereka secara eksplisit menyebutkan arsitektur generasi berikutnya, Vera Rubin (yang saat berita ini dirilis sudah dalam tahap produksi), sebagai langkah evolusi selanjutnya untuk menyediakan kapasitas agen AI yang lebih besar lagi .
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Benchmark AA AgentPerf dari Artificial Analysis, diumumkan 12 Juni 2026, adalah benchmark hardware terbuka pertama yang khusus mengukur beban kerja agen AI—bukan sekadar chatbot biasa [4].
Benchmark AA AgentPerf dari Artificial Analysis, diumumkan 12 Juni 2026, adalah benchmark hardware terbuka pertama yang khusus mengukur beban kerja agen AI—bukan sekadar chatbot biasa [4]. Menggunakan model DeepSeek V4 Pro, platform Nvidia GB300 NVL72 (Blackwell Ultra) mencatat performa tertinggi, menjalankan hingga 61.340 agen AI secara bersamaan [14].
Efisiensi daya melonjak drastis: hingga 20 kali lebih banyak agen per megawatt dibandingkan sistem Nvidia HGX H200 (Hopper) generasi sebelumnya [4].