Новий бенчмарк AgentPerf від Artificial Analysis оцінює не просто чат боти, а реальні робочі навантаження агентного ШІ, вимірюючи кількість одночасних кодінг агентів, яких може підтримувати система при заданих вимогах... Платформа Nvidia GB300 NVL72 (Blackwell Ultra) досягла найвищої продуктивності серед усіх протес...

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
12 червня 2026 року компанія Artificial Analysis опублікувала перші результати свого нового бенчмарку AA-AgentPerf, і вони стали справжнім тріумфом для Nvidia. Платформа GB300 NVL72 на архітектурі Blackwell Ultra не просто випередила конкурентів — вона продемонструвала квантовий стрибок у продуктивності для абсолютно нового класу завдань: агентного штучного інтелекту.
AA-AgentPerf — це перший у галузі відкритий, мультивендорний апаратний бенчмарк, розроблений спеціально для робочих навантажень агентного ШІ. Це принципово новий рівень тестування, адже традиційні бенчмарки здебільшого вимірюють продуктивність у режимі звичайних текстових відповідей ("запитання — відповідь"). AgentPerf же симулює поведінку справжніх AI-агентів.
Уявіть собі не просто чат-бота, а розумного помічника-розробника, який самостійно пише, перевіряє та налагоджує код. Саме такі складні ланцюжки дій і відтворює бенчмарк. Він використовує реальні траєкторії кодінг-агентів, взяті з публічних репозиторіїв із понад 12 мовами програмування. Ці траєкторії включають послідовні виклики великих мовних моделей (LLM), виклики інструментів (симульовані з реалістичними затримками центрального процесора) та постійне зростання контекстного вікна.
Головне питання, на яке відповідає AgentPerf: скільки таких агентів система може обслуговувати одночасно із дотриманням чітких вимог до швидкості генерації токенів та часу до першого токена (TTFT). Усі результати для об'єктивності нормалізуються на один прискорювач та на один мегават спожитої енергії.
У першому раунді AgentPerf тестувалася робота з моделлю DeepSeek V4 Pro — великою сумішшю експертів (MoE), яка є типовим представником передових моделей для агентного ШІ. І ось ключові досягнення Nvidia Blackwell Ultra:
Це не просто "швидше". Це означає, що для обслуговування однакової кількості AI-агентів новій платформі потрібно в 20 разів менше електроенергії, що є критичним фактором для економіки дата-центрів та їхнього впливу на довкілля.
Тріумф у AgentPerf не є випадковістю. Це частина масштабної та багаторівневої кампанії Nvidia із закріплення Blackwell Ultra як безальтернативної платформи для ери агентного ШІ.
1. Історія про повну оптимізацію. 20-кратний стрибок продуктивності — це не просто заслуга нового "заліза", а результат глибокої співпраці апаратного та програмного забезпечення. Nvidia підкреслює роль таких технологій:
2. Повне домінування в бенчмарках. AgentPerf став логічним доповненням до низки попередніх перемог. Раніше Blackwell Ultra встановив рекорди в MLPerf Inference v5.1 (в 1,4 раза більша продуктивність на DeepSeek-R1 порівняно з Blackwell) та здобув перемогу в усіх семи тестах MLPerf Training v5.1, включно з найскладнішим — попереднім тренуванням Llama 3.1 405B, яке було виконане за рекордні 10 хвилин на 5 120 графічних процесорах Blackwell
. Nvidia методично закриває всі можлимі категорії — від тренування до інференсу, а тепер і до агентних навантажень.
3. Докази з реального світу. Щоб розвіяти скепсис щодо "синтетичних" бенчмарків, Nvidia наводить приклади партнерів, які вже використовують Blackwell для агентних робочих навантажень у продакшені:
4. Погляд у майбутнє. У своєму блозі Nvidia вже анонсує наступне покоління — архітектуру Vera Rubin, яка "вже запущена у виробництво" і стане наступним кроком для нарощування потужностей агентного ШІ . Технічні документи також натякають на майбутні покращення, зокрема на 50 петафлопсів обчислювальної потужності у форматі NVFP4 та прискорення викликів інструментів LLM
.
Схоже, Nvidia не просто готується до ери агентного ШІ — вона створює для неї фундамент, який поки що не має рівних.
Джерела: Nvidia Blog про AgentPerf , пост Artificial Analysis у X
, Nvidia Blog про MLPerf Inference v5.1
, Nvidia Blog про MLPerf Training v5.1
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Новий бенчмарк AgentPerf від Artificial Analysis оцінює не просто чат боти, а реальні робочі навантаження агентного ШІ, вимірюючи кількість одночасних кодінг агентів, яких може підтримувати система при заданих вимогах...
Новий бенчмарк AgentPerf від Artificial Analysis оцінює не просто чат боти, а реальні робочі навантаження агентного ШІ, вимірюючи кількість одночасних кодінг агентів, яких може підтримувати система при заданих вимогах... Платформа Nvidia GB300 NVL72 (Blackwell Ultra) досягла найвищої продуктивності серед усіх протестованих систем, забезпечивши до 61 340 одночасних агентів при найм'якшому рівні обслуговування.
Головний козир — енергоефективність: Blackwell Ultra обробляє у 20 разів більше агентів на мегават, ніж попередня система на базі Nvidia HGX H200 (Hopper).