Эксперты Artificial Analysis представили AA AgentPerf — первый в отрасли открытый бенчмарк для оценки инфраструктуры под задачи агентного ИИ [4]. Тест измеряет, сколько параллельных «кодерских» агентов способна обслуживать система, соответствуя строгим требованиям по скорости выдачи токенов [4].

Create a landscape editorial hero image for this Studio Global article: What did Nvidia achieve in the first published results of Artificial Analysis's AgentPerf benchmark, what does this new benchmark measure, a. Article summary: Here are the key findings from the first published results of Artificial Analysis's **AA-AgentPerf** benchmark, announced on June 12, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "We measure real-world performance of AI accelerator systems during language model inference. ## AA-AgentPerf: The Hardware Benchmark for the Agent Era. AA-AgentPerf has been shaped" source context "AI Hardware Benchmarking & Performance Analysis" Reference image 2: visual subject "For years, co-founder and chief executive officer Jensen Huang and other higher-ups at Nvidia have
В середине июня 2026 года аналитическая платформа Artificial Analysis опубликовала дебютные результаты своего нового бенчмарка AA-AgentPerf, и безоговорочным лидером в них стала Nvidia . Это событие не просто очередная строчка в рейтингах, а важный маркер для всей индустрии, активно переходящей к эпохе агентного ИИ.
В отличие от классических MLPerf-тестов, которые оценивают скорость обработки одиночных запросов или обучение моделей, AgentPerf заточен под имитацию реальной работы автономных ИИ-агентов. Представьте не чат-бота, который отвечает на вопрос, а ассистента-программиста, который сам пишет код в IDE, ходит в интернет за документацией и держит в уме десятки файлов проекта .
Бенчмарк берет за основу реальные «траектории» действий агентов-разработчиков из публичных репозиториев на 12+ языках программирования. Он требует от системы не просто генерировать ответы, а выдерживать многоходовые цепочки: последовательные вызовы языковой модели, обращения к инструментам (с эмулируемой задержкой CPU) и работу с постоянно растущим контекстным окном .
Ключевая метрика здесь — количество параллельно работающих агентов, которых инфраструктура может обслуживать с соблюдением строгих соглашений об уровне сервиса (SLO). В опубликованных тестах замерялись жесткие лимиты: скорость выдачи не ниже 20 или 60 токенов в секунду при задержке первого токена не более 10 секунд . Итоговая производительность нормируется на один ускоритель и на мегаватт потребляемой энергии
.
Тесты проводились на одной из самых требовательных современных моделей — DeepSeek V4 Pro (большая смесь экспертов, MoE), которая как раз и лежит в основе самых мощных агентных систем .
Результаты Nvidia впечатляют:
Запуск AgentPerf и победа в нем — не случайность, а просчитанная демонстрация готовности Nvidia к новой волне «агентных фабрик». Стратегия компании прослеживается сразу по нескольким направлениям.
Тотальная кооптимизация «железа» и софта. 20-кратный отрыв от Hopper Nvidia объясняет не просто сменой кристалла, а слаженной работой всех звеньев платформы: объединение 72 GPU через NVLink в единую фабрику, специальные CUDA-ядра, которые перекрывают вычисления и передачу данных для MoE-моделей, и новые оптимизации в TensorRT LLM (WideEP, DeepEP, DeepGEMM) .
Доминирование в бенчмарках. AgentPerf для Nvidia — лишь новый фронт в череде побед. Архитектура Blackwell Ultra уже установила рекорды в MLPerf Inference v5.1 (в 1.4 раза быстрее обрабатывает DeepSeek-R1 по сравнению с предшественником) и заняла первые места во всех семи тестах MLPerf Training v5.1
.
Доказательства от экосистемы. Партнеры Nvidia — такие как Together AI (на чьей инфраструктуре работают агенты в IDE Cursor) и DeepInfra (поддерживающая «ИИ-сотрудников» от Pam.ai) — уже запустили агентные рабочие нагрузки на Blackwell Ultra. Это подчеркивает, что платформа готова к реальной коммерческой эксплуатации, а не только к лабораторным тестам .
Взгляд в будущее. В блоге компания не упускает шанс упомянуть, что следующее поколение архитектуры, Vera Rubin (уже запущенное в производство), станет новым шагом для наращивания агентных ИИ-мощностей . Как отмечают технические обзоры, ожидается рост вычислительной мощности до 50 PFLOPS в формате NVFP4 и улучшенная аппаратная поддержка вызовов инструментов
.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Эксперты Artificial Analysis представили AA AgentPerf — первый в отрасли открытый бенчмарк для оценки инфраструктуры под задачи агентного ИИ [4].
Эксперты Artificial Analysis представили AA AgentPerf — первый в отрасли открытый бенчмарк для оценки инфраструктуры под задачи агентного ИИ [4]. Тест измеряет, сколько параллельных «кодерских» агентов способна обслуживать система, соответствуя строгим требованиям по скорости выдачи токенов [4].
Nvidia GB300 NVL72 на архитектуре Blackwell Ultra показала максимум — 61 340 агентов одновременно — с 20 кратным превосходством над системами на базе Hopper в пересчете на мегаватт [4][14].