В тестах SemiAnalysis Nvidia оказалась примерно до 5 раз эффективнее AMD по затратам на GLM 5.3 при целевой скорости 150 выходных токенов в секунду на пользователя и более чем в 20 раз производительнее на Qwen 3.5 при... Преимущество определялось не только характеристиками ускорителей: важную роль сыграли объём памя...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Открытый бенчмарк AgentX 1.0 от SemiAnalysis показал, что связка аппаратного обеспечения Nvidia с CUDA и экосистемой серверного ПО сохраняет заметное преимущество на реалистичных задачах ИИ-агентов, работающих с очень длинным контекстом. В конфигурациях на базе SGLang разрыв достигал примерно 5× по эффективности затрат на GLM 5.3 и более 20× по производительности на Qwen 3.5 при целевой скорости 90 выходных токенов в секунду на пользователя. 26
Однако это не означает, что Nvidia всегда опережает AMD. AgentX сравнивает конкретное сочетание модели, ускорителя, движка инференса, нагрузки, уровня параллелизма и требования к отзывчивости. В отдельных конфигурациях AMD MI355X и специализированный движок ATOM показали конкурентные результаты и даже преимущества. 14
AgentX 1.0 входит в набор тестов InferenceX v3. В отличие от классических бенчмарков с заранее заданной длиной запроса и ответа, он воспроизводит многошаговой трафик coding-агентов — ИИ-систем, которые последовательно анализируют код, меняют его и проверяют результат. В некоторых сценариях длина контекста приближается к 1 млн токенов. 13
В набор вошли 393 анонимизированные сессии Claude Code, предоставленные на условиях добровольного участия. Подходящие сессии содержали не менее 20 запросов. Из данных удалили дубликаты, отдельные клиентские вызовы и реконструированные входы длиннее 990 000 токенов. Медианный запрос включал 142 000 входных и 444 выходных токена, а субагенты использовались в 44% сессий. 8
Такая нагрузка существенно отличается от одиночного запроса. Агент снова и снова отправляет развивающуюся историю диалога и большой фрагмент кодовой базы, добавляя к ним небольшие новые части. Поэтому тест проверяет не только пиковую скорость, но и способность системы долго поддерживать интерактивную работу с множеством больших контекстов.
Наиболее заметный разрыв SemiAnalysis получила в сравнениях с общедоступными конфигурациями SGLang:
Эти цифры нельзя трактовать как единый рейтинг всех продуктов Nvidia и AMD. Речь идёт о сравнении в заданной рабочей точке: InferenceX учитывает конкретный уровень интерактивности и стоимость серверной конфигурации, наблюдавшейся для каждой платформы. 79
Именно поэтому стандартный тест вроде «8 000 входных и 1 000 выходных токенов» может не показать узкие места, которые становятся критичными в многошаговой работе агентов. Ускоритель способен демонстрировать высокую скорость на отдельных запросах, но терять преимущество, когда ему приходится одновременно обслуживать множество больших частично повторяющихся контекстов.
В трассах AgentX значительная часть контекста сохраняется от запроса к запросу. По описанию SemiAnalysis, доля попаданий в префиксный, или KV-, кэш часто превышала 95%. 1
Это меняет соотношение между первоначальной обработкой запроса и генерацией ответа. Система не обрабатывает полностью новый prompt при каждом обращении, а хранит и расширяет большие закэшированные состояния, выдавая сравнительно короткие ответы. Поэтому критичными становятся хранение, поиск, передача и повторное использование этих состояний.
Доступный объём высокоскоростной памяти определяет, какая часть KV-кэша может постоянно находиться на ускорителе. Если рабочий набор превышает объём памяти устройства, серверу приходится переносить данные в оперативную память хоста или иным образом управлять кэшем через более медленный путь. 1
Выгрузка в память хоста позволяет поддерживать больше сессий, но добавляет задержки и создаёт нагрузку на пропускную способность. Платформа, которая удерживает больше активного кэша на ускорителе либо эффективнее организует его перемещение, может обслуживать больше параллельных сессий без потери отзывчивости.
SemiAnalysis также отметила механизм TensorRT-LLM для инкрементальной токенизации с учётом границ. Вместо повторной токенизации всего изменяющегося prompt система распознаёт стабильные границы и обрабатывает только добавленный материал. 1
Для coding-агентов это существенно: запрос может содержать сотни тысяч токенов, а ответ — лишь несколько сотен. В такой модели нагрузки предварительная обработка на CPU и повторная токенизация способны заметно влиять на итоговую стоимость и задержку.
Общий вывод прост: эффективность инференса — это результат взаимодействия оборудования × среды выполнения × модели × нагрузки × целевого уровня задержки. Одних показателей FLOPS, пропускной способности памяти или пиковой скорости недостаточно.
AgentX не показал безоговорочную победу Nvidia. В отдельных сочетаниях модели, скорости и серверного движка AMD добилась заметных преимуществ или приблизилась к паритету — особенно при использовании MI355X с движком ATOM. 1
В телеметрии результаты MI355X разделены по конфигурациям ATOM, SGLang, vLLM и других систем. Это важное уточнение: «результат AMD» напрямую зависит от выбранного движка, реализации модели и настроек тестирования. 4
Специализированные планировщик, работа с кэшем и оптимизированные под AMD ядра ATOM могут хорошо раскрывать возможности MI355X, если модель и характер нагрузки соответствуют конфигурации её памяти. Иными словами, AMD способна быть очень конкурентоспособной, когда оператор готов использовать специально оптимизированный для платформы runtime.
Специализированный движок способен показать, на что оборудование способно в благоприятных условиях. Но при выборе инфраструктуры обычно важны не только лучший результат отдельного ядра или сценария. Заказчикам нужны поддержка разных моделей, регулярные обновления, инструменты, опыт развертывания и понятный путь долгосрочной эксплуатации.
SemiAnalysis сообщает, что её рецепты в основном опираются на рекомендации upstream-проектов vLLM и SGLang — то есть на версии и конфигурации, которые клиентам реалистично развернуть, а не только на специально созданный под бенчмарк стек. 1
Поэтому для большинства потенциальных покупателей AMD более релевантно сравнение на upstream vLLM и SGLang, а не максимальный результат ATOM. Это не утверждение, что ATOM недействителен или бесполезен. Речь о различии между специализированным runtime, требующим отдельной интеграции и сопровождения, и более распространённым серверным слоем с широкой совместимостью.
Бенчмарк также наглядно показывает, насколько быстро устаревают сравнения инференса. В телеметрии присутствует конфигурация AMD MI355X MoRI/SGLang от 21 августа, тогда как другие варианты AMD измерялись в иные даты. 4
Обновление ПО от 21 августа изменило порядок систем как минимум в одном сравнении. Это означает, что улучшения планировщика, ядер, перемещения кэша или поддержки модели способны изменить видимую иерархию ускорителей за несколько дней. 14
Похожий пример приводит более ранняя работа SemiAnalysis с MI355X и Qwen 3.5: последовательные версии SGLang обеспечили значительный прирост производительности за 13 недель. 12
Для практического сравнения командам стоит фиксировать точную версию runtime, конфигурацию, квантизацию модели, диапазон параллелизма и целевой уровень интерактивности. Вердикт об оборудовании без этих данных быстро становится вводящим в заблуждение.
AgentX — полезный показатель для долгоконтекстных coding-агентов, но не перепись всех производственных нагрузок. Набор основан на внутреннем добровольно предоставленном корпусе и включает 393 отобранные сессии, а не репрезентативную выборку всего корпоративного трафика. 8
Результаты могут отличаться для:
В первоначальном сравнении также не участвовали Google TPU. Поэтому AgentX 1.0 не позволяет сделать полноценный вывод о противостоянии Nvidia, AMD и Google. 1
Кроме того, сравнение постоянно меняется. SemiAnalysis указала на будущие точки сопоставления — Nvidia Rubin, AMD MI455X UALoE72 и новые поколения TPU. Их появление может изменить конкурентную картину. 111
SemiAnalysis выпустила набор данных AgentX, тестовый harness, конфигурации, телеметрию и сопутствующие материалы по лицензии Apache 2.0. 1
Долгосрочное значение проекта может оказаться важнее одного заголовка о преимуществе Nvidia над AMD. По данным SemiAnalysis, AgentX уже стал целевой нагрузкой для более чем 70 upstream pull request в проектах vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache и Mooncake. 1
Это даёт разработчикам серверных фреймворков воспроизводимый способ оптимизировать системы под реальное поведение агентов: высокий процент повторного использования префикса, большие KV-кэши, множество коротких ходов, субагенты, передачу кэша, нагрузку на планировщик и стоимость токенизации.
AgentX усиливает аргумент в пользу того, что программная и серверная экосистема Nvidia остаётся серьёзным преимуществом для инференса долгоконтекстных coding-агентов. В проверенных сравнениях SGLang Nvidia получила до 5× преимущества по эффективности затрат на GLM 5.3 и более 20× по производительности на Qwen 3.5 при заданной цели интерактивности. 26
Но бенчмарк не доказывает, что Nvidia выигрывает всегда. MI355X в связке с ATOM показала, что в специально оптимизированных конфигурациях AMD способна обеспечить сопоставимую или лучшую эффективность. А быстрые обновления серверного ПО могут в любой момент изменить расстановку сил.
Для инфраструктурных команд самый полезный вывод — не выбирать победителя по одной громкой цифре, а повторять тест на собственных моделях, runtime, распределении контекстов и целевых задержках.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
В тестах SemiAnalysis Nvidia оказалась примерно до 5 раз эффективнее AMD по затратам на GLM 5.3 при целевой скорости 150 выходных токенов в секунду на пользователя и более чем в 20 раз производительнее на Qwen 3.5 при...
В тестах SemiAnalysis Nvidia оказалась примерно до 5 раз эффективнее AMD по затратам на GLM 5.3 при целевой скорости 150 выходных токенов в секунду на пользователя и более чем в 20 раз производительнее на Qwen 3.5 при... Преимущество определялось не только характеристиками ускорителей: важную роль сыграли объём памяти, повторное использование префиксного KV кэша, работа с выгрузкой в оперативную память и серверные оптимизации, включая...
AMD MI355X в связке с движком ATOM показала конкурентные результаты и отдельные победы, однако для большинства заказчиков более показательны результаты на распространённых upstream версиях vLLM и SGLang.