У тестах SemiAnalysis Nvidia була майже у 5 разів ефективнішою за витратами на GLM 5.3 за швидкості 150 вихідних токенів на секунду на користувача та показала більш ніж у 20 разів вищу продуктивність на Qwen 3.5 за шв... Перевага пояснюється не лише характеристиками чипів, а поєднанням обсягу пам’яті, повторного вик...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Бенчмарк AgentX 1.0 від SemiAnalysis свідчить, що апаратна платформа Nvidia разом із CUDA-орієнтованою екосистемою серверного програмного забезпечення зберігає значну перевагу в реалістичних сценаріях роботи AI-агентів із довгим контекстом. У протестованих конфігураціях SGLang розрив сягав майже 5 разів за ефективністю витрат на GLM 5.3 і понад 20 разів за продуктивністю на Qwen 3.5 за цільової швидкості 90 вихідних токенів на секунду на користувача. 26
Однак це не універсальний рейтинг, у якому Nvidia завжди перемагає AMD. AgentX оцінює конкретне поєднання моделі, прискорювача, рушія інференсу, робочого навантаження, рівня паралельності та вимог до швидкості відповіді. AMD MI355X і рушій ATOM у низці конфігурацій показали конкурентні результати, а оновлення програмного забезпечення змінили порядок окремих систем. 14
AgentX 1.0 є частиною набору тестів SemiAnalysis InferenceX v3. На відміну від традиційних бенчмарків із фіксованою довжиною запиту та відповіді, він відтворює багатокроковий трафік агентів для програмування з дуже великими контекстами — у деяких сценаріях майже до 1 мільйона токенів. 13
Версія 1.0 базується на 393 добровільно наданих анонімізованих сесіях Claude Code. До набору потрапляли сесії щонайменше з 20 запитами. Дані очистили від дублікатів, окремих клієнтських викликів і реконструйованих вхідних даних обсягом понад 990 000 токенів. Медіанний запит містив 142 000 вхідних і 444 вихідні токени, а 44% сесій використовували субагентів. 8
Такий профіль навантаження важливий: агент-програміст знову й знову надсилає оновлені версії великої розмови або кодової бази. Тому тест вимірює не одноразову обробку довгого запиту, а стабільність інтерактивної роботи протягом багатьох послідовних ходів.
Найпомітніша перевага Nvidia проявилася в конфігураціях SGLang, близьких до доступних для широкого розгортання:
Ці цифри варто сприймати як порівняння в конкретних робочих точках, а не як єдиний бал для всієї лінійки продуктів. InferenceX зіставляє платформи за визначеного рівня інтерактивності та розраховує витрати на основі найкращого спостереженого середовища обслуговування для кожної платформи. 79
Практичний висновок полягає в тому, що типовий тест на кшталт «8 тисяч вхідних і 1 тисяча вихідних токенів» може не показати вузькі місця, критичні для агентів. Прискорювач може мати хороший результат у тесті ізольованої пропускної здатності, але відставати, коли одночасно потрібно підтримувати багато великих частково повторюваних контекстів.
У навантаженнях AgentX значна частина контексту переходить від одного запиту до наступного. За описом SemiAnalysis, частка влучань у префіксний або KV-кеш у таких агентських трасах часто перевищувала 95%. 1
Це змінює співвідношення між початковою обробкою запиту та генерацією відповіді. Система не щоразу обробляє повністю новий промпт, а зберігає та розширює великі кешовані стани, генеруючи порівняно короткі відповіді. Відтак ключовими стають зберігання, пошук, передавання та повторне використання цих станів.
Доступний обсяг високошвидкісної пам’яті визначає, яку частину стану KV-кешу можна залишити безпосередньо на прискорювачі. Якщо робочий набір перевищує місткість пам’яті пристрою, серверу доводиться переміщати дані до пам’яті хоста або керувати кешем через повільніший канал. 1
Вивантаження в пам’ять хоста дає змогу підтримувати більше сесій, але водночас створює додаткові витрати на пропускну здатність і затримку. Платформа, яка утримує більшу частину активного кешу на прискорювачі або ефективніше керує його переміщенням, може забезпечити вищу інтерактивність за тієї самої вартості.
SemiAnalysis окремо відзначила гранично-орієнтовану інкрементальну токенізацію в TensorRT-LLM. Замість повторної токенізації всього промпту система визначає стабільні межі та обробляє лише нові додані фрагменти. 1
Для AI-агентів програмування це особливо важливо: запит може містити сотні тисяч токенів, але відповідь — лише кілька сотень. У такому режимі попередня обробка на CPU і повторна токенізація можуть становити відчутну частину накладних витрат.
Ширший урок простий: співвідношення ціни та продуктивності інференсу визначається формулою апаратне забезпечення × рушій × модель × навантаження × цільова затримка. Самі лише FLOPS, пропускна здатність пам’яті або один показник швидкості не описують повної картини.
AgentX не показав безумовної перемоги Nvidia. SemiAnalysis зафіксувала помітні переваги AMD або близькі до паритету результати в окремих поєднаннях моделі, швидкості та рушія — особливо для MI355X у парі з рушієм ATOM від AMD. 1
У телеметрії результати MI355X розділено для ATOM, SGLang, vLLM та інших конфігурацій. Це принципово важливо: «результат AMD» значною мірою залежить від того, який рушій, реалізацію моделі та налаштування використано в тесті. 4
Спеціалізовані алгоритми планування ATOM, робота з кешем і ядра, оптимізовані під AMD, можуть показувати сильні результати, коли модель і навантаження добре відповідають конфігурації пам’яті MI355X. Отже, AMD здатна бути дуже конкурентною, якщо оператор готовий використовувати рушій, спеціально налаштований для цієї платформи.
Спеціалізований рушій може продемонструвати потенціал апаратного забезпечення у сприятливих умовах. Але тим, хто купує інфраструктуру, потрібен не лише найкращий результат окремого ядра. Важливі також підтримка моделей, регулярність випусків, інструменти, досвід розгортання та зрозумілий шлях довгострокової експлуатації.
SemiAnalysis зазначає, що її рецепти переважно спираються на рекомендації upstream-версій vLLM і SGLang, щоб вимірювати конфігурації, які клієнти можуть реалістично розгорнути, а не лише результати спеціально створеного для бенчмарку стека. 1
Тому для більшості потенційних покупців AMD релевантнішим є порівняння на upstream vLLM і SGLang, а не найкращий можливий результат у спеціалізованому ATOM. Йдеться про різницю в доступності програмного забезпечення та простоті впровадження, а не про те, що ATOM є некоректним або непотрібним.
Порівняння також демонструє, наскільки швидко старіють результати інференсних тестів. У телеметрії є конфігурація AMD MI355X MoRI/SGLang від 21 серпня, а інші конфігурації AMD вимірювалися в інші дати. 4
Оновлення програмного забезпечення 21 серпня змінило порядок щонайменше одного порівняння. Це показує, що вдосконалення планування, ядер, переміщення кешу чи підтримки моделей можуть змінити уявну ієрархію апаратних платформ буквально за кілька днів. 14
Попередні тести MI355X на Qwen 3.5 від SemiAnalysis дають подібний сигнал: послідовні версії SGLang забезпечили значний приріст продуктивності протягом 13 тижнів. 12
Для покупців це означає, що під час порівняння прискорювачів потрібно фіксувати точну версію рушія, конфігурацію, квантизацію моделі, діапазон паралельності та цільовий рівень інтерактивності. Висновок про перевагу певного чипа без цього контексту швидко може стати оманливим.
AgentX є цінним наближенням до навантажень довгоконтекстних агентів програмування, але не репрезентативною вибіркою всіх виробничих сценаріїв. Набір даних походить із внутрішнього добровільного корпусу трас і містить 393 відібрані сесії, а не весь трафік корпоративних AI-агентів. 8
Результати можуть відрізнятися для:
У першому наборі порівняльних результатів також не було Google TPU, тому AgentX 1.0 не дає підстав для повного висновку у форматі «Nvidia проти AMD проти Google». 1
Порівняння залишається рухомою мішенню. SemiAnalysis назвала Nvidia Rubin, AMD MI455X UALoE72 і нові покоління TPU майбутніми учасниками або напрямами розширення тестів. Їхня поява може змінити конкурентну картину. 111
SemiAnalysis опублікувала набір даних AgentX, тестовий рушій, конфігурації, телеметрію та пов’язані матеріали за ліцензією Apache 2.0. 1
Довгострокове значення бенчмарку може полягати не стільки в одному заголовку про Nvidia й AMD, скільки в тому, що він стимулює інженерні покращення. За даними SemiAnalysis, AgentX уже став цільовим навантаженням для понад 70 upstream pull request’ів у проєктах vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache і Mooncake. 1
Це дає розробникам серверних фреймворків відтворюваний спосіб оптимізувати системи під реальну поведінку агентів: високе повторне використання префіксів, великі KV-кеші, багато коротких ходів, субагентів, переміщення кешу, навантаження на планувальник і витрати на токенізацію.
AgentX посилює аргумент, що програмна екосистема Nvidia залишається важливою конкурентною перевагою в інференсі для AI-агентів із довгим контекстом. У протестованих порівняннях SGLang Nvidia показала перевагу до 5 разів за ефективністю витрат на GLM 5.3 і понад 20 разів за продуктивністю на Qwen 3.5 за визначених цілей інтерактивності. 26
Водночас тест не доводить, що Nvidia перемагає завжди. MI355X у парі з ATOM продемонструвала можливість досягати конкурентного або кращого співвідношення ціни та продуктивності в окремих спеціалізованих конфігураціях, а швидкі оновлення серверного ПЗ можуть змінювати рейтинг платформ.
Для команд, які будують інфраструктуру, найкращий висновок — не обирати переможця за одним гучним числом, а повторити тест на власній моделі, рушії, розподілі контексту та цільовій затримці.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
У тестах SemiAnalysis Nvidia була майже у 5 разів ефективнішою за витратами на GLM 5.3 за швидкості 150 вихідних токенів на секунду на користувача та показала більш ніж у 20 разів вищу продуктивність на Qwen 3.5 за шв...
У тестах SemiAnalysis Nvidia була майже у 5 разів ефективнішою за витратами на GLM 5.3 за швидкості 150 вихідних токенів на секунду на користувача та показала більш ніж у 20 разів вищу продуктивність на Qwen 3.5 за шв... Перевага пояснюється не лише характеристиками чипів, а поєднанням обсягу пам’яті, повторного використання префіксного кешу, поведінки під час вивантаження даних у пам’ять хоста та можливостей серверного ПЗ, зокрема Te...
AMD MI355X у парі з рушієм ATOM у деяких сценаріях досягла паритету або кращого співвідношення ціни й продуктивності, але для більшості покупців важливішими залишаються результати на стандартніших vLLM і SGLang.