SemiAnalysis의 AgentX 테스트에서 엔비디아는 GLM 5.3 기준 사용자당 초당 150개 출력 토큰 조건에서 AMD보다 최대 5배 높은 비용 효율을 보였고, Qwen 3.5에서는 사용자당 초당 90개 출력 토큰 조건에서 20배를 넘는 성능 우위를 기록했다. 이번 격차는 하드웨어 사양만의 결과가 아니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did SemiAnalysis’s open-source AgentX 1.0 benchmark, released on August 24 as part of InferenceX v3 and based on 393 anonymized Claude. Article summary: AgentX’s main finding was not that Nvidia always wins, but that on the tested, realistic long-context coding-agent traces, Nvidia’s hardware-plus-serving stack held a large advantage in the broadly deployable SGLang conf. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
SemiAnalysis의 AgentX 1.0은 장문·다중 대화형 코딩 에이전트 추론에서 엔비디아의 하드웨어와 CUDA 중심 서빙 생태계가 여전히 상당한 우위를 유지하고 있음을 시사했다. 시험된 SGLang 구성에서는 GLM 5.3에서 엔비디아의 비용 효율이 최대 5배, Qwen 3.5에서는 사용자당 초당 90개 출력 토큰이라는 목표 조건에서 성능이 20배 이상 높게 나타났다. 26
다만 이를 ‘엔비디아가 모든 조건에서 AMD를 이긴다’는 뜻으로 해석해서는 안 된다. AgentX는 특정 모델, 가속기, 런타임, 워크로드, 동시성, 응답성 목표를 결합해 측정하는 벤치마크다. AMD의 MI355X와 ATOM 서빙 엔진은 일부 구성에서 경쟁력 있는 결과를 냈고, 소프트웨어 업데이트에 따라 시스템 간 순위가 바뀌기도 했다. 14
AgentX 1.0은 SemiAnalysis의 InferenceX v3 벤치마크 제품군에 포함된다. 고정된 입력·출력 길이를 사용하는 일반적인 추론 테스트와 달리, AgentX는 최대 약 100만 토큰에 이르는 긴 컨텍스트의 다중 대화형 코딩 에이전트 트래픽을 재생한다. 13
v1.0 데이터셋은 사용자가 참여를 허용한 익명화 Claude Code 세션 393개로 구성됐다. 대상 세션은 최소 20개의 요청을 포함해야 했으며, 중복 요청과 일부 클라이언트 전용 호출, 99만 토큰을 넘는 재구성 입력 등은 처리 과정에서 제외됐다. 요청당 입력 토큰 수 중앙값은 14만 2,000개, 출력 토큰 수 중앙값은 444개였고, 세션의 44%에는 하위 에이전트가 포함됐다. 8
이런 트래픽은 일반적인 단일 프롬프트 테스트와 다르다. 코딩 에이전트는 대화 내용이나 코드베이스가 조금씩 바뀔 때마다 이전 맥락을 반복해서 전송한다. 따라서 한 번의 긴 입력을 처리하는 순간 최고 처리량보다, 대규모 캐시 상태를 유지하면서 여러 세션에 짧고 빠르게 응답하는 능력이 중요해진다.
폭넓게 사용되는 SGLang 서빙 구성에서 가장 뚜렷한 엔비디아의 우위가 나타났다.
이 수치는 제품군 전체를 하나의 숫자로 평가한 결과가 아니라, 특정 운영 지점에서의 비교다. InferenceX는 플랫폼별로 관측된 서빙 환경을 기준으로 비용을 산정하고, 사용자가 체감하는 상호작용성과 처리량 목표에 맞춰 플랫폼을 비교한다. 79
결국 8K 입력·1K 출력처럼 길이가 고정된 테스트만으로는 실제 에이전트 트래픽의 병목을 놓칠 수 있다. 개별 요청의 처리량은 비슷해 보여도, 여러 대규모 컨텍스트를 동시에 유지하고 응답해야 하는 상황에서는 결과가 크게 달라질 수 있다는 의미다.
AgentX의 요청은 앞선 요청과 컨텍스트 상당 부분을 공유한다. SemiAnalysis는 이러한 에이전트 트레이스에서 프리픽스 또는 KV 캐시 적중률이 종종 95%를 넘었다고 설명한다. 1
이는 매번 완전히 새로운 프롬프트를 처음부터 처리하는 작업과 다르다. 시스템은 이미 계산한 대규모 상태를 저장·검색·전송·재사용하면서 짧은 답변을 이어서 생성해야 한다. 따라서 캐시를 얼마나 효율적으로 관리하느냐가 처리량과 비용을 좌우한다.
가속기에 장착된 고대역폭 메모리의 실제 사용 가능 용량은 KV 캐시 상태를 얼마나 상주시키는지를 결정한다. 작업 집합이 장치 메모리를 초과하면 서빙 시스템은 호스트 메모리로 데이터를 옮기거나 더 느린 경로에서 캐시 상태를 관리해야 할 수 있다. 1
호스트 메모리 오프로딩은 지원 가능한 세션 수를 늘릴 수 있지만, 대역폭과 지연시간 비용을 동반한다. 활성 캐시를 더 많이 가속기에 유지하거나 데이터 이동을 더 효율적으로 처리하는 플랫폼은 같은 비용에서 더 높은 상호작용성을 유지할 수 있다.
SemiAnalysis는 TensorRT-LLM의 ‘경계 인식형 증분 토큰화’도 주요 요인으로 꼽았다. 계속 변하는 프롬프트 전체를 매번 다시 토큰화하는 대신, 안정적인 경계를 찾아 새로 추가된 부분만 처리하는 방식이다. 1
코딩 에이전트는 입력 컨텍스트는 매우 길지만 응답은 수백 토큰에 그치는 경우가 많다. 이런 환경에서는 CPU 전처리와 반복적인 토큰화가 전체 서빙 오버헤드에서 무시하기 어려운 비중을 차지할 수 있다.
더 넓은 교훈은 추론의 가격 대비 성능이 하드웨어 × 런타임 × 모델 × 워크로드 × 지연시간 목표의 결과라는 점이다. 연산 성능이나 메모리 대역폭, 단일 처리량 수치만으로는 전체 성능을 설명하기 어렵다.
AgentX가 엔비디아의 전면적인 승리를 보여준 것은 아니다. SemiAnalysis는 특히 AMD MI355X와 ATOM 서빙 엔진 조합에서 특정 모델·처리량·엔진 조건의 AMD 승리 또는 근접한 결과를 확인했다고 보고했다. 1
텔레메트리에는 MI355X의 ATOM, SGLang, vLLM 등 구성이 별도로 기록돼 있다. 이는 매우 중요한 구분이다. ‘AMD 성능’이라는 하나의 수치가 있는 것이 아니라, 어떤 서빙 엔진과 모델 구현, 튜닝을 사용했는지에 따라 결과가 달라지기 때문이다. 4
ATOM은 특화된 스케줄링과 캐시 처리, AMD에 맞춘 커널을 활용한다. 모델과 워크로드가 MI355X의 메모리 구성에 잘 맞을 경우 높은 성능을 낼 수 있다. 즉 AMD는 플랫폼에 맞게 최적화된 런타임을 기꺼이 채택하고 운영할 수 있는 환경에서는 충분히 경쟁력을 발휘할 수 있다.
특화 엔진은 특정 하드웨어가 최적의 조건에서 낼 수 있는 잠재력을 보여준다. 하지만 실제 인프라 구매자는 최고 성능의 커널 하나만 보지 않는다. 모델 지원 범위, 업데이트 주기, 도구, 배포 경험, 장기 운영 가능성도 함께 고려해야 한다.
SemiAnalysis는 고객이 실제로 배포할 가능성이 높은 구성을 측정하기 위해, 벤치마크 전용 스택에만 의존하지 않고 주로 업스트림 vLLM과 SGLang의 지침을 따랐다고 밝혔다. 1
따라서 AMD 도입을 검토하는 대부분의 구매자에게 더 현실적인 비교 대상은 특정 환경에 맞춘 ATOM의 최고 기록이 아니라 업스트림 vLLM과 SGLang에서의 성능이다. ATOM이 무효하거나 특화 런타임이 가치 없다는 뜻은 아니다. 다만 실제 도입 가능성과 소프트웨어 생태계의 범위를 함께 따져야 한다는 의미다.
추론 벤치마크가 빠르게 낡는다는 점도 AgentX에서 확인됐다. 텔레메트리에는 8월 21일 측정된 AMD MI355X MoRI/SGLang 구성이 다른 날짜의 AMD 구성과 함께 기록돼 있다. 4
8월 21일의 소프트웨어 업데이트는 적어도 한 비교에서 성능 순서를 바꿨다. 스케줄링, 커널, 캐시 이동, 모델 지원이 개선되면 며칠 만에도 하드웨어의 겉보기 순위가 달라질 수 있다는 뜻이다. 14
SemiAnalysis가 앞서 공개한 MI355X의 Qwen 3.5 분석도 같은 경고를 준다. 13주 동안 이어진 SGLang 업데이트만으로 상당한 성능 향상이 나타났다. 12
따라서 가속기를 비교할 때는 정확한 런타임 버전, 구성, 모델 양자화 방식, 동시성 범위, 목표 상호작용성을 함께 기록해야 한다. 이 정보가 빠진 하드웨어 순위는 소프트웨어가 개선되는 순간 오해를 낳을 가능성이 크다.
AgentX는 장문 코딩 에이전트를 평가하는 유용한 대리 지표지만, 모든 상용 워크로드를 대표하는 전수조사는 아니다. 데이터셋은 내부 옵트인 트레이스에서 추출한 393개 세션으로 구성됐다. 8
다음과 같은 워크로드에서는 결과가 달라질 수 있다.
또한 초기 비교 결과에는 Google TPU가 포함되지 않았다. 따라서 AgentX 1.0만으로 엔비디아·AMD·구글 간 3자 경쟁 구도를 확정할 수 없다. 1
비교 대상 자체도 계속 바뀔 예정이다. SemiAnalysis는 엔비디아 Rubin, AMD MI455X UALoE72, 차세대 TPU 시스템을 향후 추가될 대상으로 언급했다. 이들이 포함되면 경쟁 구도는 달라질 수 있다. 111
SemiAnalysis는 AgentX 데이터셋과 하네스, 구성 파일, 텔레메트리 및 관련 자료를 Apache 2.0 라이선스로 공개했다. 1
AgentX의 장기적인 의미는 한 번의 ‘엔비디아 대 AMD’ 결과보다, 실제 에이전트의 동작을 최적화하도록 업계의 개발 방향을 바꾼 데 있을 수 있다. SemiAnalysis는 AgentX가 이미 vLLM, SGLang, TensorRT-LLM, ATOM, AITER, Dynamo, LMCache, Mooncake 등 프로젝트의 70개가 넘는 업스트림 풀 리퀘스트에서 목표 워크로드로 활용됐다고 밝혔다. 1
개발자들은 이를 통해 높은 프리픽스 재사용률, 대규모 KV 캐시, 짧은 다중 대화, 하위 에이전트, 캐시 전송, 스케줄링 압박, 토큰화 오버헤드 같은 실제 문제를 재현하며 서빙 프레임워크를 개선할 수 있다.
AgentX는 장문 코딩 에이전트 추론에서 엔비디아의 소프트웨어와 서빙 생태계가 여전히 큰 경쟁 우위라는 분석에 힘을 실었다. 시험된 SGLang 비교에서 엔비디아는 GLM 5.3 비용 효율에서 최대 5배, Qwen 3.5 성능에서 20배 이상 앞섰다. 26
그러나 이 결과가 엔비디아의 보편적 승리를 증명하는 것은 아니다. AMD의 MI355X와 ATOM은 특정 목적에 맞춘 구성에서 경쟁력 있거나 더 나은 가격 대비 성능을 보였고, 서빙 소프트웨어의 빠른 개선은 순위를 뒤집을 수 있다.
인프라팀이 얻어야 할 결론은 단일 헤드라인 수치만 보고 승자를 고르는 것이 아니다. 실제로 사용할 모델, 런타임, 컨텍스트 분포, 동시성, 목표 지연시간을 기준으로 직접 재현해 비교해야 한다는 점이다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
SemiAnalysis의 AgentX 테스트에서 엔비디아는 GLM 5.3 기준 사용자당 초당 150개 출력 토큰 조건에서 AMD보다 최대 5배 높은 비용 효율을 보였고, Qwen 3.5에서는 사용자당 초당 90개 출력 토큰 조건에서 20배를 넘는 성능 우위를 기록했다.
SemiAnalysis의 AgentX 테스트에서 엔비디아는 GLM 5.3 기준 사용자당 초당 150개 출력 토큰 조건에서 AMD보다 최대 5배 높은 비용 효율을 보였고, Qwen 3.5에서는 사용자당 초당 90개 출력 토큰 조건에서 20배를 넘는 성능 우위를 기록했다. 이번 격차는 하드웨어 사양만의 결과가 아니다. 메모리 용량, 높은 프리픽스 캐시 재사용률, 호스트 메모리 오프로딩, TensorRT LLM 같은 서빙 소프트웨어가 함께 영향을 미쳤다.
AMD의 MI355X와 ATOM 엔진은 일부 조합에서 승리하거나 대등한 결과를 냈다. 다만 대부분의 구매자에게는 특화 런타임인 ATOM보다 업스트림 vLLM·SGLang에서의 성능이 더 현실적인 비교 기준이다.