AMD, Supermicro, Spectro Cloud가 공동 개발한 이 플랫폼은 2026년 8월 5일 라스베이거스에서 열린 Ai4 2026 컨퍼런스에서 발표되었습니다.
AMD Instinct Coder의 핵심 차별점은 정책 기반 지능형 모델 라우팅입니다. 코드 생성, 요약, 리팩토링과 같은 일상적인 코딩 요청은 AMD 최적화 GLM-5.2 전문가 혼합(Mixture-of-Experts) 모델(총 파라미터 744B, 토큰당 약 40B 활성화)이 로컬에서 처리합니다. 반면, 복잡한 추론이 필요한 쿼리는 로컬 모델이 처리하기 어려울 경우 OpenAI GPT, Anthropic Claude, Google Gemini와 같은 최첨단 모델로 전달됩니다. 이러한 계층형 추론 설계가 주장된 비용 절감의 핵심 메커니즘입니다.
레퍼런스 시스템은 사전 검증된 랙 통합 어플라이언스로, 단일 SKU로 출하됩니다.
| 구성 요소 | 사양 |
|---|---|
| CPU | AMD EPYC 9575F 2개 (각 64코어, 3.3 GHz) |
| GPU | AMD Instinct MI325X 가속기 8개 (각 256 GB HBM3E 메모리, 6 TB/s 피크 대역폭), 공랭 또는 액랭 가능 |
| 네트워킹 | AMD Pensando Pollara 400 Gb/s SmartNIC 2개 |
| 섀시 | Supermicro AS-8126GS-TNMR, 완전 검증 및 랙 통합 |
이 시스템은 "플러그를 꽂고, 말 그대로 전원만 켜면 작동하는" 어플라이언스로 설계되었으며, 출시 분기 내에 단일 SKU로 주문 가능합니다.
Spectro Cloud의 PaletteAI Inference Launchpad는 이 하드웨어를 실질적으로 유용하게 만드는 소프트웨어 레이어입니다. 제공 기능은 다음과 같습니다.
AMD와 Spectro Cloud는 모든 요청을 클라우드 기반 최첨단 모델 API에 보내는 방식과 비교해 AI 코딩 토큰 비용을 최대 70%까지 줄일 수 있다고 주장합니다. AMD 자체 자료는 자본 투자 회수 기간이 6개월에 불과하다고 밝히고 있습니다. 그러나 이러한 주장은 아직 외부에서 독립적으로 검증되지 않았으며, 실제 절감액은 조직의 워크로드 구성, 사용 패턴 및 클라우드 API 가격에 따라 달라질 수 있습니다.
AMD 댄 맥나마라(Dan McNamara) 수석 부사장 겸 컴퓨팅·엔터프라이즈 AI 총괄:
"조직은 코드가 어디서 처리되고, 어떤 모델이 사용되며, 그 비용이 얼마인지 통제할 수 있어야 합니다. AMD Instinct Coder는 고성능 AMD 컴퓨팅과 개방형 소프트웨어 에코시스템을 Supermicro 및 Spectro Cloud 기술과 결합하여, 고객이 더 많은 워크로드를 로컬에서 실행하고 최첨단 모델을 선택적으로 사용하며 인프라를 직접 운영할 수 있는 간단한 방법을 제공합니다."
Spectro Cloud 텐리 푸(Tenry Fu) 공동 창업자 겸 CEO:
"조직은 최첨단 모델의 역량과 로컬 추론의 경제성 및 통제 사이에서 선택해야 한다는 딜레마에 빠져서는 안 됩니다."
Supermicro 빅 말랄라(Vik Malyala) AI 및 엔터프라이즈 수석 부사장:
Supermicro의 역할은 사전 검증, 랙 통합 및 시스템 자격 검증을 통해 배포 복잡성을 줄이고, 하드웨어 인도부터 프로덕션 추론까지의 시간을 단축하는 것입니다.
이 플랫폼은 Ai4 2026(8월 4~6일, 라스베이거스)에서 처음 공개되었습니다. 이번 출시는 기업의 명확한 고통 지점에 대응합니다. 즉, 조직이 개발 팀과 자동화 워크플로 전반에 AI 코딩 에이전트를 확장함에 따라 토큰 비용이 빠르게 증가하고 있다는 점입니다. 초기 도입사인 BMC는 이미 자사 Helix Agentic Engineering 작업에 이 플랫폼을 배포했습니다.
AMD Instinct Coder는 독점 소스 코드를 타사 API에 보낼 수 없거나 보내지 않으려는 기업을 위해, 역량, 비용 및 통제력의 균형을 맞춘 규제된 온프레미스 AI 코딩 대안으로 포지셔닝되고 있습니다.