Développée conjointement par AMD, Supermicro et Spectro Cloud, la solution a été annoncée le 5 août 2026 lors de la conférence Ai4 2026 à Las Vegas . Voici comment elle fonctionne, combien elle coûte et à qui elle s'adresse.
AMD Instinct Coder repose sur un routage intelligent des modèles, piloté par des règles (policy-based intelligent model routing) . Les requêtes de codage courantes — génération de code, résumé, refactorisation — sont traitées localement par un modèle GLM-5.2 mixture-of-experts optimisé par AMD (744 milliards de paramètres au total, environ 40 milliards activés par token) . Les requêtes de raisonnement complexes peuvent être redirigées vers des modèles de pointe comme OpenAI GPT, Anthropic Claude ou Google Gemini lorsque le modèle local ne peut pas les traiter . Cette architecture d'inférence à plusieurs niveaux est le mécanisme qui sous-tend les économies annoncées .
Le système de référence est un appliance pré-validé et intégré en baie, livré sous une seule référence :
| Composant | Spécification |
|---|---|
| CPU | 2x AMD EPYC 9575F (64 cœurs chacun, 3,3 GHz) |
| GPU | 8x AMD Instinct MI325X (256 Go HBM3E chacun, bande passante de pointe 6 To/s), disponibles en version refroidie par air ou par liquide |
| Réseau | 2x AMD Pensando Pollara 400 Gb/s SmartNICs |
| Châssis | Supermicro AS-8126GS-TNMR, entièrement validé et intégré en baie |
Le système est conçu comme un appliance « prêt à brancher, littéralement à allumer, et ça marche », disponible sous une seule référence d'ici la fin du trimestre de son lancement .
PaletteAI Inference Launchpad de Spectro Cloud est la couche logicielle qui rend le matériel utile. Il fournit :
AMD et Spectro Cloud affirment que la plateforme peut réduire les coûts de tokens de codage IA jusqu'à 70 % par rapport à l'envoi de toutes les requêtes aux API cloud des modèles de pointe . Les documents d'AMD mentionnent une période de retour sur investissement aussi courte que six mois . Ces allégations n'ont pas été vérifiées de manière indépendante, et les économies réelles dépendront de la charge de travail, des habitudes d'utilisation et de la tarification des API cloud .
Dan McNamara (SVP & GM, Compute & Enterprise AI, AMD) :
« Les entreprises ont besoin de contrôler où le code est traité, quels modèles sont utilisés et ce que cette utilisation coûte. AMD Instinct Coder combine la puissance de calcul haute performance d'AMD et un écosystème logiciel ouvert avec les technologies de Supermicro et Spectro Cloud, offrant aux clients un moyen simple d'exécuter davantage de charges localement, d'utiliser les modèles de pointe de manière sélective et d'exploiter eux-mêmes l'infrastructure. »
Tenry Fu (Co-fondateur et CEO, Spectro Cloud) :
« Les entreprises ne devraient pas avoir à choisir entre les capacités des modèles de pointe et l'économie et le contrôle de l'inférence locale. »
Vik Malyala (SVP, AI and Enterprise, Supermicro) :
Le rôle de Supermicro comprend la pré-validation, l'intégration en baie et la qualification du système pour réduire la complexité du déploiement et raccourcir le chemin entre le matériel livré et l'inférence en production .
La plateforme a été dévoilée lors de l'Ai4 2026 (4-6 août à Las Vegas) . Ce lancement répond à une problématique claire des entreprises : alors qu'elles déploient des agents de codage IA à grande échelle, les coûts de tokens grimpent rapidement. Un premier adoptant, BMC, a déjà déployé la plateforme pour ses travaux Helix Agentic Engineering .
AMD Instinct Coder se positionne comme une alternative sur site et gouvernée aux assistants de codage purement cloud, offrant un équilibre entre capacité, coût et contrôle pour les entreprises qui ne peuvent pas ou ne veulent pas envoyer leur code source propriétaire à des API tierces.