Featherless lance un cloud privé dédié pour GLM 5.2 à 7 500 $/mois, tokens illimités, sur 4× GPU AMD Instinct MI325X, avec des économies revendiquées de 94 % par rapport aux API propriétaires pour les usages agentique... Le modèle MoE de 744B paramètres surpasse GPT 5.5 sur SWE bench Pro (62,1 % contre 58,6 %) tout...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Featherless's new fixed-fee private cloud service for GLM 5.2, including its pricing, har. Article summary: Featherless's new service offers a **$7,500/month flat-fee private cloud** for GLM 5.2 on 4× AMD MI325X GPUs, claiming **94% cost savings** over proprietary APIs for high-volume agentic usage. The 744B MoE model beats GP. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Featherless a lancé un déploiement cloud privé dédié du modèle open-weights GLM 5.2 de Z.ai, facturé 7 500 $ par mois, sans frais par token. Le service est optimisé pour fonctionner nativement sur des GPU AMD Instinct MI325X, et l'entreprise affirme réduire les coûts d'inférence de 94 % par rapport à des concurrents propriétaires comme GPT-5.5 et Claude Opus 4.8 IF. Voici tout ce qu'il faut savoir sur ce service, le modèle et son positionnement face aux alternatives propriétaires.
Featherless a lancé un déploiement cloud privé dédié du modèle open-weights GLM 5.2 de Z.ai, optimisé pour fonctionner nativement sur des GPU AMD Instinct MI325X moyennant des frais mensuels fixes IF. Featherless affirme être la seule plateforme à avoir optimisé GLM 5.2 pour fonctionner nativement sur du matériel AMD dans un environnement cloud privé I. Cette approche permet aux clients d'éviter la facturation au token et de payer plutôt un coût annuel fixe de 90 000 $ US pour une équipe de développement pleinement utilisée I.
Comment le calcul fonctionne : GLM 5.2 sur l'API publique coûte environ 1/5 à 1/6 du prix par token de GPT-5.5 ou Claude Opus 4.8 GD. Sur la seule sortie, GLM-5.2 à 4,40 $ par million de tokens contre 30 $ pour GPT-5.5 représente environ 1/6,8 du coût OF. L'entrée en cache tombe à 0,26 $ par million de tokens GF.
Chaque instance cloud privée fonctionne sur 4 × GPU AMD Instinct MI325X FO. Le MI325X se caractérise par :
Il s'agit d'une stratégie matérielle notablement différente des déploiements NVIDIA H100/H200 courants dans l'industrie, et Featherless la présente comme un moyen d'éviter les contraintes d'approvisionnement NVIDIA I.
| Spécification | Détails |
|---|---|
| Architecture | 744B paramètres au total, Mixture-of-Experts (MoE) avec ~40B actifs par token GS |
| Fenêtre de contexte | Jusqu'à 256K tokens sur le cloud public ; jusqu'à 1 million de tokens sur le cloud privé FI |
| Quantification | FP8 par défaut (~750 Go de VRAM pour les poids) FOR |
| Poids ouverts | Oui — Z.ai a publié GLM 5.2 sous licence MIT IDA |
| Focus d'entraînement | Priorité au codage ; spécialisé pour les tâches de génie logiciel GDS |
En quantification FP8, les poids du modèle nécessitent environ 750 Go de VRAM, ce qui est confortablement accueilli par le total de 1 To de VRAM réparti sur 4× MI325X (4 × 256 Go), avec de la marge pour le cache KV sur des contextes étendus OR.
SWE-bench Pro (génie logiciel réel) :
Terminal-Bench 2.1 (tâches de codage agentique) :
GLM 5.2 se classe #2 sur le classement Arena WebDev de codage selon Featherless F.
L'avantage en termes de coût est là où GLM 5.2 se démarque vraiment. Aux tarifs officiels de l'API de Z.ai :
| Modèle | Entrée (par million de tokens) | Sortie (par million de tokens) |
|---|---|---|
| GLM 5.2 | 1,40 $ | 4,40 $ |
| GPT-5.5 | ~5,00 $ | ~30,00 $ |
| Claude Opus 4.8 | ~8,00 $ | ~40,00 $ |
Sur un mix réaliste de 3:1 sortie/entrée, GLM-5.2 atterrit autour de 3,65 $ par million de tokens contre environ 23,75 $ pour GPT-5.5 — un rapport d'environ 1/6,5 O. Des observateurs indépendants listent une médiane plus basse chez les fournisseurs servant les poids ouverts (plus proche de ~0,55 $ en entrée et ~1,85 $ en sortie) DD.
Le cloud privé Featherless pour GLM 5.2 est surtout intéressant pour :
Featherless propose également des forfaits à tarif fixe de niveau inférieur à partir de 25 $/mois pour un accès serverless à des modèles plus petits, mais le nœud dédié à 7 500 $/mois est explicitement destiné aux équipes ayant besoin d'une inférence soutenue à volume élevé sur le modèle complet GLM 5.2 F.
Le nouveau service de Featherless propose un cloud privé à 7 500 $/mois pour GLM 5.2 sur 4× GPU AMD MI325X, revendiquant 94 % d'économies par rapport aux API propriétaires pour une utilisation agentique intensive. Le modèle MoE de 744B paramètres bat GPT-5.5 sur SWE-bench Pro pour environ un sixième du coût par token, ce qui en fait une alternative open-weights convaincante pour les organisations ayant de lourdes charges de travail de codage et d'inférence agentique. Bien que Claude Opus 4.8 soit toujours en tête sur certains benchmarks, l'avantage en termes de coût de la combinaison GLM 5.2 + Featherless est suffisamment important pour en faire une option sérieuse pour les équipes soucieuses de leur budget qui ne veulent pas faire de compromis sur les performances.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Featherless lance un cloud privé dédié pour GLM 5.2 à 7 500 $/mois, tokens illimités, sur 4× GPU AMD Instinct MI325X, avec des économies revendiquées de 94 % par rapport aux API propriétaires pour les usages agentique...
Featherless lance un cloud privé dédié pour GLM 5.2 à 7 500 $/mois, tokens illimités, sur 4× GPU AMD Instinct MI325X, avec des économies revendiquées de 94 % par rapport aux API propriétaires pour les usages agentique... Le modèle MoE de 744B paramètres surpasse GPT 5.5 sur SWE bench Pro (62,1 % contre 58,6 %) tout en coûtant environ six fois moins cher par token que GPT 5.5 et Claude Opus 4.8.
GLM 5.2 supporte jusqu'à 1 million de tokens de contexte en cloud privé et fonctionne en quantification FP8, ce qui en fait une alternative open weights crédible pour le codage et l'inférence agentique.