Featherless biedt een dedicated private cloud voor GLM 5.2 voor een vast bedrag van $7.500/maand, met onbeperkt aantal tokens op 4× AMD Instinct MI325X GPU's en claimt 94% kostenbesparing ten opzichte van eigen API's... Het 744B MoE model verslaat GPT 5.5 op SWE bench Pro (62,1% vs.
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Featherless's new fixed-fee private cloud service for GLM 5.2, including its pricing, har. Article summary: Featherless's new service offers a **$7,500/month flat-fee private cloud** for GLM 5.2 on 4× AMD MI325X GPUs, claiming **94% cost savings** over proprietary APIs for high-volume agentic usage. The 744B MoE model beats GP. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Featherless heeft een dedicated private cloud lancering aangekondigd van Z.ai's open-gewichtenmodel GLM 5.2 voor een vast maandbedrag van $7.500, zonder kosten per token. De dienst is geoptimaliseerd om native te draaien op AMD Instinct MI325X GPU's en het bedrijf claimt dat het de inferentiekosten met 94% verlaagt in vergelijking met closed-source concurrenten zoals GPT-5.5 en Claude Opus 4.8 IF. Dit artikel behandelt alles wat je moet weten over de dienst, het model en hoe het zich verhoudt tot propriëtaire alternatieven.
Featherless lanceerde een dedicated private cloud implementatie van Z.ai's open-gewichtenmodel GLM 5.2, geoptimaliseerd om native te draaien op AMD Instinct MI325X GPU's tegen een vast maandbedrag IF. Featherless beweert het enige platform te zijn dat GLM 5.2 heeft geoptimaliseerd om native op AMD-hardware in een private cloud-omgeving te draaien I. Deze aanpak stelt klanten in staat om token-gebaseerde facturatie te vermijden en in plaats daarvan een vaste jaarlijkse kost van USD $90.000 te betalen voor een volledig benut ontwikkelingsteam I.
Hoe de rekensom werkt: GLM 5.2 op de publieke API kost ongeveer 1/5 tot 1/6 van de prijs per token van GPT-5.5 of Claude Opus 4.8 GD. Op pure output is GLM-5.2 met $4,40 per miljoen tokens tegenover GPT-5.5's $30 ongeveer 1/6,8 van de kosten OF. Cached input daalt verder naar $0,26 per miljoen tokens GF.
Elke private cloud instance draait op 4 × AMD Instinct MI325X GPU's FO. De MI325X beschikt over:
Dit is een opvallend andere hardwarestrategie dan de NVIDIA H100/H200-implementaties die gebruikelijk zijn in de industrie. Featherless presenteert het als een manier om NVIDIA-leveringsbeperkingen te omzeilen I.
| Specificatie | Details |
|---|---|
| Architectuur | 744B totale parameters, Mixture-of-Experts (MoE) met ~40B actief per token GS |
| Contextvenster | Tot 256K tokens op publieke cloud; tot 1 miljoen tokens op private cloud implementaties FI |
| Kwantificatie | FP8 standaard (~750 GB VRAM voor gewichten) FOR |
| Open gewichten | Ja — Z.ai heeft GLM 5.2 als open-gewichten uitgebracht onder MIT-licentie IDA |
| Training focus | Codeer-eerst; gespecialiseerd voor software-engineering taken GDS |
Bij FP8-kwantificatie nemen de gewichten van het model ongeveer 750 GB VRAM in beslag, wat comfortabel past in de 1 TB totale VRAM over 4× MI325X GPU's (4 × 256 GB), met ruimte voor KV-cache bij uitgebreide contextlengtes OR.
SWE-bench Pro (real-world software engineering):
Terminal-Bench 2.1 (agentische codeertaken):
Volgens Featherless staat GLM 5.2 op #2 van de Arena WebDev-codeerleaderboard F.
Het kostenvoordeel is waar GLM 5.2 echt opvalt. Bij de officiële API-tarieven van Z.ai:
| Model | Invoer (per 1M tokens) | Uitvoer (per 1M tokens) |
|---|---|---|
| GLM 5.2 | $1,40 | $4,40 |
| GPT-5.5 | ~$5,00 | ~$30,00 |
| Claude Opus 4.8 | ~$8,00 | ~$40,00 |
Bij een realistische 3:1 verhouding van uitvoer- tot invoerworkload komt GLM-5.2 uit op ongeveer $3,65 per miljoen tokens tegenover GPT-5.5's ongeveer $23,75 — een verhouding van ongeveer 1/6,5 O. Onafhankelijke trackers vermelden een lagere mediaan bij aanbieders die de open gewichten serveren (dichter bij ~$0,55 invoer en ~$1,85 uitvoer) DD.
De Featherless private cloud voor GLM 5.2 is het meest aantrekkelijk voor:
Featherless biedt ook goedkopere vaste-prijsplannen vanaf $25/maand voor serverloze toegang tot kleinere modellen, maar de dedicated node van $7.500/maand is expliciet bedoeld voor teams die aanhoudende, hoogwaardige inferentie op het volledige GLM 5.2-model nodig hebben F.
De nieuwe dienst van Featherless biedt een private cloud met een vast tarief van $7.500/maand voor GLM 5.2 op 4× AMD MI325X GPU's, met een geclaimde 94% kostenbesparing ten opzichte van propriëtaire API's voor hoogwaardig agentisch gebruik. Het 744B MoE-model verslaat GPT-5.5 op SWE-bench Pro tegen ongeveer een zesde van de kosten per token, wat het een aantrekkelijk open-gewichten alternatief maakt voor organisaties met zware codeer- en agentische inferentie workloads. Hoewel Claude Opus 4.8 nog steeds voorloopt op sommige benchmarks, is het kostenvoordeel van de GLM 5.2 + Featherless-combinatie groot genoeg om het een serieuze optie te maken voor budgetbewuste teams die geen concessies willen doen aan prestaties.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Featherless biedt een dedicated private cloud voor GLM 5.2 voor een vast bedrag van $7.500/maand, met onbeperkt aantal tokens op 4× AMD Instinct MI325X GPU's en claimt 94% kostenbesparing ten opzichte van eigen API's...
Featherless biedt een dedicated private cloud voor GLM 5.2 voor een vast bedrag van $7.500/maand, met onbeperkt aantal tokens op 4× AMD Instinct MI325X GPU's en claimt 94% kostenbesparing ten opzichte van eigen API's... Het 744B MoE model verslaat GPT 5.5 op SWE bench Pro (62,1% vs. 58,6%) en kost ongeveer een zesde per token van GPT 5.5 en Claude Opus 4.8.
GLM 5.2 ondersteunt tot 1 miljoen tokens contextvenster in de private cloud en draait in FP8 kwantificatie, wat het een concurrerend open gewichten alternatief maakt voor codeer en agentische inferentie.