Featherless fasta månadsavgift för privat moln med GLM 5.2 är 7 500 dollar med obegränsat antal tokens och 4× AMD Instinct MI325X, vilket ger 94 % besparing jämfört med proprietära API:er för höga agentvolymer. Modellen med 744B MoE slår GPT 5.5 på SWE bench Pro (62,1 % mot 58,6 %) och kostar ungefär en sjättedel av...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Featherless's new fixed-fee private cloud service for GLM 5.2, including its pricing, har. Article summary: Featherless's new service offers a **$7,500/month flat-fee private cloud** for GLM 5.2 on 4× AMD MI325X GPUs, claiming **94% cost savings** over proprietary APIs for high-volume agentic usage. The 744B MoE model beats GP. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Featherless har lanserat en dedikerad privat molntjänst för Z.AI:s öppna modell GLM 5.2, optimerad för att köras på AMD Instinct MI325X GPU:er. Tjänsten har en fast månadsavgift på 7 500 dollar och ingen debitering per token. Enligt Featherless minskar detta kostnaderna för inferens med 94 % jämfört med slutna modeller som GPT-5.5 och Claude Opus 4.8 IF. Här är allt du behöver veta om tjänsten, modellen och hur den står sig mot proprietära alternativ.
Featherless erbjuder ett dedikerat privat moln för Z.ai:s GLM 5.2 – en modell med öppna vikter – optimerad för att köras inbyggt på AMD Instinct MI325X GPU:er för en fast månadsavgift IF. Featherless uppger att de är den enda plattformen som optimerat GLM 5.2 för AMD-hårdvara i en privat molnmiljö I. Det innebär att kunderna slipper tokenbaserad debitering och istället betalar en fast årlig kostnad på 90 000 dollar – vilket motsvarar ett fullt utnyttjat utvecklingsteam I.
Så fungerar matematiken: GLM 5.2 på det publika API:et kostar ungefär 1/5 till 1/6 av priset per token för GPT-5.5 eller Claude Opus 4.8 GD. För enbart genererade tokens är GLM-5.2:s 4,40 dollar mot GPT-5.5:s 30 dollar ungefär 1/6,8 av kostnaden OF. Cachelagrad inmatning sjunker till 0,26 dollar per miljon tokens GF.
Varje privat molninstans körs på 4 × AMD Instinct MI325X GPU:er FO. MI325X har:
Detta är en markant annorlunda hårdvarustrategi jämfört med de NVIDIA H100/H200-installationer som är vanliga i branschen. Featherless framhåller det som ett sätt att kringgå NVIDIA:s leveransbegränsningar I.
| Specifikation | Detaljer |
|---|---|
| Arkitektur | 744B totala parametrar, Mixture-of-Experts (MoE) med cirka 40B aktiva per token GS |
| Kontextfönster | Upp till 256K tokens i publikt moln; upp till 1 miljon tokens i privat moln FI |
| Kvantisering | FP8 som standard (cirka 750 GB VRAM för vikterna) FOR |
| Öppna vikter | Ja – Z.ai släppte GLM 5.2 med MIT-licens IDA |
| Träningsfokus | Kodningsfokuserad; specialiserad på mjukvaruutveckling GDS |
Med FP8-kvantisering kräver modellens vikter cirka 750 GB VRAM. Detta ryms bekvämt i den totala VRAM på 1 TB över 4× MI325X GPU:er (4 × 256 GB), med utrymme kvar för KV-cache vid långa kontextlängder OR.
SWE-bench Pro (verklig mjukvaruutveckling):
Terminal-Bench 2.1 (agentbaserade kodningsuppgifter):
GLM 5.2 rankas som #2 på Arena WebDev:s kodningsledarlista enligt Featherless F.
Kostnadsfördelen är där GLM 5.2 verkligen utmärker sig. Vid Z.AI:s officiella API-priser:
| Modell | Inmatning (per 1M tokens) | Generering (per 1M tokens) |
|---|---|---|
| GLM 5.2 | 1,40 $ | 4,40 $ |
| GPT-5.5 | cirka 5,00 $ | cirka 30,00 $ |
| Claude Opus 4.8 | cirka 8,00 $ | cirka 40,00 $ |
Vid en realistisk blandning av 3:1 generering-till-inmatning hamnar GLM-5.2 på cirka 3,65 dollar per miljon tokens, jämfört med GPT-5.5:s cirka 23,75 dollar – en kvot på ungefär 1/6,5 O. Oberoende spårare listar ett lägre medianvärde bland leverantörer som erbjuder öppna vikter (närmare cirka 0,55 dollar för inmatning och 1,85 dollar för generering) DD.
Featherless privata moln för GLM 5.2 är mest lockande för:
Featherless erbjuder också billigare planer med fast pris från 25 dollar i månaden för serverlös åtkomst till mindre modeller, men 7 500-dollar-noden är explicit för team som behöver kontinuerlig inferens med hög volym på hela GLM 5.2-modellen F.
Featherless nya tjänst erbjuder ett privat moln med fast avgift på 7 500 dollar i månaden för GLM 5.2 på 4× AMD MI325X GPU:er, med påstådda 94 % kostnadsbesparingar jämfört med proprietära API:er vid hög agentanvändning. Modellen med 744B MoE slår GPT-5.5 på SWE-bench Pro till ungefär en sjättedel av kostnaden per token, vilket gör den till ett attraktivt öppen-vikter-alternativ för organisationer med tunga kodnings- och agentinferensbehov. Även om Claude Opus 4.8 fortfarande leder på vissa riktmärken, är kostnadsfördelen med kombinationen GLM 5.2 + Featherless tillräckligt stor för att göra den till ett seriöst alternativ för kostnadsmedvetna team som inte vill kompromissa med prestanda.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Featherless fasta månadsavgift för privat moln med GLM 5.2 är 7 500 dollar med obegränsat antal tokens och 4× AMD Instinct MI325X, vilket ger 94 % besparing jämfört med proprietära API:er för höga agentvolymer.
Featherless fasta månadsavgift för privat moln med GLM 5.2 är 7 500 dollar med obegränsat antal tokens och 4× AMD Instinct MI325X, vilket ger 94 % besparing jämfört med proprietära API:er för höga agentvolymer. Modellen med 744B MoE slår GPT 5.5 på SWE bench Pro (62,1 % mot 58,6 %) och kostar ungefär en sjättedel av priset per token för GPT 5.5 och Claude Opus 4.8.
GLM 5.2 stöder upp till 1 miljon tokens kontextfönster i privat moln och körs i FP8 kvantisering, vilket gör den till ett konkurrenskraftigt alternativ med öppna vikter för kodning och agentbaserad inferens.