Featherless пропонує приватну хмару для GLM 5.2 за $7,500/міс з необмеженою кількістю токенів — це на 94% дешевше за пропрієтарні API для інтенсивних агентних сценаріїв. 744B MoE модель обходить GPT 5.5 у тесті SWE bench Pro (62.1% проти 58.6%) та коштує приблизно в шість разів менше за токен.
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Featherless's new fixed-fee private cloud service for GLM 5.2, including its pricing, har. Article summary: Featherless's new service offers a **$7,500/month flat-fee private cloud** for GLM 5.2 on 4× AMD MI325X GPUs, claiming **94% cost savings** over proprietary APIs for high-volume agentic usage. The 744B MoE model beats GP. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Компанія Featherless запустила виділену приватну хмару для моделі GLM 5.2 від Z.ai з відкритими вагами. Сервіс працює за фіксованою щомісячною платою $7,500 без жодної токенної оплати IF. Оптимізований для роботи на AMD Instinct MI325X GPU, сервіс, за твердженням компанії, скорочує витрати на інференс на 94% порівняно з закритими аналогами, такими як GPT-5.5 та Claude Opus 4.8 IF. Ось усе, що варто знати про цей сервіс, модель та її позиціонування щодо пропрієтарних рішень.
Featherless запустив виділене приватне хмарне розгортання моделі GLM 5.2 від Z.ai з відкритими вагами. Унікальність сервісу в тому, що він оптимізований для роботи нативно на AMD Instinct MI325X GPU IF. Featherless стверджує, що це єдина платформа, яка змогла оптимізувати GLM 5.2 для роботи на AMD-обладнанні у приватному хмарному середовищі I. Замість токенної оплати клієнти сплачують щорічну фіксовану суму $90,000, що відповідає повністю завантаженій команді розробників I.
Як це працює математично: На публічному API GLM 5.2 коштує приблизно 1/5 – 1/6 ціни за токен GPT-5.5 або Claude Opus 4.8 GD. Лише за вихідними токенами: $4.40 за мільйон у GLM-5.2 проти $30 у GPT-5.5 — це приблизно 1/6.8 вартості OF. Кешований вхідний токен коштує лише $0.26 за мільйон GF.
Кожен приватний хмарний інстанс працює на 4 × AMD Instinct MI325X GPU FO. Характеристики MI325X:
Це принципово інша апаратна стратегія порівняно з типовими NVIDIA H100/H200 розгортаннями. Featherless подає це як спосіб уникнути дефіциту NVIDIA-обладнання I.
| Специфікація | Деталі |
|---|---|
| Архітектура | 744B загальних параметрів, Mixture-of-Experts (MoE) з ~40B активних на токен GS |
| Контекстне вікно | До 256K токенів на публічній хмарі; до 1 млн токенів у приватній хмарі FI |
| Квантизація | FP8 за замовчуванням (~750 ГБ VRAM для ваг) FOR |
| Відкриті ваги | Так — Z.ai випустив GLM 5.2 з відкритими вагами під ліцензією MIT IDA |
| Фокус навчання | Насамперед код; модель спеціалізована на завданнях програмної інженерії GDS |
У квантизації FP8 ваги моделі займають близько 750 ГБ VRAM. Загальний обсяг пам'яті 4× MI325X GPU становить 1 ТБ (4 × 256 ГБ), що забезпечує достатньо місця для ваг і KV-кешу навіть при розширених контекстах OR.
SWE-bench Pro (реальні завдання програмної інженерії):
Terminal-Bench 2.1 (агентні завдання з кодом):
За даними Featherless, GLM 5.2 посідає #2 у рейтингу Arena WebDev coding leaderboard F.
Цінова перевага GLM 5.2 є вражаючою. Офіційні тарифи Z.ai:
| Модель | Вхідні (за 1M токенів) | Вихідні (за 1M токенів) |
|---|---|---|
| GLM 5.2 | $1.40 | $4.40 |
| GPT-5.5 | ~$5.00 | ~$30.00 |
| Claude Opus 4.8 | ~$8.00 | ~$40.00 |
При реалістичному робочому навантаженні зі співвідношенням 3:1 (вихідні до вхідних), GLM-5.2 коштує близько $3.65 за мільйон токенів проти ~$23.75 у GPT-5.5 — співвідношення приблизно 1/6.5 O.
Приватна хмара Featherless для GLM 5.2 найбільш вигідна для:
Featherless також пропонує дешевші фіксовані тарифи від $25/міс для серверлес-доступу до менших моделей, але інстанс за $7,500/міс призначений саме для команд з високими навантаженнями F.
Новий сервіс Featherless пропонує приватну хмару для GLM 5.2 на 4× AMD MI325X GPU за фіксованою платою $7,500/міс, забезпечуючи 94% економії порівняно з пропрієтарними API для високонавантажених агентних сценаріїв. 744B MoE-модель випереджає GPT-5.5 на SWE-bench Pro, коштуючи приблизно в шість разів менше за токен, що робить її переконливою відкритою альтернативою для організацій з інтенсивними завданнями кодування та агентного інференсу.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Featherless пропонує приватну хмару для GLM 5.2 за $7,500/міс з необмеженою кількістю токенів — це на 94% дешевше за пропрієтарні API для інтенсивних агентних сценаріїв.
Featherless пропонує приватну хмару для GLM 5.2 за $7,500/міс з необмеженою кількістю токенів — це на 94% дешевше за пропрієтарні API для інтенсивних агентних сценаріїв. 744B MoE модель обходить GPT 5.5 у тесті SWE bench Pro (62.1% проти 58.6%) та коштує приблизно в шість разів менше за токен.
У приватній хмарі модель підтримує контекст до 1 млн токенів, працює у квантизації FP8 та є відкритою (MIT ліцензія).