Cómo funcionan las matemáticas: GLM 5.2 en la API pública cuesta aproximadamente 1/5 a 1/6 del precio por token de GPT-5.5 o Claude Opus 4.8 GD. Solo en salida, GLM-5.2 a $4.40 por millón de tokens frente a los $30 de GPT-5.5 es aproximadamente 1/6.8 veces el costo OF. La entrada en caché se reduce aún más a $0.26 por millón de tokens GF.
Esta es una estrategia de hardware notablemente diferente de los despliegues comunes de NVIDIA H100/H200 en la industria, y Featherless la presenta como una forma de evitar las limitaciones de suministro de NVIDIA I.
| Especificación | Detalles |
|---|---|
| Arquitectura | 744B parámetros totales, Mixture-of-Experts (MoE) con ~40B activos por token GS |
| Ventana de contexto | Hasta 256K tokens en nube pública; hasta 1 millón de tokens en despliegues de nube privada FI |
| Cuantización | FP8 por defecto (~750 GB de VRAM para los pesos) FOR |
| Pesos abiertos | Sí — Z.ai lanzó GLM 5.2 con pesos abiertos bajo licencia MIT IDA |
| Enfoque de entrenamiento | Prioriza la codificación; especializado en tareas de ingeniería de software GDS |
En cuantización FP8, los pesos del modelo requieren aproximadamente 750 GB de VRAM, lo que es cómodamente acomodado por el total de 1 TB de VRAM en 4 GPUs MI325X (4 × 256 GB), con espacio libre para la caché KV en longitudes de contexto extendidas OR.
SWE-bench Pro (ingeniería de software del mundo real):
Terminal-Bench 2.1 (tareas de codificación agéntica):
GLM 5.2 ocupa el puesto #2 en el ranking de codificación Arena WebDev según Featherless F.
La ventaja de costos es donde realmente destaca GLM 5.2. A las tarifas oficiales de la API de Z.ai:
| Modelo | Entrada (por 1M de tokens) | Salida (por 1M de tokens) |
|---|---|---|
| GLM 5.2 | $1.40 | $4.40 |
| GPT-5.5 | ~$5.00 | ~$30.00 |
| Claude Opus 4.8 | ~$8.00 | ~$40.00 |
En una combinación de cargas de trabajo realista con una proporción de 3:1 de salida a entrada, GLM-5.2 se sitúa cerca de $3.65 por millón de tokens frente a los aproximadamente $23.75 de GPT-5.5, una relación de aproximadamente 1/6.5 O. Los rastreadores independientes listan una mediana más baja entre los proveedores que sirven los pesos abiertos (más cercana a ~$0.55 de entrada y ~$1.85 de salida) DD.
La nube privada de Featherless para GLM 5.2 es más convincente para:
Featherless también ofrece planes de tarifa plana de nivel inferior a partir de $25/mes para acceso serverless a modelos más pequeños, pero el nodo dedicado de $7,500/mes está explícitamente diseñado para equipos que necesitan inferencia sostenida de alto volumen en el modelo GLM 5.2 completo F.
El nuevo servicio de Featherless ofrece una nube privada de tarifa fija de $7,500/mes para GLM 5.2 en 4 GPUs AMD MI325X, reclamando un 94% de ahorro en costos sobre las APIs propietarias para uso agéntico de alto volumen. El modelo MoE de 744B supera a GPT-5.5 en SWE-bench Pro a aproximadamente una sexta parte del costo por token, lo que lo convierte en una alternativa de pesos abiertos convincente para organizaciones con cargas de trabajo pesadas de codificación e inferencia agéntica. Si bien Claude Opus 4.8 aún lidera en algunos benchmarks, la ventaja de costo de la combinación GLM 5.2 + Featherless es lo suficientemente grande como para convertirla en una opción seria para equipos con presupuesto ajustado que no quieren comprometer el rendimiento.