| GLM-5.2 |
| 13 juin 2026 |
| 744B paramètres totaux, 40B actifs, fenêtre de contexte de 1 million de tokens ; classé n°1 des modèles à poids ouverts sur l'Artificial Analysis Intelligence Index |
| DeepSeek | V4-Flash / V4-Pro | Juin à août 2026 | V4-Flash à 0,14 $/M tokens d'entrée ; V4-Pro à 0,435 $/M après baisse de prix en juin |
| Alibaba | Qwen 3.7 Max / Plus / Flash | Mai à juin 2026 | Modèle phare de 2,8 T paramètres (MoE) ; Qwen3.7 Max à 1,25 $/3,75 $ par M tokens ; Qwen3.6 Flash à 0,19 $/1,13 $ |
| Moonshot AI | Kimi K3 | 16 juillet 2026 | 2,8 T paramètres totaux, ~50B actifs, contexte de 1M ; promesse de publication des poids en open-source d'ici le 27 juillet |
| Z.ai | Rival de Fable 5 | Fin juin 2026 | Dévoilé peu après l'arrêt de deux modèles avancés d'Anthropic à la demande du gouvernement américain |
L'écart de coût est abyssal. Le V4-Flash de DeepSeek facture 0,14 $ par million de tokens d'entrée — soit plus de 100 fois moins cher que le Claude Fable 5 d'Anthropic . Le Qwen3.6 Flash d'Alibaba coûte 0,19 $/M tokens d'entrée, tandis que les modèles de pointe américains comme GPT-5.5 et Claude Opus 4.8 coûtent environ 7 à 12 fois plus cher pour des niveaux de capacité comparables . Le K3 de Moonshot, un modèle de niveau « frontière », propose des prix d'API de 3 $/M tokens d'entrée et 15 $/M tokens de sortie, avec des poids ouverts promis pour un auto-hébergement gratuit .