Le Qwen 3.7 Max d'Alibaba, lancé en mai 2026, est un modèle phare de 2 800 milliards de paramètres à architecture mixte d'experts (MoE). Il semble égaler ou dépasser le Fable 5 d'Anthropic sur les tests de performance, pour environ un sixième du coût . Pour les usages à fort volume, le Qwen3.6 Flash d'Alibaba coûte seulement 0,19 $ par million de tokens d'entrée .
Le GLM-5.2 de Zhipu AI, sorti le 13 juin 2026, utilise une architecture MoE de 744 milliards de paramètres (40 milliards d'actifs) avec une fenêtre de contexte d'un million de tokens. Il est classé comme le meilleur modèle à poids ouverts sur l'Indice d'Intelligence de Artificial Analysis . Son prix de 1,40 $ par million de tokens d'entrée et 4,40 $ par million de tokens de sortie sous-cote les modèles américains de pointe d'environ 5 à 6 fois .
Le Kimi K3 de Moonshot AI, dévoilé le 16 juillet 2026, est le plus grand système d'IA à poids ouverts jamais annoncé : 2 800 milliards de paramètres, une fenêtre de contexte d'un million de tokens et une compréhension visuelle native . Moonshot a promis les poids complets pour le 27 juillet 2026 . Son API coûte 3 $ par million de tokens d'entrée et 15 $ par million de tokens de sortie, ce qui en fait le modèle chinois le plus cher, mais toujours en dessous des offres américaines comparables .
L'écart de coût entre les modèles de pointe chinois et américains est extrême :
| Modèle | Prix d'entrée (par million de tokens) | Prix de sortie (par million de tokens) |
|---|---|---|
| DeepSeek V4-Flash | 0,14 $ | 0,28 $ |
| Alibaba Qwen3.6 Flash | 0,19 $ | 1,13 $ |
| Zhipu GLM-5.2 | 1,40 $ | 4,40 $ |
| Alibaba Qwen3.7 Max | 1,25 $ | 3,75 $ |
| Moonshot Kimi K3 | 3,00 $ | 15,00 $ |
| Anthropic Claude Fable 5 (est.) | ~15,00 $ | ~50,00 $ |
| OpenAI GPT-5.5 (est.) | ~5,00 $ | ~15,00 $ |
Sources :
Les chiffres parlent d'eux-mêmes : le V4-Flash de DeepSeek coûte environ 3 cents par test de référence, contre 1,86 $ pour GPT-5.5 et 3,33 $ pour Claude Fable 5 . Le capital-risqueur Marc Andreessen a noté que le GLM-5.2 était « le premier modèle d'IA chinois à égaler et souvent battre les grands modèles publics des laboratoires américains, sans compromis » — pour une fraction du prix .
Le deuxième volet de la stratégie chinoise est la publication des poids des modèles. Des modèles comme GLM-5.2 (licence MIT), Kimi K3 (licence Modified MIT promise) et la série Qwen sont librement téléchargeables. Cela signifie que n'importe qui peut les exécuter, les modifier ou les affiner sans coût par token . Cette stratégie consistant à « donner les modèles » vide le marché intermédiaire où les entreprises américaines facturaient des prix élevés .
Un tournant clé est survenu en juin 2026, lorsque l'administration Trump a demandé à Anthropic de cesser l'exploitation de ses deux systèmes d'IA les plus avancés (Fable et Mythos) pour des raisons de sécurité nationale . En deux semaines, Z.ai a dévoilé un modèle qui rivalisait étroitement avec les offres d'Anthropic — plus abordable et sans les restrictions américaines . Les entreprises chinoises ont vu une opportunité et se sont précipitées pour la saisir .
La réponse américaine a été fragmentée. Anthropic a obéi à la demande du gouvernement. Google serait en difficulté avec la dernière version de son modèle Gemini, alors que les modèles chinois réduisent l'écart . Aucune contre-mesure politique coordonnée majeure n'a été annoncée. Les analystes notent que les contrôles à l'exportation sur les puces n'ont pas empêché les entreprises chinoises d'atteindre des performances compétitives grâce à l'efficacité architecturale (par exemple, MoE, attention hybride) plutôt qu'à la puissance de calcul brute .
Parallèlement, les entreprises américaines testent et adoptent de plus en plus les modèles chinois pour des raisons de coût, érodant davantage l'avantage des laboratoires d'IA américains sur leur propre marché .