Les modèles à poids ouverts ont atteint 62 % du volume de tokens de Vercel AI Gateway le samedi précédent le 25 août, avant de retomber à 54 % le mardi, contre 46 % pour les modèles propriétaires.[4] DeepSeek V4 Flash a joué le rôle de principal catalyseur : ses nouveaux poids ont nettement amélioré ses performances...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What drove the record surge in usage of low-cost Chinese open-weight AI models—particularly DeepSeek’s latest lightweight model—on Vercel’s. Article summary: The surge was driven by developers shifting high-volume workloads to inexpensive Chinese open-weight models, led by DeepSeek V4 Flash: a lightweight model whose updated weights improved agentic performance substantially.. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Le marché de l’inférence IA est en train de changer de logique : pour de nombreux usages en production, les développeurs privilégient désormais le modèle suffisamment performant au coût le plus bas. Les données de Vercel AI Gateway — une API qui permet d’accéder à de nombreux modèles depuis un point d’entrée unique — en donnent une illustration frappante.
Le mardi 25 août 2026, les modèles à poids ouverts représentaient 54 % du volume de tokens traité par la passerelle, contre 46 % pour les modèles propriétaires. Le samedi précédent, leur part avait atteint un record annoncé de 62 %, laissant 38 % aux modèles propriétaires.4
| Point observé en août | Modèles à poids ouverts | Modèles propriétaires |
|---|---|---|
| Samedi précédent | 62 % | 38 % |
| Mardi 25 août | 54 % | 46 % |
Les modèles à poids ouverts conservaient donc une avance de 8 points le mardi, après avoir atteint 24 points lors du précédent record. Ces pourcentages mesurent uniquement le volume de tokens traité par AI Gateway. Ils ne permettent pas de déduire les revenus, les bénéfices ni le nombre d’entreprises utilisant chaque catégorie de modèles.
Le principal élément déclencheur semble être la mise à jour de DeepSeek V4 Flash. Vercel indique que le modèle fonctionne désormais par défaut avec de nouveaux poids sur AI Gateway. Son score à Terminal-Bench est passé de 56,9 dans l’aperçu d’avril à 82,7, soit une progression de 25,8 points.19
Pour les utilisateurs existants, le changement s’est fait sans modification de l’identifiant du modèle ni du code de l’application : les requêtes adressées à deepseek/deepseek-v4-flash récupèrent automatiquement les nouveaux poids.19 Cette absence de friction réduit fortement le coût du passage à la version améliorée.
L’intérêt du modèle ne tient donc pas seulement à son prix. Ses progrès en matière de codage, d’utilisation d’outils et de flux de travail « agentiques » le rendent plus adapté aux tâches répétitives et volumineuses. Vercel présente également V4 Flash comme un modèle prenant en charge le raisonnement, l’utilisation d’outils et la mise en cache implicite, avec une fenêtre de contexte d’un million de tokens.27
Le positionnement tarifaire renforce cette attractivité. Selon Reuters, DeepSeek V4 Pro a été lancé avec un prix d’entrée environ neuf fois supérieur à celui de V4 Flash et un prix de sortie 14 fois plus élevé, ce qui souligne l’écart entre le modèle d’efficacité et l’offre haut de gamme de DeepSeek.17
Des comparaisons indépendantes montrent elles aussi un avantage de prix substantiel pour V4 Flash, même si les résultats des benchmarks varient selon les tests et les configurations.25 Pour les développeurs qui font tourner des assistants de programmation, des appels d’outils ou de la génération à grande échelle, le coût par token peut peser davantage que la performance maximale obtenue sur les tâches les plus complexes.
Les informations disponibles associent le recul du volume des modèles propriétaires à une demande professionnelle moins forte pour Fable 5, le modèle plus coûteux d’Anthropic.4 Cette explication est cohérente pour les usages où le débit et le coût unitaire comptent davantage que le niveau de performance maximal, mais les chiffres de Vercel ne prouvent pas qu’il s’agit de l’unique cause pour chaque client ou chaque requête.
Fable 5 reste présenté par Vercel comme un modèle destiné aux tâches longues, ambiguës et comportant plusieurs étapes, notamment lorsque l’exécution de bout en bout peut éviter de fréquentes interventions humaines.3 Le changement observé en août ressemble donc moins à un verdict général — les modèles ouverts seraient meilleurs dans tous les cas — qu’à une décision d’aiguillage.
Les entreprises peuvent affecter les tâches adaptées à un modèle moins cher et réserver les modèles propriétaires premium aux missions suffisamment importantes pour justifier leur tarif supérieur.
La distinction entre volume d’utilisation et chiffre d’affaires est essentielle. Dans un rapport antérieur, Vercel indiquait que les modèles à poids ouverts représentaient 29 % du volume de tokens d’AI Gateway, mais moins de 4 % des dépenses.44
L’écart s’explique par le fait qu’un simple comptage de tokens ne tient pas compte du prix facturé pour les tokens d’entrée et de sortie. Ainsi, les modèles ouverts peuvent traiter la majorité des requêtes ou des tokens tout en laissant aux modèles propriétaires une part disproportionnée des dépenses.
Le franchissement observé en août signale donc surtout que les modèles à poids ouverts prennent en charge une plus grande partie du travail de la passerelle — pas nécessairement qu’ils génèrent davantage de revenus pour les fournisseurs.
Les données plaident pour une stratégie de routage plus fine des modèles :
La tendance de fond est claire : les modèles à poids ouverts peuvent s’imposer dans les environnements de production lorsqu’ils combinent des capacités suffisantes et un coût nettement inférieur. DeepSeek V4 Flash en est l’exemple le plus visible, mais le mouvement ne signifie pas le remplacement immédiat de tous les modèles propriétaires. Il traduit plutôt une approche plus pragmatique : associer chaque tâche au modèle le moins cher capable de l’exécuter de manière suffisamment fiable.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Les modèles à poids ouverts ont atteint 62 % du volume de tokens de Vercel AI Gateway le samedi précédent le 25 août, avant de retomber à 54 % le mardi, contre 46 % pour les modèles propriétaires.[4]
Les modèles à poids ouverts ont atteint 62 % du volume de tokens de Vercel AI Gateway le samedi précédent le 25 août, avant de retomber à 54 % le mardi, contre 46 % pour les modèles propriétaires.[4] DeepSeek V4 Flash a joué le rôle de principal catalyseur : ses nouveaux poids ont nettement amélioré ses performances agentiques tout en conservant un positionnement tarifaire axé sur l’efficacité.[19]
Cette avance en volume ne signifie pas que les modèles ouverts représentent la majorité des dépenses : des données antérieures de Vercel leur attribuaient 29 % des tokens, mais moins de 4 % des dépenses.[44]