DeepSeek V4 Flash a traité 7,22 billions de jetons sur OpenRouter du 27 juillet au 2 août, selon TechNode, mais cette semaine recouvre à la fois l’ancienne préversion et la version 0731 publiée le 31 juillet. Le modèle associe 284 milliards de paramètres au total, dont 13 milliards activés par jeton, à une fenêtre d...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 illustre la vitesse à laquelle les choix par défaut peuvent évoluer dans l’IA générative lorsqu’un modèle réunit trois qualités : des jetons peu chers, une très grande fenêtre de contexte et un accès immédiat via un agrégateur tel qu’OpenRouter. Le modèle a pris la première place du classement hebdomadaire d’OpenRouter, avec 7,22 billions de jetons traités entre le 27 juillet et le 2 août. Ce chiffre mérite toutefois d’être lu avec prudence. 5
La version du 31 juillet est un modèle mixture-of-experts (MoE) clairsemé : elle compte 284 milliards de paramètres au total, mais n’en active que 13 milliards par jeton. OpenRouter lui attribue une fenêtre de contexte de 1 310 720 jetons et le présente pour la programmation, le raisonnement et les flux de travail agentiques. 1
Cette formule est particulièrement séduisante lorsque le volume de jetons pèse lourd dans la facture :
L’architecture MoE ne garantit pas, à elle seule, ni une meilleure qualité ni un coût réel inférieur. Son intérêt est avant tout économique : n’activer qu’une fraction des paramètres à chaque jeton vise à offrir une grande capacité de modèle sans le profil de calcul par jeton d’un modèle dense de taille totale comparable. En pratique, le gain dépend aussi de la latence, de la capacité du fournisseur, du routage, des prompts et de la longueur des réponses.
TechNode indique que DeepSeek V4 Flash a traité 7,22 billions de jetons sur OpenRouter lors de la semaine du 27 juillet au 2 août. Le même article précise que les modèles chinois occupaient les quatre premières places et que V4 Flash 0731 ainsi que V4 Pro figuraient parmi les six premiers. 5
Mais la période observée a commencé avant la sortie publique en bêta de la version 0731, le 31 juillet. V4 Flash existait déjà sous forme de préversion, et la version 0731 a remplacé celle-ci sur l’endpoint API deepseek-v4-flash. 3 Le total hebdomadaire ne peut donc pas être attribué exclusivement au nouveau modèle.
Les accès gratuits brouillent également l’interprétation. Le 1er août, OpenCode aurait traité 8 billions de jetons avec ce modèle, dont 5 billions via des essais gratuits et 3 billions payés par les développeurs. 5 Cette exposition est stratégique : elle réduit le coût et la friction de l’évaluation. Mais elle n’équivaut pas à une adoption en production, stable et payante.
La conclusion la plus solide est donc celle d’une distribution et d’une phase de test exceptionnellement rapides. Les éléments disponibles ne démontrent pas que tout ce volume correspondait à des migrations payantes ou à un usage durable en production.
Les tarifs dépendent du fournisseur, de la route de distribution, des remises, du cache et de la date d’observation. La couverture de la sortie du 31 juillet citait un tarif officiel de 0,14 $ par million de jetons d’entrée non mis en cache et 0,28 $ en sortie ; OpenRouter affichait alors d’autres prix selon les routes. 3
La fiche plus récente d’OpenRouter pour la route datée deepseek-v4-flash-0731 affiche 0,05 $ par million de jetons en entrée, 0,16 $ en sortie et 0,013 $ pour un million de jetons relus depuis le cache. 1
Sur cette base, l’écart avec les prix de comparaison fournis est considérable :
| Modèle | Tarif affiché par million de jetons, entrée / sortie | Écart par rapport à V4-Flash à 0,05 $ / 0,16 $ |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0,05 $ / 0,16 $ |
Référence |
| Kimi K3 | 3 $ / 15 $ |
Environ 60× / 94× plus cher |
| GPT-5.6 Sol | 5 $ / 30 $ |
Environ 100× / 188× plus cher |
| Claude Fable 5 | 10 $ / 50 $ |
Environ 200× / 313× plus cher |
Il s’agit de calculs à partir de tarifs publics, non d’une preuve d’équivalence en qualité, vitesse, fiabilité des outils, sécurité ou disponibilité. Il n’existe pas non plus de « coût par tâche » universel : la facture dépend de la taille des entrées et sorties, du cache, des tentatives échouées, des appels d’outils, du fournisseur et de la fréquence à laquelle une requête est redirigée vers un modèle plus cher.
Ces modèles ne sont pas interchangeables sous prétexte qu’ils couvrent tous des usages avancés de code et d’agents. La source de comparaison décrit Kimi K3 comme un MoE de 2 800 milliards de paramètres avec un contexte d’un million de jetons. Elle attribue 1,05 million de jetons de contexte à GPT-5.6 Sol et un million à Claude Fable 5. 17
Pour une équipe technique, le bon raisonnement est opérationnel :
Les benchmarks publics sont utiles pour constituer une première sélection, mais un score isolé ne peut pas décider d’un standard de production. La comparaison « Agent Ultimate » à 25,2 contre 25,7 évoquée dans l’affirmation initiale n’est pas étayée de façon indépendante par les sources de premier plan fournies : elle ne doit donc pas servir de preuve de quasi-équivalence. Les informations de sortie de DeepSeek signalent notamment 82,7 sur Terminal Bench 2.1 et 54,2 sur NL2Repo ; ces résultats doivent néanmoins être validés sur les flux de travail réels. 10
Pour une équipe de développement de taille intermédiaire, la question n’est généralement pas « quel modèle gagne le classement ? ». Elle est plutôt : quel modèle est assez fiable sur nos tâches pour générer une économie nette, une fois les échecs et les redirections pris en compte ?
Une évaluation utile suit quelques étapes simples :
C’est pourquoi la progression de V4-Flash compte, même si les premiers volumes ont été gonflés par les essais. Elle montre qu’un agrégateur multi-modèles peut permettre aux développeurs de tester immédiatement une option à très bas coût et à long contexte. Si cette option atteint le niveau requis lors des évaluations en production, elle peut absorber une partie des tâches routinières auparavant envoyées vers des modèles plus onéreux.
Les sources fournies étayent la première place hebdomadaire avec 7,22 billions de jetons, le chevauchement avec la période de préversion et l’importance signalée des essais gratuits sur OpenCode. 3
5 Elles ne permettent pas d’établir solidement que les modèles chinois occupaient neuf des dix premières places, qu’ils dépassaient le volume d’appels américain depuis quatorze semaines, qu’ils ont entraîné une migration généralisée de développeurs américains et européens, qu’ils ont produit 60 à 85 % de baisse réelle des coûts d’inférence ou qu’ils ont provoqué une réduction tarifaire précise de 80 % pour GPT-5.6 Luna.
Ces affirmations nécessiteraient des données directes du tableau de bord d’OpenRouter, des historiques tarifaires des fournisseurs ou des études de charges de travail reproductibles. À ce stade, le constat étayé est plus ciblé : DeepSeek V4-Flash a combiné des prix de routage affichés très bas, une grande fenêtre de contexte et un accès largement ouvert au moment où les développeurs cherchaient des modèles moins coûteux pour le code et les agents. Cela suffit à expliquer une flambée rapide des usages, mais pas encore à prouver un rééquilibrage durable du marché.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
DeepSeek V4 Flash a traité 7,22 billions de jetons sur OpenRouter du 27 juillet au 2 août, selon TechNode, mais cette semaine recouvre à la fois l’ancienne préversion et la version 0731 publiée le 31 juillet.
DeepSeek V4 Flash a traité 7,22 billions de jetons sur OpenRouter du 27 juillet au 2 août, selon TechNode, mais cette semaine recouvre à la fois l’ancienne préversion et la version 0731 publiée le 31 juillet. Le modèle associe 284 milliards de paramètres au total, dont 13 milliards activés par jeton, à une fenêtre de contexte de 1 310 720 jetons, une combinaison adaptée aux agents, au code et aux gros volumes.
Les tarifs affichés par OpenRouter pour V4 Flash 0731 sont de 0,05 $ par million de jetons en entrée et 0,16 $ en sortie ; un avantage de prix considérable, qui ne dispense pas de tester la qualité et la fiabilité sur...