Depuis le 17 août 2026 à 00 h 00, heure de Pékin, DeepSeek facture les API V4 Flash et V4 Pro selon l’heure : le tarif creux correspond à la moitié du tarif de pointe. Les créneaux de pointe sont fixés de 9 h à 12 h et de 14 h à 18 h, heure de Pékin.
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
Le 17 août 2026 à 00 h 00, heure de Pékin — soit le 16 août à 16 h 00 UTC — DeepSeek a remplacé la grille tarifaire fixe de ses API V4 par une facturation selon l’heure d’utilisation. Les tarifs « heures creuses » sont exactement deux fois moins élevés que les tarifs « heures pleines », tandis que les nouveaux prix dépassent les anciens tarifs de 50 % à 1 100 % selon le modèle, le type de jeton et l’horaire. 1
2
La nouvelle grille concerne DeepSeek-V4-Flash et DeepSeek-V4-Pro. Les heures de pointe sont les suivantes :
Toutes les autres plages horaires sont considérées comme creuses. Pour chaque requête, la plateforme détermine le tarif selon l’heure — en heure de Pékin — à laquelle ses serveurs la reçoivent. Il faut donc tenir compte du fuseau horaire chinois lors de la programmation des traitements. 2
7
Il ne s’agit pas d’une simple hausse uniforme. Une même requête coûte deux fois plus cher si elle arrive pendant l’un des deux créneaux de pointe.
Les montants ci-dessous sont exprimés en yuans (¥) par million de jetons. Une entrée avec cache correspond à un préfixe d’invite déjà mis en cache ; une entrée sans cache doit être traitée intégralement et revient donc plus cher.
| Modèle et type de jeton | Ancien tarif fixe | Tarif creux | Évolution | Tarif de pointe | Évolution |
|---|---|---|---|---|---|
| V4-Flash, entrée avec cache | ¥0,02 | ¥0,05 | +150 % | ¥0,10 | +400 % |
| V4-Flash, entrée sans cache | ¥1,00 | ¥1,50 | +50 % | ¥3,00 | +200 % |
| V4-Flash, sortie | ¥2,00 | ¥4,50 | +125 % | ¥9,00 | +350 % |
| V4-Pro, entrée avec cache | ¥0,025 | ¥0,15 | +500 % | ¥0,30 | +1 100 % |
| V4-Pro, entrée sans cache | ¥3,00 | ¥4,50 | +50 % | ¥9,00 | +200 % |
| V4-Pro, sortie | ¥6,00 | ¥13,50 | +125 % | ¥27,00 | +350 % |
Pour V4-Flash, la documentation indique des tarifs creux de 0,05 ¥ pour une entrée avec cache, 1,50 ¥ pour une entrée sans cache et 4,50 ¥ pour une sortie. Ils passent respectivement à 0,10 ¥, 3 ¥ et 9 ¥ en période de pointe. 2 À l’échelle de la gamme V4, les hausses annoncées vont de 50 % à 1 100 %.
1
8
Évaluations, indexation de documents, opérations de rattrapage, génération de données synthétiques et autres tâches non urgentes peuvent être placés en file d’attente en dehors des deux créneaux de pointe. Comme le tarif creux représente la moitié du tarif de pointe, la simple programmation des tâches peut réduire sensiblement la facture des traitements flexibles. 2
Le fuseau horaire devient ainsi une variable d’exploitation à part entière pour les infrastructures d’IA. Une file d’attente qui connaît à la fois l’échéance d’un traitement et les périodes de facturation à l’heure de Pékin peut reporter son exécution sans changer de modèle ni réduire le budget de jetons.
Les services clients, assistants de programmation et agents en temps réel fonctionnent généralement lorsque les utilisateurs sont actifs. Ils devront donc parfois supporter les tarifs de pointe. Ils peuvent toutefois limiter leurs coûts en réutilisant les invites, en concevant des requêtes favorables au cache, en raccourcissant les réponses et en orientant chaque tâche vers le modèle approprié.
La mise en cache est particulièrement importante : sur les deux modèles, une entrée avec cache reste bien moins chère qu’une entrée sans cache. Pour les systèmes qui renvoient régulièrement les mêmes instructions, définitions d’outils ou passages documentaires, améliorer le taux d’accès au cache peut avoir davantage d’effet que de petites réductions du volume de requêtes.
Les longues chaînes de raisonnement, les rapports détaillés et les réponses contenant beaucoup de code consomment des jetons de sortie. En période de pointe, ceux-ci coûtent 9 ¥ par million pour Flash et 27 ¥ pour Pro. Les développeurs peuvent réduire l’impact en fixant des limites de sortie plus strictes, en utilisant Flash pour les demandes courantes et en réservant Pro aux tâches dont les capacités supplémentaires justifient le surcoût. 1
2
Le prix de pointe d’une entrée avec cache sur V4-Pro est douze fois supérieur à l’ancien tarif fixe, soit la plus forte progression de la nouvelle grille. Le montant absolu reste faible face aux entrées sans cache et aux sorties, mais cette évolution concerne directement les applications qui traitent de très gros volumes d’invites répétitives. 1
19
Cette révision tarifaire intervient après la mise à disposition générale de DeepSeek-V4-Pro-0813, accessible via le point d’accès deepseek-v4-pro en août. Les caractéristiques publiées décrivent un modèle textuel doté d’un contexte d’un million de jetons, d’une sortie maximale de 384 000 jetons et d’une architecture à experts mélangés — ou MoE, pour mixture of experts — totalisant environ 1 600 milliards de paramètres, dont 49 milliards actifs par jeton. 29
33
Les limites de concurrence documentées au niveau du compte distinguent également les deux modèles :
Une requête occupe un emplacement jusqu’à la fin de son traitement, y compris lorsqu’elle utilise une réponse en flux continu. 28
L’ensemble dessine une segmentation assez claire : Flash paraît mieux adapté aux flux courants à haut débit, tandis que Pro constitue un niveau plus limité en capacité, destiné aux tâches de raisonnement exigeantes et aux contextes volumineux. Il s’agit toutefois d’une déduction fondée sur les tarifs et les limites publiées, et non d’une affirmation de DeepSeek concernant chaque cas d’usage. 2
28
Le changement ressemble à une stratégie de régulation de la demande en calcul GPU. Les fournisseurs font face à une demande concentrée lorsque les utilisateurs interactifs sont en ligne, alors que de nombreux traitements par lots peuvent attendre. Des tarifs plus élevés à ces moments et moins élevés le reste du temps incitent à répartir les calculs sur l’ensemble de la journée.
Pour les développeurs, le problème d’optimisation ne se limite donc plus au choix du modèle et au décompte des jetons. Les équipes de production doivent aussi déterminer :
À plus grande échelle, DeepSeek semble s’éloigner de la concurrence fondée uniquement sur des tarifs fixes très bas pour adopter une tarification liée à la rareté de la capacité de calcul. L’entreprise conserve une voie moins coûteuse pour les demandes flexibles, tout en rendant l’inférence haut de gamme plus sensible à l’heure à laquelle elle est exécutée. Reuters a décrit cette évolution comme une hausse importante variant selon le modèle, la catégorie de jetons et la période d’utilisation — et non comme une surtaxe uniforme. 1
Pour les équipes qui utilisent DeepSeek V4, la conclusion est concrète : la programmation des tâches, la mise en cache, le routage entre modèles et le contrôle de la longueur des sorties doivent désormais être intégrés au modèle de coût de l’API. Une charge impossible à déplacer dans le temps pourra nécessiter un autre modèle ou un budget de jetons plus strict ; une charge qui peut attendre pourra préserver une grande partie de son intérêt économique en étant exécutée en heures creuses.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Depuis le 17 août 2026 à 00 h 00, heure de Pékin, DeepSeek facture les API V4 Flash et V4 Pro selon l’heure : le tarif creux correspond à la moitié du tarif de pointe.
Depuis le 17 août 2026 à 00 h 00, heure de Pékin, DeepSeek facture les API V4 Flash et V4 Pro selon l’heure : le tarif creux correspond à la moitié du tarif de pointe. Les créneaux de pointe sont fixés de 9 h à 12 h et de 14 h à 18 h, heure de Pékin.
La mise en cache des invites, le choix entre Flash et Pro et la programmation des tâches deviennent désormais des leviers directement liés au coût d’utilisation.