Il 16 agosto 2026 DeepSeek ha introdotto un pricing API a fasce orarie, con aumenti fino al 355% per l'output di V4 Pro in fascia alta e punte del 1.555% per l'input in cache. Nei test indipendenti di Composio, il modello top di gamma V4 Flash ha completato solo il 53,8% dei task in scenari reali, con un divario di...
Research answer

Create a landscape editorial hero image for this Studio Global article: What pricing changes did DeepSeek implement for its V4 API models on August 16, 2026, how does the new peak and off-peak tiered structure co. Article summary: **Pi Agent** led in both success rate (20/30) and cost efficiency ($0.028/task).. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence
Il 16 agosto 2026 DeepSeek ha introdotto una delle revisioni di prezzo più significative nel mercato delle API AI, sostituendo le tariffe fisse con una struttura peak/off-peak che ha portato i costi a crescere fino al 1.555% per alcune tipologie di token . Nella stessa settimana, la società di testing indipendente Composio ha rivelato che il modello di punta V4 Flash ha completato solo il 53,8% dei task in scenari reali su otto diversi framework di orchestrazione, evidenziando un ampio divario tra i punteggi delle classifiche e l'affidabilità in produzione
. Insieme, questi sviluppi costringono le aziende a riconsiderare il costo totale e la maturità dell'orchestrazione necessari per distribuire DeepSeek V4 su larga scala.
A partire dalle 16:00 UTC del 16 agosto 2026, DeepSeek è passato da una tariffa fissa a un modello di pricing a due fasce per V4-Flash e V4-Pro . Le fasce orarie di punta (peak) sono 01:00–04:00 UTC e 06:00–10:00 UTC (7 ore totali al giorno); tutte le altre ore sono considerate fuori punta (off-peak)
. Le tariffe off-peak sono esattamente la metà di quelle peak, ma ogni categoria di token ha comunque subito un aumento netto rispetto ai prezzi precedenti
.
| Modello | Tipo di token | Tariffa fissa precedente | Off-peak (nuova) | Peak (nuova) | Variazione effettiva |
|---|---|---|---|---|---|
| V4-Flash | Input (cache miss) | $0,14 | $0,21 | $0,42 | +50% off-peak, +200% peak |
| V4-Flash | Input (cache hit) | $0,0028 | $0,007 | $0,014 | +150% off-peak, +400% peak |
| V4-Flash | Output | $0,28 | $0,42 | $0,84 | +50% off-peak, +200% peak |
| V4-Pro | Input (cache miss) | $0,435 | $0,99 | $1,98 | +128% off-peak, +355% peak |
| V4-Pro | Input (cache hit) | $0,003625 | $0,03 | $0,06 | +728% off-peak, +1.555% peak |
| V4-Pro | Output | $0,87 | $1,98 | $3,96 | +128% off-peak, +355% peak |
Fonte dati: listino prezzi pubblicato da DeepSeek e tracker indipendenti .
L'aumento più estremo riguarda l'input in cache di V4-Pro, passato da $0,003625 a $0,06 in fascia peak — un incremento di circa il 1.555% . DeepSeek ha dichiarato che la modifica è stata introdotta per allocare le risorse in modo più efficiente e incoraggiare gli utenti a pianificare i carichi di lavoro non urgenti durante le fasce off-peak
.
Ad agosto 2026, la società di testing indipendente Composio ha valutato DeepSeek V4 Flash su otto diversi framework di orchestrazione (harness) per agenti, su 30 flussi di lavoro volutamente complessi e multi-step, che coinvolgevano strumenti live come Gmail, GitHub, Slack e Google Sheets . Ogni task aveva un timeout di 900 secondi e tutti gli harness utilizzavano gli stessi strumenti MCP ospitati da Composio
.
Il risultato complessivo: su 240 esecuzioni totali, solo 129 hanno avuto successo — un tasso di superamento del 53,8%. Solo 6 dei 30 flussi di lavoro sono stati completati con successo da tutti gli harness .
| Harness | Tasso di superamento (su 30 task) | Costo per task riuscito |
|---|---|---|
| Pi Agent | 20/30 (66,7%) | $0,028 |
| Prime Agent | ~15/24 (62,5% run valide) | $0,131 |
| OMP (Oh My Pi) | 17/30 (56,7%) | $0,103 |
| Claude Code | 16/30 (53,3%) | $0,195 |
| Codex | 16/30 (53,3%) | $0,081 |
| Deep Agents (LangChain) | 16/30 (53,3%) | $0,045 |
| Hermes Agent | 15/30 (50,0%) | $0,056 |
| OpenCode | 14/30 (46,7%) | $0,067 |
Dati dai risultati pubblicati da Composio .
Pi Agent ha guidato sia in termini di tasso di successo (20/30) che di efficienza dei costi ($0,028/task) . Un diverso harness ha vinto per ogni metrica — tasso di successo, costo e velocità — il che significa che la scelta dell'orchestrazione è importante tanto quanto la capacità del modello
. Il divario di 20 punti percentuali tra l'harness migliore e quello peggiore dimostra un'estrema sensibilità al framework dell'agente, alla configurazione degli strumenti, alla cache, ai tentativi e allo stack del provider
.
La combinazione di prezzi più alti e risultati reali disomogenei ha rimodellato la visione degli analisti sull'idoneità di DeepSeek V4 per le imprese.
VentureBeat ha notato che lo stesso modello V4 Flash ha prodotto risultati sostanzialmente diversi a seconda dell'harness, del tooling e dello stack di caching, suggerendo che le aziende devono investire nella maturità dell'orchestrazione parallelamente alla selezione del modello . Lo stesso commento di Composio ha sottolineato che la sola scelta dell'harness ha modificato il successo di tre task, il costo di quasi 3 volte e la velocità di 2,2 volte
.
Anche in fascia off-peak, ogni tipo di token è più costoso di prima. Gli analisti affermano che ciò modifica il calcolo del ROI per i carichi di lavoro ad alto volume basati su agenti, in particolare per gli agenti di assistenza clienti e le pipeline di generazione di codice che in precedenza facevano affidamento sui prezzi aggressivamente bassi di DeepSeek .
I benchmark ufficiali di DeepSeek per gli agenti (82,7 su Terminal-Bench 2.1, 70,3 su Toolathlon-Verified) appaiono solidi, ma il tasso di successo reale del 53,8% è un promemoria che i punteggi nelle classifiche non garantiscono l'affidabilità in ambienti di produzione con API live, limiti di frequenza e flussi di lavoro con stato .
Il traffico API passa attraverso server in Cina, creando sfide di conformità per le aziende regolamentate. Gli analisti consigliano un'attenta pianificazione architetturale per la governance dei dati, le tracce di audit e i controlli delle autorizzazioni degli strumenti . Per i settori regolamentati, l'auto-hosting dei pesi aperti rimane l'unica strada percorribile per la produzione
.
Il framework aziendale di BayTech Consulting raccomanda DeepSeek V4 per la sintesi di documenti non sensibili, la generazione di codice su repository aperti e la stesura di contenuti ad alto volume, ma richiede una valutazione rigorosa carico di lavoro per carico di lavoro prima di impegnarsi nella produzione .
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Il 16 agosto 2026 DeepSeek ha introdotto un pricing API a fasce orarie, con aumenti fino al 355% per l'output di V4 Pro in fascia alta e punte del 1.555% per l'input in cache.
Il 16 agosto 2026 DeepSeek ha introdotto un pricing API a fasce orarie, con aumenti fino al 355% per l'output di V4 Pro in fascia alta e punte del 1.555% per l'input in cache. Nei test indipendenti di Composio, il modello top di gamma V4 Flash ha completato solo il 53,8% dei task in scenari reali, con un divario di 20 punti percentuali tra i diversi framework di orchestrazione.
La scelta del framework di orchestrazione (harness) si rivela cruciale quanto il modello stesso, con Pi Agent che ha ottenuto il miglior rapporto successo/costo (66,7% a $0,028 per task).