| Modell | Token-Typ | Vorheriger Festpreis | Nebenzeiten (neu) | Spitzenzeit (neu) | Effektive Änderung |
|---|---|---|---|---|---|
| V4-Flash | Input (Cache-Miss) | 0,14 $ | 0,21 $ | 0,42 $ | +50 % Nebenzeiten, +200 % Spitzenzeit |
| V4-Flash | Input (Cache-Hit) | 0,0028 $ | 0,007 $ | 0,014 $ | +150 % Nebenzeiten, +400 % Spitzenzeit |
| V4-Flash | Output | 0,28 $ | 0,42 $ | 0,84 $ | +50 % Nebenzeiten, +200 % Spitzenzeit |
| V4-Pro | Input (Cache-Miss) | 0,435 $ | 0,99 $ | 1,98 $ | +128 % Nebenzeiten, +355 % Spitzenzeit |
| V4-Pro | Input (Cache-Hit) | 0,003625 $ | 0,03 $ | 0,06 $ | +728 % Nebenzeiten, +1.555 % Spitzenzeit |
| V4-Pro | Output | 0,87 $ | 1,98 $ | 3,96 $ | +128 % Nebenzeiten, +355 % Spitzenzeit |
Die extremste Erhöhung betrifft V4-Pro Cache-Hit-Input: von 0,003625 $ auf 0,06 $ zur Spitzenzeit – ein Anstieg um rund 1.555 % . DeepSeek begründete die Änderung mit einer effizienteren Ressourcenallokation und dem Anreiz, nicht dringende Workloads in Nebenzeiten zu planen
.
Im August 2026 testete Composio DeepSeek V4 Flash mit acht verschiedenen Agenten-Frameworks (Harnesses) in 30 bewusst schwierigen, mehrstufigen Workflows. Diese Workflows verwendeten Live-Tools wie Gmail, GitHub, Slack und Google Sheets . Jede Aufgabe hatte ein Zeitlimit von 900 Sekunden, und alle Frameworks nutzten die gleichen gehosteten Composio MCP-Tools
.
Das Gesamtergebnis: Von 240 Durchläufen waren nur 129 erfolgreich – eine Erfolgsquote von 53,8 %. Nur 6 der 30 Workflows wurden von jedem Framework erfolgreich abgeschlossen .
| Framework | Erfolgsquote (von 30 Aufgaben) | Kosten pro erfolgreicher Aufgabe |
|---|---|---|
| Pi Agent | 20/30 (66,7 %) | 0,028 $ |
| Prime Agent | ~15/24 (62,5 % gültige Läufe) | 0,131 $ |
| OMP (Oh My Pi) | 17/30 (56,7 %) | 0,103 $ |
| Claude Code | 16/30 (53,3 %) | 0,195 $ |
| Codex | 16/30 (53,3 %) | 0,081 $ |
| Deep Agents (LangChain) | 16/30 (53,3 %) | 0,045 $ |
| Hermes Agent | 15/30 (50,0 %) | 0,056 $ |
| OpenCode | 14/30 (46,7 %) | 0,067 $ |
Pi Agent führte sowohl bei der Erfolgsquote (20/30) als auch bei der Kosteneffizienz (0,028 $/Aufgabe) . Dass bei jedem Erfolgsfaktor – Erfolgsquote, Kosten und Geschwindigkeit – ein anderes Framework die Nase vorn hatte, zeigt: Die Wahl des Frameworks ist genauso wichtig wie die Wahl des Modells
. Der Unterschied von 20 Prozentpunkten zwischen dem besten und dem schlechtesten Framework belegt eine extreme Abhängigkeit von der Agenten-Architektur, der Tool-Konfiguration, dem Caching, den Wiederholungsversuchen und dem Anbieter-Stack
.
Die Kombination aus höheren Preisen und ungleichmäßigen Praxis-Ergebnissen hat die Analystenmeinung über den Unternehmenseinsatz von DeepSeek V4 verändert.
VentureBeat stellte fest, dass dasselbe V4 Flash-Modell je nach Framework, Tooling und Caching-Stack deutlich unterschiedliche Ergebnisse lieferte. Unternehmen müssen daher in die Reife ihrer Orchestrierung investieren, nicht nur in die Modellauswahl . Compsios eigener Kommentar wies darauf hin, dass die Wahl des Frameworks allein den Erfolg um drei Aufgaben, die Kosten um fast das Dreifache und die Geschwindigkeit um das 2,2-fache veränderte
.
Selbst in den Nebenzeiten ist jeder Token-Typ teurer als zuvor. Analysten sehen darin eine Veränderung der ROI-Rechnung für Workloads mit hohem Volumen, insbesondere für Kundenservice-Agenten und Code-Generierungs-Pipelines, die bisher auf die aggressiv niedrigen Preise von DeepSeek angewiesen waren .
DeepSeeks offizielle Agenten-Benchmarks (82,7 auf Terminal-Bench 2.1, 70,3 auf Toolathlon-Verified) sehen stark aus, aber die reale Erfolgsquote von 53,8 % ist eine Mahnung: Leaderboard-Ergebnisse garantieren keine Zuverlässigkeit in Produktionsumgebungen mit Live-APIs, Rate Limits und zustandsbehafteten Workflows .
Der API-Datenverkehr läuft über Server in China, was für regulierte Unternehmen Compliance-Herausforderungen schafft. Für Branchen mit strengen Datenschutzauflagen – wie viele in Deutschland und der EU – bleibt das Selbsthosten der Open-Weight-Versionen der einzig gangbare Weg in die Produktion . Analysten raten zu einer sorgfältigen Architekturplanung mit Blick auf Data Governance, Audit-Trails und Tool-Berechtigungen
.
BayTech Consulting empfiehlt DeepSeek V4 in seinem Enterprise-Framework für die Zusammenfassung nicht sensibler Dokumente, die Codegenerierung aus öffentlichen Repositories und das Verfassen von Inhalten mit hohem Volumen. Vor der Produktion ist aber eine gründliche, workload-spezifische Evaluierung unerlässlich .