DeepSeek V4 Flash ist die auf Effizienz und hohe Anfragevolumen ausgelegte Variante der V4-Familie. Die MoE-Architektur stellt dem Modell einen großen Pool spezialisierter Experten zur Verfügung, aktiviert bei jeder Anfrage aber nur einen Teil davon. Das kann Rechenaufwand und Kosten senken.
| Eigenschaft | Angabe |
|---|---|
| Gesamtparameter | 284 Milliarden |
| Parameter pro Token aktiv | 13 Milliarden |
| Parameter inklusive DSpark-Modul | 304 Milliarden |
| Architektur | Mixture of Experts (MoE) |
| Kontextfenster | 1.000.000 Tokens |
| Maximale Ausgabe | 384.000 Tokens |
| Präzision | FP4 und FP8, gemischt |
| Lizenz | MIT |
| Download-Größe | etwa 160 GB |
Quellen:
Die Produktionsversion vom 31. Juli ersetzt die zuvor veröffentlichte Vorschau. Die Architektur und die Modellgröße blieben dabei unverändert; die Leistungsgewinne sollen vor allem durch weiteres Post-Training entstanden sein .
Die Gewichte von V4 Flash und V4 Pro stehen unter der permissiven MIT-Lizenz zur Verfügung. Damit sind kommerzielle Nutzung, Veränderung und Weitergabe grundsätzlich ohne Lizenzgebühren möglich . Die Modelle können über Plattformen wie Hugging Face bezogen, auf eigener Infrastruktur betrieben oder in eigene Anwendungen integriert werden.
Für Unternehmen ist das besonders relevant, weil kein ausschließliches API-Modell vorgeschrieben ist. Wer über ausreichend Hardware verfügt, kann die Datenverarbeitung selbst kontrollieren. Allerdings bedeutet „Open Weight“ nicht automatisch, dass der Betrieb unkompliziert oder günstig ist: Das Modell benötigt trotz Quantisierung erhebliche Speicherkapazitäten.
Das große Kontextfenster basiert auf einer hybriden Attention-Architektur mit zwei Mechanismen:
Die Schichten wechseln sich ab: Gerade Schichten ab Schicht 2 verwenden CSA, ungerade Schichten ab Schicht 3 HCA. Ein zusätzliches Fenster mit den letzten 128 unveränderten Tokens soll aktuelle Informationen erhalten .
Vereinfacht gesagt: Das Modell behandelt den jüngsten Gesprächsabschnitt detailliert, während ältere Inhalte stark verdichtet werden. So bleibt ein Zugriff auf sehr lange Dokumente oder Codebasen möglich, ohne jede Information mit voller Rechenlast zu verarbeiten.
Die Modellgewichte liegen in einer gemischten Präzision vor:
nvidia/DeepSeek-V4-Flash-NVFP4 .In FP8 benötigen die Gewichte allein ungefähr 284 GB. Für einen Betrieb mit dem vollständigen 1-Million-Token-Kontext werden als Richtwert vier NVIDIA-H200-SXM5-GPUs mit zusammen 564 GB VRAM genannt . Das zeigt die zentrale Einschränkung: Die Gewichte sind offen verfügbar, aber ein leistungsfähiger Eigenbetrieb bleibt vor allem für Einzelentwickler eine anspruchsvolle Hardwareaufgabe.
V4 Flash stellt den Parameter reasoning_effort bereit. Entwickler können damit Geschwindigkeit und Antworttiefe gegeneinander abwägen:
Damit muss nicht jede Anfrage im langsamsten Modus laufen. Ein Klassifikations- oder Extraktionsdienst kann den schnellen Modus verwenden, während ein Coding-Agent für mehrstufige Planung auf Think High oder Think Max umschaltet .
Die API-Preise von DeepSeek V4 Flash liegen bei 0,14 US-Dollar pro Million Input-Tokens, wenn der Inhalt nicht aus dem Cache kommt, und bei 0,28 US-Dollar pro Million Output-Tokens . Für wiederverwendete Eingabepräfixe, etwa Systemanweisungen oder häufige Prompts, sinkt der Preis auf 0,0028 US-Dollar pro Million Tokens – eine Reduktion um 98 Prozent .
Mehrere Marktübersichten bezeichnen V4 Flash deshalb als eine der günstigsten Frontier-APIs. Beim Output liegt der Preis laut einem Vergleich 54-mal unter dem von Sonnet 4.6 mit 15 US-Dollar pro Million Tokens und 107-mal unter dem von GPT-5.5 mit 30 US-Dollar . Solche Vergleiche hängen allerdings vom jeweiligen Anbieter, Modellstand und Abrechnungszeitpunkt ab.
Für Entwickler ist der praktische Effekt klar: Aufgaben wie Zusammenfassen, Routing, Extraktion, Code-Unterstützung und wiederholte Agentenaufrufe können deutlich günstiger skaliert werden als mit vielen konkurrierenden Spitzenmodellen.
Die Version V4-Flash-0731 soll vor allem bei Coding- und Agentenaufgaben zugelegt haben. DeepSeek führt die Verbesserung auf weiteres Post-Training zurück, nicht auf eine neue Architektur . In den veröffentlichten Ergebnissen werden unter anderem folgende Werte genannt:
DeepSeek erklärt, die Produktionsversion erreiche bei Agenten- und Coding-Benchmarks ein vergleichbares Niveau wie das größere V4 Pro . Damit wird die klassische Einordnung „Pro ist leistungsstark, Flash ist nur schnell und günstig“ zumindest für bestimmte agentische Workloads weniger eindeutig .
Exakte SWE-bench-Werte für V4-Flash-0731 konnten in den ausgewerteten Berichten jedoch nicht unabhängig bestätigt werden . Die veröffentlichten Zahlen sollten daher nicht automatisch auf jede Software-Engineering-Aufgabe übertragen werden.
Am 1. August 2026 begann DeepSeek, Open-Source-Entwickler für die geschlossene Beta von DeepSeek Harness zu suchen . Ein Harness ist in diesem Zusammenhang eine Ausführungsumgebung rund um ein Sprachmodell. Sie übernimmt unter anderem Kontextverwaltung, Tool-Aufrufe und die Koordination mehrerer Arbeitsschritte .
Der Name tauchte erstmals im Changelog von V4-Flash-0731 mit dem Hinweis auf, das System werde „bald veröffentlicht“ . Ein konkreter Veröffentlichungstermin wurde bislang nicht genannt .
Die Einladung richtet sich an Entwickler von Open-Source-Projekten mit Erfahrung im Bereich Agent Harness. Für die Bewerbung sollen sie ihre GitHub-ID und repräsentative eigene Arbeiten einreichen . Das deutet darauf hin, dass DeepSeek zunächst Feedback von einer spezialisierten Entwicklergemeinschaft sammeln will, bevor das Framework breiter verfügbar wird.
Das Harness-Projekt wird von Cui Tianyi geleitet. Das zugehörige Engineering-Team soll im März 2026 aufgebaut worden sein, als Cui zu DeepSeek kam . Angaben zu früheren Stationen bei TSY Capital und Jane Street stammen bislang nur aus einem einzelnen Blogbeitrag und konnten nicht unabhängig bestätigt werden.
DeepSeeks Linie lässt sich auf eine einfache Formel bringen: leistungsfähige Modelle zu möglichst niedrigen Kosten und mit offenen Gewichten. Das Preisniveau von 0,14 beziehungsweise 0,28 US-Dollar pro Million Tokens und die MIT-Lizenz sind die sichtbarsten praktischen Ausprägungen dieser Strategie . In der Branchenberichterstattung wird dieser Ansatz mit CEO Liang Wenfengs Ziel verbunden, kostengünstige, leistungsfähige Modelle als Baustein auf dem Weg zu allgemeiner künstlicher Intelligenz zu entwickeln .
In China konkurriert DeepSeek unter anderem mit Alibaba und dessen Qwen-Modellen, ByteDance mit Doubao, Moonshot AI, MiniMax und Z.AI . Die V4-Familie nimmt dabei eine besondere Position ein, weil sie in dieser Leistungsklasse offene Gewichte, ein 1-Million-Token-Kontextfenster und eine permissive MIT-Lizenz kombiniert .
Berichte über mögliche Vorbereitungen für einen Börsengang von DeepSeek kursieren ebenfalls. Ein konkreter Zeitplan, beteiligte Banken oder bestätigte Einreichungen sind jedoch nicht belegt .
DeepSeek V4 Flash richtet sich vor allem an Entwickler und Unternehmen, die viele Modellaufrufe benötigen, lange Kontexte verarbeiten oder agentische Coding-Workflows aufbauen wollen. Die niedrigen API-Kosten machen Experimente und hohe Anfragevolumen attraktiv. Die MIT-Lizenz eröffnet zusätzlich die Möglichkeit, das Modell anzupassen und selbst zu betreiben.
Der Haken liegt in der Infrastruktur: Ein vollständiger lokaler Betrieb mit langem Kontext erfordert erhebliche GPU-Ressourcen. Außerdem sind einige viel zitierte Leistungs- und Unternehmensangaben noch nicht unabhängig bestätigt. Sicher ist dennoch: Mit V4 Flash verschiebt DeepSeek erneut die Diskussion darüber, wie viel ein leistungsfähiges KI-Modell kosten muss – und wie offen seine Nutzung sein kann.