DeepSeek V4.1 Flash unterstützt bis zu eine Million Token Kontext. Beim Verarbeiten der Eingabe aktiviert es rund 8 Milliarden Parameter pro Token, beim Generieren 16 Milliarden.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Wenn ein KI-Agent lange Gesprächsverläufe, Dokumente und Zwischenergebnisse immer wieder einliest, kann die Eingabe deutlich umfangreicher sein als seine Antwort. Für solche Aufgaben ist DeepSeek-V4.1-Flash ausgelegt: Das multimodale Mixture-of-Experts-Modell mit offen verfügbaren Gewichten unterstützt Kontext von bis zu einer Million Token. Diese Obergrenze bedeutet allerdings nicht, dass es jedes Detail einer entsprechend langen Sitzung zuverlässig wiederfindet. 2
8
Der Modellkern umfasst 552 Milliarden Parameter und ist als kausaler Encoder-Decoder mit zweimal 20 Schichten aufgebaut. Der Encoder verarbeitet die Eingabe; aus dessen letzten Zuständen wird der globale Key-Value-Cache (KV-Cache) des Decoders abgeleitet, statt ihn in jeder Decoder-Schicht separat zu erzeugen. Laut DeepSeek sind beim Prefill, also beim Einlesen der Eingabe, rund 8 Milliarden Parameter pro Token aktiv. Beim Decode, der Ausgabe neuer Token, sind es 16 Milliarden. Das ist besonders für Agenten interessant, die viel lesen und vergleichsweise wenig schreiben. 2
8
Hinzu kommt Compressed Sparse Attention 2 (CSA2). Dabei erhalten Attention-Schichten einen von drei festen Modi – Full, Reindex oder Reuse – und können zwischengespeicherte Informationen sowie Auswahlen für Sparse Attention wiederverwenden. Zusammen mit der Speicherung des wichtigsten KV-Caches im FP4-Format beziffert DeepSeek den globalen Cache-Bedarf auf 890 Byte pro Token: etwa ein Viertel des Werts von DeepSeek-V4-Flash. Das ist ein Vergleich der Cache-Größe, keine Messung der gesamten Betriebskosten in jeder Umgebung. 6
8
Eine weitere Technik, SWA Bounded Replay, stellt fehlende KV-Zustände der Sliding-Window-Attention wieder her, indem sie nur das jüngste Token-Fenster erneut verarbeitet. Diese Zustände müssen dadurch nicht dauerhaft auf einer SSD liegen. Für den dauerhaft gespeicherten KV-Cache nennt die Modellbeschreibung etwa ein Achtel des Bedarfs von V4-Flash. Dieser Wert beschreibt etwas anderes als das Viertel beim globalen KV-Cache. 5
9
Eine Modellauflistung beschreibt ein Training von Grund auf mit einem multimodalen Korpus von 45 Billionen Token. Sparse Attention wurde demnach mit Sequenzen von 64.000 Token trainiert; bei einem Trainingsstand von 34 Billionen Token wurde der Kontext auf eine Million Token erweitert. DeepSeek verweist außerdem auf neue Vortrainingsmethoden und ein umfangreicheres Nachtraining mit Reinforcement Learning. Die angeführten Quellen belegen keine genauere Rezeptur dieses Nachtrainings. 9
16
Das Modell verarbeitet Bilder und Text nativ; DeepSeek nennt auch multimodale Unterstützung für die API. Detaillierte Ergebnisse aus Bildverarbeitungs-Benchmarks gehen aus den hier angeführten Auszügen nicht hervor. 2
16
In DeepSeeks eigenen Auswertungen liegt das Basismodell bei Wissen, Schlussfolgern und Programmieren etwa auf dem Niveau von V4-Pro-Base. Auf zurückgehaltenen Tests meldet DeepSeek 5 bis 10 Prozent bessere Ergebnisse – bei etwa einem Drittel der Gesamtparameter und einem Viertel der aktivierten Parameter. Für die veröffentlichte Modellversion beansprucht das Unternehmen zudem Vorteile gegenüber V4-Pro bei Agentenaufgaben. Die vorliegenden Auszüge erlauben dafür jedoch keinen belastbaren Vergleich einzelner Benchmarks. Es handelt sich um berichtete Ergebnisse, nicht um einen unabhängigen Direktvergleich. 1
16
Für die DeepSeek-API lautet der Modellname deepseek-flash. Die veröffentlichten Gewichte sind laut Modellmaterial unter der MIT-Lizenz verfügbar. Für die Bereitstellung wird SGLang beschrieben; Modellauflistungen nennen auch Transformers und vLLM für die Inferenz. Welche Langkontext- und Bildfunktionen tatsächlich nutzbar sind, sollte für die jeweilige Laufzeitumgebung geprüft werden. 8
9
16
DeepSeek bezeichnet V4-Flash und V4-Flash-Vision-Exp als eingestellt; ihre bisherigen API-Namen werden vorübergehend an V4.1-Flash weitergeleitet. Für Anfragen an deepseek-v4-pro kündigte das Unternehmen ab dem 14. September 2026 ebenfalls eine Weiterleitung an V4.1-Flash zu Flash-Tarifen an, bis V4.1-Pro erscheint. Wer auf spezifisches Pro-Verhalten angewiesen ist, sollte deshalb das tatsächlich antwortende Modell prüfen – nicht nur den verwendeten Alias. 16
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
DeepSeek V4.1 Flash unterstützt bis zu eine Million Token Kontext. Beim Verarbeiten der Eingabe aktiviert es rund 8 Milliarden Parameter pro Token, beim Generieren 16 Milliarden.
DeepSeek V4.1 Flash unterstützt bis zu eine Million Token Kontext. Beim Verarbeiten der Eingabe aktiviert es rund 8 Milliarden Parameter pro Token, beim Generieren 16 Milliarden. CSA2, FP4 Speicherung und SWA Bounded Replay senken laut DeepSeek unterschiedliche Teile des KV Cache Bedarfs; die Vergleichszahlen sind keine pauschale Kostenersparnis.
Das Modell ist über den API Namen deepseek flash erreichbar. Leistungsangaben gegenüber V4 Pro stammen aus berichteten Auswertungen, nicht aus einem unabhängigen Direktvergleich.