DeepSeek V4.1 Flash verscheen op 10 september 2026 als het actuele Flash model met native ondersteuning voor tekst en afbeeldingen. De eerdere API modellen V4 Flash en V4 Flash Vision Exp zijn uitgefaseerd; de oude modelnamen blijven tijdelijk werken maar worden afgehandeld door V4.1 Flash tegen Flash tarieven.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What are DeepSeek V4.1 Flash’s launch date, global OpenRouter adoption, relationship to the earlier V4 Flash, V4 Flash Vision, and V4 Pro of. Article summary: DeepSeek-V4.1-Flash launched on September 10, 2026. It is an open-weight, multimodal successor to the V4 Flash line that prioritizes long-context and inference efficiency; however, several claims about its market adoptio. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4.1-Flash is op 10 september 2026 uitgebracht als een nieuw open-weight, multimodaal model. De opvallendste verandering zit niet alleen in de modelomvang: DeepSeek koppelt een mixture-of-experts-model (MoE) met 552 miljard parameters aan schaarse activering en een veel kleinere KV-cache. Dat moet zeer lange contexten praktischer maken tijdens inferentie. 17
35
Voor nieuwe integraties via de DeepSeek-API is deepseek-flash de aanbevolen modelnaam. Die verwijst naar V4.1 Flash, dat naast tekst ook afbeeldingen native kan verwerken. 15
17
De eerdere modellen V4 Flash en de experimentele V4 Flash Vision Exp zijn uitgefaseerd. De oude identifiers deepseek-v4-flash en deepseek-v4-flash-vision-exp worden tijdelijk nog geaccepteerd, maar verzoeken gaan naar V4.1 Flash en worden gefactureerd tegen het Flash-tarief. 15
23
V4 Pro blijft een apart geval. Eerdere berichten over de overgang stelden dat V4 Pro-verkeer voorlopig naar V4.1 Flash zou worden omgeleid, in afwachting van V4.1 Pro. In de latere officiële API-changelog staat echter dat DeepSeek, na vraag van gebruikers, de V4 Pro-API ook na 14 september 2026 blijft aanbieden, met ongewijzigde facturering. Gebruik daarom de huidige, gedocumenteerde model-ID's en voer regressietests uit als reproduceerbaar gedrag belangrijk is. Ga er niet blind van uit dat een oude route altijd naar V4.1 Flash wijst. 15
23
V4.1 Flash is een Mixture-of-Experts-model met 552 miljard backboneparameters. Bij deze aanpak wordt per token slechts een geselecteerd deel van het model ingezet, in plaats van alle parameters tegelijk te laten rekenen.
Volgens DeepSeek zijn tijdens de verwerking van invoer (prefill) 8 miljard parameters actief, en tijdens het genereren van uitvoer (decoding) 16 miljard. De onderliggende opzet heet een Causal Encoder–Decoder-architectuur. Dat onderscheid is relevant, omdat lange prompts en lange antwoorden verschillende kosten voor inferentie veroorzaken. 17
35
Schaarse activering maakt een model overigens niet automatisch in elke omgeving goedkoop of snel. Doorvoer en kosten hangen ook af van hardware, batching, kwantisatie, servingsoftware, contextlengte en de mix van verzoeken. Wel is deze keuze de kern van het efficiëntieprofiel dat DeepSeek voor het model beoogt.
V4.1 Flash ondersteunt een context van maximaal 1 miljoen tokens. 35
Bij zulke lange gesprekken, documenten of codebases vormt de key-value-cache (KV-cache) vaak het praktische knelpunt. Dit is de opgeslagen attentietoestand die het model gebruikt wanneer het ieder volgend token genereert. Hoe langer prompt en antwoord worden, hoe groter de geheugendruk op een inference-server.
Volgens de modelkaart leidt de Causal Encoder–Decoder-opzet de globale KV-cache van de decoder af uit de laatste verborgen toestanden van de encoder, in plaats van die afzonderlijk uit elke decoderlaag op te bouwen. In combinatie met Compressed Sparse Attention 2 en FP4 KV-caching komt de globale KV-cache volgens DeepSeek uit op circa 890 bytes per token — ongeveer een kwart van de vergelijkbare voetafdruk van DeepSeek V4 Flash. 35
39
Dat betekent niet dat elke taak met 1 miljoen tokens automatisch goedkoop of betrouwbaar is. Maximale contextcapaciteit is iets anders dan consequent relevante informatie terugvinden, redeneren of instructies volgen over de volledige invoer. Teams met grote codebases, documentverzamelingen of lange agentgeschiedenissen doen er goed aan recall, latentie en kosten op eigen representatieve workloads te testen.
DeepSeek heeft de gewichten van V4.1 Flash op Hugging Face gepubliceerd onder de MIT-licentie. Daarmee kunnen organisaties het model downloaden en implementeren onder de voorwaarden van die licentie. 35
Dat biedt een alternatief voor uitsluitend API-gebaseerde modellen: organisaties kunnen het model op eigen infrastructuur beoordelen en meer invloed houden op hun servingstack. Zelf hosten blijft wel complex, zeker bij een backbone van 552 miljard parameters, maar de open release biedt ruimte voor eigen optimalisaties.
DeepSeek zegt dat nieuwe pretrainingmethoden en grootschaligere post-training met reinforcement learning leiden tot benchmarkresultaten vóór die van vlaggenschipmodellen, waaronder V4 Pro. Het bedrijf verwijst ook naar tests van meerdere partijen die V4.1 Flash hoger zouden plaatsen op prestaties, kosten, snelheid en totale doorlooptijd. 17
Dat zijn relevante, maar grotendeels leveranciersgerapporteerde resultaten — geen universeel eindoordeel. Benchmarks hangen af van taakselectie, prompts, toolconfiguratie, beoordelingsmethode en de geteste modelversie. Test vóór een productiemigratie beide modellen op wat werkelijk telt: complexe redenering, acceptatiegraad bij code, toolgebruik, multimodale nauwkeurigheid, betrouwbaarheid, veiligheidsmaatregelen, latentie en totale kosten.
V4.1 Flash arriveerde in een markt waarin DeepSeek en andere Chinese modelaanbieders al veel routed gebruik zagen. OpenRouter rangschikt modellen op het aantal prompt- en completiontokens dat via zijn eigen API wordt verwerkt. In de ranglijst van 13 september stond DeepSeek V4.1 Flash op 4,94 biljoen tokens, gemarkeerd als nieuw. DeepSeek V4 Flash 0731 stond op 11,6 biljoen, V4 Flash 0423 op 4,36 biljoen en Xiaomi MiMo-V2.5 op 7,77 biljoen tokens. 57
Eerdere momentopnames lieten zien hoe snel zulke ranglijsten kunnen omslaan: in augustus noteerde V4 Flash 7,1 biljoen wekelijkse tokens en bestonden negen van de tien meest gebruikte modellen in die ranglijst uit Chinese modellen. 50
De kanttekening is belangrijk: OpenRouter-tokens meten verkeer dat via OpenRouter loopt, niet al het mondiale AI-gebruik, bedrijfsimplementaties, omzet of modelkwaliteit. De cijfers zijn een bruikbaar signaal van vraag op een ontwikkelaarsplatform, maar geen bewijs dat een model de bredere markt heeft gewonnen.
De belangrijkste reden om V4.1 Flash te evalueren is de combinatie van native multimodaliteit, een contextvenster van 1 miljoen tokens, open weights en een architectuur die het geheugenverbruik bij lange inferentie moet verlagen. 17
35
Een verstandige migratieaanpak is:
deepseek-flash voor nieuwe Flash-integraties.De technische claims rond V4.1 Flash zijn aanzienlijk, vooral de globale KV-cache van 890 bytes per token en de schaarse activering. De werkelijke betekenis zal afhangen van de vraag of die voordelen zich ook vertalen naar betrouwbare en betaalbare prestaties op de workloads die ontwikkelaars daadwerkelijk draaien.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash verscheen op 10 september 2026 als het actuele Flash model met native ondersteuning voor tekst en afbeeldingen.
DeepSeek V4.1 Flash verscheen op 10 september 2026 als het actuele Flash model met native ondersteuning voor tekst en afbeeldingen. De eerdere API modellen V4 Flash en V4 Flash Vision Exp zijn uitgefaseerd; de oude modelnamen blijven tijdelijk werken maar worden afgehandeld door V4.1 Flash tegen Flash tarieven.
OpenRouter noteerde op 13 september 4,94 biljoen verwerkte tokens voor V4.1 Flash, terwijl oudere V4 Flash varianten en Xiaomi MiMo V2.5 eveneens veel verkeer hadden.