Naar de inhoud
AI Side

DeepSeek V4.1 Flash: de nieuwe Chinese AI-revolutie in prijs-prestatie

Geschreven door Gab

Inhoud

DeepSeek V4.1 Flash wordt door @kimmonismus gepresenteerd als een bijzonder snelle evolutie, zes weken na de V4-Flash-update van juli. Zijn bericht neemt de belangrijkste cijfers over: een Causal Encoder Decoder-architectuur, 552 miljard MoE-parameters, waarvan 8 miljard actief bij de invoer en 16 miljard tijdens het genereren, evenals een KV-cache die is teruggebracht tot een kwart van het HBM-geheugen en een achtste van de SSD-opslag van de vorige generatie. Hij voegt eraan toe dat DeepSeek nu beter zou presteren dan DeepSeek V4 Pro op het gebied van capaciteit, kosten en snelheid, en dat het V4 Pro-verkeer vanaf 14 september tijdelijk naar V4.1 Flash moet worden gerouteerd.

Deze lezing komt in grote lijnen overeen met de aankondiging, maar legt vooral de nadruk op het tempo van de releases en de productsprong. De officiële thread schetst een vollediger beeld: de verbeteringen worden niet alleen toegeschreven aan de architectuur, maar ook aan nieuwe pre-trainingsmethoden en een op grotere schaal uitgevoerde RL-post-training. Achter de boodschap over een „intelligenter, sneller en efficiënter” Flash-model schuilt vooral een operationele verandering in de hoeveelheid geheugen die nodig is voor inferentie over lange contexten, een doorslaggevend onderwerp voor AI-agents.

De door @kimmonismus gedeelde grafiek laat bovendien een minder eenduidige werkelijkheid zien dan het marketingverhaal: DeepSeek V4.1 Flash is concurrerend in verschillende evaluaties, maar domineert de meest geavanceerde modellen niet systematisch op Terminal-Bench.

Grafiek waarin DeepSeek V4.1 Flash wordt vergeleken met Kimi-K3, GLM-5.3, Opus5 en GPT5.6-Sol op vier benchmarks, waaronder Terminal-Bench

De post van @kimmonismus, gepubliceerd op 10 september, is expliciet gebaseerd op de thread van het officiële DeepSeek-account. Dit punt is belangrijk: de cijfers, de migratie van de endpoints en de prestatiebeloften zijn in eerste instantie afkomstig van de ontwikkelaar van het model, en niet van de analist die ze heeft samengevat.

Dit is de bronpost, enkele uren eerder gepubliceerd door DeepSeek:

De officiële thread: een nieuwe familie, niet zomaar een Flash-update

In zijn eerste bericht presenteert @deepseek_ai V4.1 Flash als „the smallest model in our new architecture family”, met native visueel begrip. De positionering is duidelijk: Flash is niet langer alleen een lichtere variant, maar het eerste model van een familie die is ontworpen voor snelheid, doorvoer en schaalbaarheid.

Het tweede deel van de thread gaat dieper in op de architectuur. DeepSeek V4.1 Flash is gebaseerd op een MoE met 552 miljard parameters, maar gebruikt niet bij elke stap het volledige netwerk. Volgens DeepSeek zijn slechts 8 miljard parameters actief tijdens de verwerking van de invoer, en vervolgens 16 miljard tijdens het genereren.

Deze asymmetrie vormt de kern van de Causal Encoder Decoder-architectuur. Het verwerken van de context en het produceren van nieuwe tokens hebben niet langer dezelfde kosten en doen niet precies een beroep op dezelfde resources. Voor toepassingen waarbij een omvangrijke context moet worden gelezen voordat een relatief kort antwoord wordt gegenereerd, kan deze scheiding de kosten-prestatieverhouding verbeteren.

De officiële tabel vergelijkt V4.1 Flash met V4 Pro 0813, V4 Flash 0731 en verschillende concurrenten. Daarin worden voor V4.1 Flash onder meer scores vermeld van 30,0 op Terminal-Bench 3.0, 31,2 op Terminal-Bench 4.0 en 74,2 op DeepSWE v1.1.

Benchmarktabel waarin DeepSeek V4.1 Flash, DeepSeek V4 Pro, GLM 5.3, Kimi K3, GPT 5.6-Sol en Claude Opus 5 worden vergeleken

Belangrijkste benchmarks van DeepSeek V4.1 Flash

BenchmarkAangekondigde score voor V4.1 FlashInterpretatie
Terminal-Bench 3.030,0V4.1 Flash presteert in de officiële tabel beter dan GLM 5.3.
Terminal-Bench 4.031,2Het model blijft achter bij GLM 5.3, dat een score van 37,9 behaalt.
DeepSWE v1.174,2Een resultaat dat door DeepSeek wordt benadrukt voor software-engineeringtaken.

DeepSeek stelt dat zijn nieuwe pre-trainingsmethoden, gecombineerd met een ambitieuzere RL-post-training, het model vóór toonaangevende systemen plaatsen, waaronder DeepSeek V4 Pro. Deze verduidelijking is belangrijk ten opzichte van de samenvatting van @kimmonismus: de architectuur speelt een centrale rol, maar verklaart op zichzelf niet de geclaimde scores.

De officiële formulering is bewust eenvoudig:

"Kleinere KV-cache. Grotere besparingen." @deepseek_ai

De meest concrete belofte van V4.1 Flash is dus niet noodzakelijk een hogere ruwe score, maar een aanzienlijk lager geheugengebruik voor langdurige en repetitieve workloads.

De KV-cache van DeepSeek, de echte hefboom voor agents

De KV-cache slaat de benodigde representaties op om te voorkomen dat bij elk gegenereerd token de volledige context opnieuw moet worden berekend. Dit geheugen is essentieel voor lange gesprekken, agents die tools aanroepen, codeworkflows, iteratieve zoekopdrachten en systemen die een uitgebreide geschiedenis bewaren.

DeepSeek kondigt aan dat de cache van V4.1 Flash nog slechts het volgende vereist:

  • Een kwart van het HBM-geheugen dat de vorige generatie nodig had.
  • Een achtste van de SSD-opslag die voorheen nodig was.
  • Ongeveer 890 bytes per token aan globale cache, tegenover 3.514 bytes voor V4 Flash volgens de door het bedrijf gepubliceerde grafiek.

De officiële visualisatie toont een spectaculaire daling sinds DeepSeek-V1: 389.120 bytes per token voor V1, 48.068 voor V3.2, 3.514 voor V4 Flash en vervolgens 890 voor V4.1 Flash.

Grafiek die de verkleining van de globale KV-cache per token toont, van 389.120 bytes op DeepSeek V1 tot 890 bytes op DeepSeek V4.1 Flash

Voor een beheerder van agents kan deze winst structureler zijn dan een marginaal verschil op een benchmark. Cachehits vormen vaak een aanzienlijk deel van de kosten wanneer een agent regelmatig een omvangrijke context hergebruikt. Door deze cache te comprimeren, nemen zowel de druk op het GPU-geheugen als de benodigde opslagcapaciteit op grote schaal af.

Dat is precies wat @datachad opmerkt in de reacties op de post van @kimmonismus:

"the kv-cache cut to a quarter of hbm is the one that matters for local inference" @datachad

Die observatie klopt, maar moet worden genuanceerd. Een compactere DeepSeek-KV-cache maakt AI-self-hosting toegankelijker voor infrastructuren die al over de nodige apparatuur beschikken. Daarmee wordt een MoE-model met 552 miljard parameters echter nog geen software die eenvoudig op een pc kan worden uitgevoerd.

DeepSeek erkent dit indirect wanneer het zelf spreekt over implementaties van een geheel andere omvang:

"Planning a large-scale deployment with 2,000 GPUs + a storage cluster? Let’s talk." @deepseek_ai

De cachewinst verbetert de kostenefficiëntie van de dienstverlening aanzienlijk, maar neemt de hardwarebarrière als gevolg van de omvang van het model niet weg.

Het model en het technische rapport zijn beschikbaar via de Hugging Face-pagina van DeepSeek-V4.1-Flash en het technische rapport van DeepSeek V4.1. Het materiaal dat in de thread beschikbaar is, maakt het echter niet mogelijk om de details te bevestigen die @UnslothAI in een reactie noemt over ‘196B engram’. Dit gegeven mag daarom niet als een geverifieerde specificatie worden beschouwd zonder het technische rapport rechtstreeks te raadplegen.

Een API-transitie die van Flash het standaardproduct maakt

De aankondiging beperkt zich niet tot de promotie van een nieuw model. Ze reorganiseert ook het DeepSeek-aanbod.

De officiële thread vermeldt het volgende:

  1. V4 Flash en V4 Flash Vision Exp worden uitgefaseerd.
  2. De oude identifiers deepseek-v4-flash en deepseek-v4-flash-vision-exp worden tijdelijk doorgestuurd naar V4.1 Flash om de compatibiliteit te behouden.
  3. Vanaf 14 september 2026 om 04:00 UTC worden ook verzoeken voor DeepSeek V4 Pro naar V4.1 Flash gerouteerd.
  4. Deze situatie blijft van kracht tot de lancering van V4.1 Pro.
  5. Voor verzoeken die vanuit V4 Pro worden gemigreerd, gelden de tarieven van V4.1 Flash.

Deze beslissing gaat veel verder dan een promotionele vergelijking. DeepSeek maakt van V4.1 Flash zijn belangrijkste API-product, nog vóór de komst van V4.1 Pro. Voor teams die de API al gebruiken, verkleint de migratie het risico op een onmiddellijke onderbreking. Toch blijft het nodig om de uitvoer, latentie, toolaanroepen, native vision-functionaliteit en het gedrag van het model in productie opnieuw te valideren.

@bygregorr vat het probleem samen vanuit het perspectief van applicatiebouwers:

"Six weeks between architecture families is a short runway for API builders." @bygregorr

DeepSeek reageert hierop met tijdelijke compatibiliteit en door de oude identifiers door te sturen. Dit is een pragmatische oplossing om de continuïteit van de dienstverlening te waarborgen, maar geen garantie voor perfecte functionele gelijkwaardigheid. Een agentische applicatie die gevoelig is voor uitvoerformaten, toolaanroepen of redeneerbeleid zal hoe dan ook opnieuw moeten worden getest.

De prijstabel van DeepSeek vermeldt per miljoen tokens verschillende prijzen naargelang het tijdstip. Buiten de piekuren bedraagt de prijs 0,003 dollar voor invoer met cache, 0,15 dollar voor invoer zonder cache en 0,6 dollar voor uitvoer. Tijdens de piekuren stijgen deze bedragen respectievelijk naar 0,006, 0,3 en 1,2 dollar.

Tabel met API-tarieven voor DeepSeek V4.1 Flash, met prijzen tijdens dal- en piekuren

DeepSeek verduidelijkt dat de dalurenprijzen 50% van de piekurenprijzen bedragen. Deze tariefstructuur maakt flexibele workloads economisch aantrekkelijker, met name batchverwerking, geautomatiseerde evaluaties en niet-synchrone agentische taken.

Een post van een derde partij, @ns123abc, die in de bredere discussie wordt genoemd, spreekt van een uitvoering die ongeveer 86 keer goedkoper per miljoen tokens is en een doorvoer van 420 tot 507 tokens per seconde. Deze cijfers kunnen bijdragen aan het debat, maar komen niet voor in de aangeleverde officiële thread. Ze moeten daarom worden beschouwd als beweringen van een derde partij die afhankelijk zijn van de hardware, de contextlengte, het kwantisatieniveau en de geteste belasting, en niet als door DeepSeek bevestigde gegevens.

Terminal-Bench: aangekondigde dominantie, maar geen universeel oordeel

DeepSeek beweert dat „tests by multiple parties” V4.1 Flash vóór V4 Pro plaatsen wat betreft prestaties, kosten, snelheid en totale uitvoeringstijd. Deze bewering kan de vergelijkende positionering ondersteunen, maar de thread bevat onvoldoende informatie over de protocollen, providers, inferentie-instellingen of exacte samenstelling van deze tests.

Het voornaamste twistpunt betreft Terminal-Bench, een benchmark die nauwlettend wordt gevolgd om agentische vaardigheden op computers en bij het programmeren te evalueren.

@Greg_GL_87 wijst op een ogenschijnlijke inconsistentie tussen twee versies van de evaluatie:

"the table has it losing Terminal-Bench 4.0 to GLM 5.3, 31.2 vs 37.9, but winning 3.0. weird split for two versions of the same eval" @Greg_GL_87

Deze kritiek is in de thread onbeantwoord gebleven. Ze is specifiek en belangrijk. De officiële tabel vermeldt inderdaad 31,2 voor V4.1 Flash op Terminal-Bench 4.0, terwijl @Greg_GL_87 deze score vergelijkt met de 37,9 van GLM 5.3. Tegelijkertijd behaalt V4.1 Flash 30,0 op Terminal-Bench 3.0 en scoort het daar beter dan GLM 5.3.

Een model kan V4 Pro op meerdere indicatoren verslaan zonder de beste keuze te zijn voor alle agentische programmeertaken. Zonder een gedetailleerd protocol blijft het onmogelijk om vast te stellen of het verschil tussen Terminal-Bench 3.0 en 4.0 voortkomt uit de taken, omgevingen, testparameters of een andere methodologische factor.

@kryptosopus formuleert een breder bezwaar door V4.1 Flash met Claude Opus 5 te vergelijken:

"Native vision baked into the smallest model but it still loses Terminal-Bench to Opus5 by 13 points. Flash is clearly the "cheap and fast" play, not the frontier one. The scaling line at the bottom is the real tell here" @kryptosopus

Deze interpretatie is niet volledig in tegenspraak met die van DeepSeek. V4.1 Flash kan volgens verschillende door het bedrijf gekozen maatstaven beter zijn dan DeepSeek V4 Pro, terwijl het op een bepaalde agentische benchmark achterblijft bij Opus 5. Het probleem ontstaat wanneer een relatieve verbetering binnen een modellenreeks wordt omgezet in een claim van algehele superioriteit.

Reacties: open-source-enthousiasme, voorzichtigheid rond het product en vragen over de toekomstige Pro-versie

De reacties op de officiële thread zijn overwegend enthousiast over het openstellen van het model en de snelle integratie ervan. @MrAhmadAwais geeft bijvoorbeeld aan dat V4.1 Flash al beschikbaar is binnen zijn CommandCodeAI-aanbod. @Presidentlin prijst vooral de bijdrage van DeepSeek aan het open-source-ecosysteem:

"Thank you again for moving Open Source forward" "As always oblig" "How high will your ceiling go?!!" @Presidentlin

De reactie ging vergezeld van een mangapagina die deze mix van fascinatie en uitdaging tegenover het tempo van DeepSeek verbeeldt.

Zwart-witte mangapagina gepubliceerd door Presidentlin, met de vraag How high tegenover dreigende silhouetten

@ParthM1001 vat de sfeer op zijn beurt samen met een culinaire metafoor:

"The whale has cooked something beautiful again." @ParthM1001

Antropomorfe blauwe walvis met koksmuts die in een keuken een mes vasthoudt, afbeelding gepubliceerd door ParthM1001

De reacties op de post van @kimmonismus richten zich meer op de positionering van de modellenreeks. @elshayib_ vindt dat de oudere Pro-versie haar relevantie verliest:

"V4 pro kinda irrelevant now" @elshayib_

@kimmonismus antwoordt daarop:

"yeah, just waiting for another release of the pro version" @kimmonismus

Dit antwoord strookt met de officiële aankondiging: V4 Pro wordt inderdaad tijdelijk uitgefaseerd, maar DeepSeek kondigt expliciet een toekomstige V4.1 Pro aan. De conclusie dat de volledige Pro-reeks definitief overbodig is, gaat dus verder dan de vastgestelde feiten.

Dezelfde vraag duikt op bij @RimasXYZ:

"Als Flash v4-pro nu overtreft op het gebied van capaciteiten, kosten en snelheid, waarop kan v4.1-pro zich dan nog onderscheiden?" @RimasXYZ

De thread geeft geen antwoord op deze vraag. De definitie van het toekomstige Pro-product blijft volledig open: betere kwaliteit bij moeilijke taken, sterkere redeneercapaciteiten, een langere context, hogere betrouwbaarheid voor agenttoepassingen of een ander prestatiecompromis.

Causal Encoder Decoder-architectuur: wat er technisch verandert

De reactie van @austinyuhao, « welkom terug, encoder-decoder », is kort maar relevant. DeepSeek stelt niet alleen cachecompressie voor, maar introduceert opnieuw een architecturale scheiding tussen het causale encoderpad en de decoder.

"welkom terug, encoder-decoder" @austinyuhao

Het schema dat in het antwoord wordt gedeeld, toont een Causal Encoder en een Decoder van elk twintig lagen, voor een netwerk van in totaal veertig lagen. Ook de componenten MoE, CSA2, SWA, Vision Encoder, Text Embedding, Engram, DSpark en Candidate Pool zijn erop te zien.

Schema van de DeepSeek V4.1 Flash-architectuur met causale encoder, decoder, MoE-blokken en multimodale componenten

Deze opzet verklaart waarom multimodale inferentie en de KV-cache met elkaar samenhangen. DeepSeek wil native ondersteuning voor beeldverwerking bieden en tegelijkertijd de kosten voor lange sequenties binnen de perken houden. Deze belofte is bijzonder aantrekkelijk voor agents die documenten moeten lezen, interfaces moeten analyseren, code moeten verwerken en een persistent werkgeheugen moeten behouden.

FAQ over DeepSeek V4.1 Flash

Hoeveel parameters zijn actief in DeepSeek V4.1 Flash?

DeepSeek kondigt een MoE-model met 552 miljard parameters aan. Daarvan zouden slechts 8 miljard parameters actief zijn tijdens de verwerking van de invoer en vervolgens 16 miljard tijdens het genereren.

Waarom is de KV-cache van DeepSeek belangrijk voor AI-agents?

De KV-cache bewaart de representaties van de context die al is verwerkt. Een compactere cache vermindert de benodigde hoeveelheid GPU-geheugen en opslagruimte, wat de kosten kan verlagen van lange gesprekken, agents met toolaanroepen en workflows die vaak dezelfde context hergebruiken.

Wat gebeurt er met gebruikers van DeepSeek V4 Pro?

Vanaf 14 september 2026 om 04:00 UTC moeten verzoeken die bestemd zijn voor DeepSeek V4 Pro tijdelijk worden doorgestuurd naar V4.1 Flash, tot de lancering van V4.1 Pro. De betrokken teams moeten hun productiegebruik opnieuw valideren, ook al blijft de API-compatibiliteit tijdens de overgang behouden.

Wat u moet onthouden

DeepSeek V4.1 Flash is niet zomaar opnieuw een snelle update. De aankondiging combineert een nieuwe asymmetrische architectuur, een verschillende MoE-activering voor invoer en generatie, een sterke compressie van de KV-cache, agressieve API-tarieven en een concrete migratie van verkeer vanuit V4 Pro.

Voor professionals zijn de gevolgen duidelijk:

  • De kleinere KV-cache kan de kosten van agents met een lange context aanzienlijk verlagen.
  • Zelfhosting van AI wordt realistischer voor operators die al over een omvangrijke infrastructuur beschikken.
  • De omleiding van V4 Pro naar Flash vereist een fase waarin applicaties opnieuw worden gevalideerd.
  • De geclaimde prestaties ten opzichte van V4 Pro volstaan niet om superioriteit op alle agentbenchmarks aan te tonen.
  • Terminal-Bench blijft een aandachtspunt, met name vanwege het verschil tussen versie 3.0 en 4.0 dat door @Greg_GL_87 is vastgesteld.

De thread laat dus verschillende vragen onbeantwoord: welke protocollen onderbouwen de « tests door meerdere partijen », waarom verschillen de resultaten per versie van Terminal-Bench, wat wordt de onderscheidende rol van V4.1 Pro en met welke hardwareconfiguratie wordt zelfhosting werkelijk praktisch?

De meest redelijke conclusie is ook de nuttigste: V4.1 Flash lijkt een grote stap vooruit op het gebied van efficiëntie en implementatie, maar bewijst nog niet dat een Flash-model de kenmerkende compromissen van frontiermodellen heeft weggenomen.

Lees in een andere taal