Verbeterde DeepSeek V4 Flash kost per taak 60 procent minder dan GPT-5.6 Luna
DeepSeek heeft V4 Flash 0731 uitgebracht, een verbeterde versie van de in april verschenen V4 Flash. Deze nieuwe versie doet nauwelijks onder voor GPT-5.6 Luna van OpenAI, maar is wel zo'n 60 procent goedkoper.
Dat blijkt uit de Artificial Analysis Intelligence Index, die AI-modellen op verschillende gebieden beoordeelt. Het gaat bijvoorbeeld om wiskunde, programmeren en redeneren.
Het verbeterde model krijgt in de index 50 punten, evenveel als Gemini 3.6 Flash en slechts één punt minder dan GPT-5.6 Luna. Ter vergelijking: de vorige versie van V4 Flash scoorde 40 punten. Het model is dan ook op veel gebieden verbeterd. Het is vooral beter geworden in agentic taken, waarbij het zelfstandig beslissingen neemt en acties uitvoert. Volgens Artificial Analysis doet het dat nu vrijwel even goed als GPT-5.6 Luna. Verder hallucineert het veel minder dan voorheen.
De intelligentie van GPT-5.6 Luna en DeepSeek V4 Flash is nagenoeg gelijk, maar de prijzen zijn dat niet. OpenAI verlaagde de prijzen van GPT-5.6 Luna onlangs met 80 procent. Zelfs na die prijsdaling zijn de kosten per taak bij DeepSeek V4 Flash 60 procent lager dan bij GPT-5.6 Luna, aldus de Intelligence Index.
Aan de architectuur van DeepSeek V4 Flash is verder niets gewijzigd. V4 Flash 0731 bevat net als zijn voorganger 284 miljard parameters en heeft een contextvenster van een miljoen tokens. DeepSeek V4 Flash 0731 is beschikbaar via Hugging Face.
Lees meer
Reacties (71)
Zeer dicht bij State of the Art modellen en op openrouter is een cache hit slechts $0,0028 per miljoen tokens.
Voor een vergelijking tussen modellen, kijk hoe groot het verschil in kosten: https://openrouter.ai/com...lm-5.2/moonshotai/kimi-k3
Dat is praktisch gratis! Een klein model zelf hosten op een Macbook kost nog meer aan elektriciteit denk ik.
Maar dat gaan we komende weken zien want er komt een nieuwe versie van het legendarische model Qwen 3.6 36B!
Wat een tijd om mee te maken. Wekelijkse de grens van menselijke kennis verlegd.
[Reactie gewijzigd door ApexAlpha op 3 augustus 2026 13:19]
Iemand eigenlijk een idee in welke mate deze Chinese modellenbureau gesubsidieerd worden om de token prijs laag te houden? Zit dat in dezelfde grootordes als Chatgpt en consoorten, of meer/minder/niet?Dat is praktisch gratis! Een klein model zelf hosten op een Macbook kost nog meer aan elektriciteit denk ik.
Ik snap je punt maar het is maar hoe je er naar kijkt en het gebruikt. Ik maak me stilaan toch ook zorgen voor het afstompen van de menselijke kennis, als ik zie hoe verslaafd sommige er aan zijn. Waarmee ik niet wil zeggen dat dat bij jou het geval is, versta me dus niet verkeerdWat een tijd om mee te maken. Wekelijkse de grens van menselijke kennis verlegd.
Niet. Althans, dat kan ik niet met 100% zekerheid zeggen, maar:Iemand eigenlijk een idee in welke mate deze Chinese modellenbureau gesubsidieerd worden om de token prijs laag te houden?
Inference providers (bedrijven die open-weight modellen voor je draaien en waar jij dan per token kunt afrekenen voor het gebruik) draaien Chinese modellen vaak voor dezelfde kosten als de Chinese partij zelf. Als voorbeeld het recente Kimi K3, wat je bij Kimi kunt afnemen voor $3 input en $15 output (per miljoen tokens) en bij Melious.ai (een Duitse inference provider) voor €3 input en €15 output.
Ik vermoed dat alle providers hun token-prijzen niet subsidiëren. De subsidie zit op hun abonnementsmodellen, bij claude kun je bijvoorbeeld voor $200/maand gerust 100x zoveel ($20.000) aan tokens verbranden (tegen de tokenprijzen van claude zelf). Maar als je dat dus had gedaan op hun API-pricing dan zou je gewoon $20k betalen.
[Reactie gewijzigd door TheRien op 3 augustus 2026 16:57]
AI is een waanzinnig hulpmiddel. We moeten er alleen voor zorgen dat we de maatschappij niet ontwrichten door de drang naar innovatie. Zeker nu dat innovatie in Amerika enkel en alleen nog gedreven wordt door geld. De tijden van het creëren van een utopische leefwereld zijn al lang de deur uit.
Juist al die toolcalling is zeer standaard en praktisch altijd een cache hit wel.
Claude, OpenAI e.d. willen je allemaal abonnementen verkopen: Je betaalt iedere maand weer, ongeacht of je je tegoed nu gebruikt of niet.
Mocht je vertrouwelijke gegevens hebben, er is tegenwoordig Loes.AI. Ontwikkeld en gehost in Holland en is zo slecht nog niet.
De goedkopere subscripties zijn vaak een stuk goedkoper als je het echt veel gebruikt, maar duurder als je ze weinig gebruikt. Dus wat beter is hangt geheel van je eigen situatie af.
Als jij je 3e bericht stuurt, dan stuur je ook op nieuwe je 2 voorgaande berichten berichten en de antwoorden mee. Dan is het dus heel fijn als die input tokens wat goedkoper zijn.
In elk geval is het omzetten van tokenized tekst naar KV tensors een redelijk klusje, en daarna is het vooral tokens genereren, wat redelijk vlot gaat.
Het gaat hier dus wel om identieke cache: bit voor bit moet je hele stuk identiek zijn. De enige cache die dus zo'n beetje gedeeld kan worden tussen mensen is de system prompt - alles daarna is eigenlijk alleen jouw unieke cache. Maar zo zou je dus 1 pittige prompt laten werken met een goeie response, en vanaf deze 200k tokens in cache doorwerken - ook als je stapjes terug gaat en je vraag aanpast kan dit stukje cache gebruikt worden.
Het is tegelijkertijd dus een soort "reservering" van jouw context op een fysieke machine ergens.
Met elk volgend bericht wat je stuurt hoeft de hele input (system + jouw vragen + LLM's antwoorden) dus niet meer opnieuw opgebouwd te worden in KV-cache, tot aan de generatie.
Maar Deepseek v4 is 90% van de kwaliteit voor 0,001% van de prijs vergeleken met Fable.
Natuurlijk voor het gros van de mens lijkt het geweldig, die reviewen de code verder niet.
Heb Hermes tijdje draaiend gehad, nu weer even terug naar Opencode; ben er nog niet uit wat handiger/beter is.
Sinds vorige week Kimi K3 in gebruik, maar ook wel Deepseek V4 Pro gebruikt in de afgelopen tijd. Zal Hermes eens testen met de nieuwe Flash zoals je suggereert.
Dat laatste doe ik wel met een lokaal model ivm privacy. Maar alle infra beheren doet Deepseek v4 flash nu standaard.
Tot zaterdag wisselde ik ook wel eens naar Kimi voor hardnekkige bugs of langdurige sysadmin opdrachten maar met deze update niet meer nodig.
Eerder al eens Hermes alle projectwerk laten degeren naar Opencode, maar dat was niet heel betrouwbaar en hij deed vrij veel alsnog zelf.
Kimi K3 bevalt mij goed moet ik zeggen, stukje duurder wel, maar niks vergeleken bij de grote frontier models natuurlijk.
zo doe ik dat, want ik wil ook geen privedata naar deepseek.
Voor mij zou het echt enorm win-win zijn als ik een personal assistant heb die een beetje triage doet op m'n e-mail, planning en afspraken. Ben een chaoot en spendeer veel tijd aan "wat moet ik doen".
Overigens is de kwaliteit afhankelijk van het model dat je gebruikt, niet het harnas per se.
Zelfs V4 Flash 0731 kan ik straks locaal draaien op mijn rog flow z13 128GB met 40+tok/s, welke bijna Opus 4.8 performance levert. v4 pro zal Fable overtreffen terwijl het vele malen kleiner is.
Stel je eens voor wat we over 12 maanden locaal kunnen draaien.
Hopelijk upgraden ze die ook maar ook de nieuwe dense variant ben ik erg benieuwd naar.
Momenteel draai ik DeepSeek V4 Flash 0731, de Q2 (!) variant met 131k context op (ook) n 128G Strix Halo, maar met de default llamacpp parameters kom ik nog niet verder dan 15 tokens per seconde. Aardig, maar te langzaam om als daily driver te gebruiken momenteel.
Overigens lijkt het tot zover wel een heel fijn model te zijn, met m'n beperkte real-world ervaring.
Wat een maand, wat een maand: GLM 5.2, Kimi K3, Laguna, DeepSeek V4 0731, en zometeen Qwen 3.8... het kan niet op...
Als je even naar de afbeelding met de benchmark scores kijkt, zie je dat Fable 5 minder scoort dan Opus 5. Als je van beide modellen gebruik hebt gemaakt (ik gebruik het voor wiskunde, bewijzen en dergelijke, en zo nu en dan programmeren) merk je dat dit nergens op slaat, Fable 5 is een groter model met echt nauwkeurigere antwoorden en een stuk meer natuurlijk inzicht (wiskundige intuïtie, eleganter programmeren, etc).
Kortom, deze benchmarks zijn erg onbetrouwbaar, er wordt veel gedaan aan het optimaliseren van LLMs specifiek voor de benchmark tests, terwijl de intelligentie van een model totaal anders kan zijn in de praktijk.
Je kan puur op basis van één zon getal echt niet concluderen dat het model evengoed is als Gemini 3.6 flash, en nauwelijks onder doet aan GPT 5.6 Luna...
Ik zou als journalistieke redactie toch echt een beetje voorzichtiger zijn met claims uit de AI wereld direct overnemen, er valt vaak veel op af te dingen. (denk ook aan de marketing claims over het losbreken van LLMs en hacks, of claims over Opus 5, van Anthropic zelf)
Nog even los van al die datacenters die nu gebouwd worden moeten gaan concurreren met de datacenters die over 10 jaar gebouwd worden met nieuwere hardware.
We gebruiken nu x86 CPU's met veredelde videokaarten.
Gaaf dat het kan. Maar wat zijn de kansen dat dat de meest efficiënte manier is.
Nu worden er miljarden gestoken in de hoop op een monopoliepositie. Terwijl de Westerse bedrijven nu al om de oren geslagen worden door de Chinezen op sommige fronten.
En toen bleken de miljarden aan hardware geen monopolie te geven en over een paar jaar net zo veel waard als een miljoen Overlayprojectoren.
Of het is net als het uitsterven van de videochip producenten 25 jaar geleden.
Die strijdt legt AMD en Nvidia ook geen windeieren achteraf.
Ik vindt het ook jammer dat de rest van het Westen ook altijd de VS maar blijft volgen. Je ziet toch al heel duidelijk dat het pad wat de Amerikanen met AI zijn ingeslagen helemaal niet het beste pad is. Het is vooral de volume zo snel mogelijk opkrikken en het overal in proppen in de hoop dat het werkt.Het zou maar zo kunnen dat er nog zoveel te optimaliseren is dat er zwaar overschat wordt hoeveel rekenkracht er nodig is.
Nog even los van al die datacenters die nu gebouwd worden moeten gaan concurreren met de datacenters die over 10 jaar gebouwd worden met nieuwere hardware.
[...]
Nu worden er miljarden gestoken in de hoop op een monopoliepositie. Terwijl de Westerse bedrijven nu al om de oren geslagen worden door de Chinezen op sommige fronten.
En toen bleken de miljarden aan hardware geen monopolie te geven en over een paar jaar net zo veel waard als een miljoen Overlayprojectoren.
Of het is net als het uitsterven van de videochip producenten 25 jaar geleden.
Die strijdt legt AMD en Nvidia ook geen windeieren achteraf.
Ik dacht dat Nieuwsuur een keer reportage gemaakt had over hoe veel verfijnder de Chinezen AI inzetten. Niet domweg het maar in features stoppen zonder concreet doel, nee echt een plan hebben.
We moeten als Westen gewoon erkennen dat China ons technologisch gaat inhalen of zelfs al ingehaald heeft. Alleen met zo'n factcheck kan je weer kijken naar hoe je beter moet worden. Het gaat op den duur ons ook duur te komen staan dat we ze nu voor allerlei zaken uitsluiten.
Je motiveert China in de huidige manier alleen nog maar meer. Nog onafhankelijker worden van anderen, waarbij wij alleen maar afhankelijker gaan worden van China.
Nu weet ik dat je als land met CCP aan de macht al een groot voordeel hebt tegenover een democratie, maar ik vind dat we het al een tijdje gewoon niet slim aanpakken.
Nieuwsberichten als dit bevestigen deze vermoeden.
De grote jongens gebruiken helemaal geen x86 CPU's...We gebruiken nu x86 CPU's met veredelde videokaarten.
Nee, ik wil geen China vs VS kant expliciet kiezen, maar ik denk dat het flink opschalen hoe nu de Amerikaanse bedrijven doen niet de manier is om AI groot te maken.
Het is wel een beetje typisch waar de VS voor staat... alles groot. Kijk maar naar bijvoorbeeld hun auto's. De auto's staan niet bijzonder bekend om hun kwaliteit, hun prettige rijvermogen of oog voor detail. Nee, het stond (voor de opkomst van verduurzaming van auto's) vooral bekend om het formaat en de grote bruto motoren & PK's.
Ik denk niet dat het in ons belang als EU is dat China grootser wordt, maar er lijkt ten minste een duidelijk plan achter te zitten.
[Reactie gewijzigd door Pasteis op 3 augustus 2026 13:16]
Heb je 128gb ram en een GPU kun je nog prima de Q3 of Q4 versie draaien.
Hier te downloaden: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
[Reactie gewijzigd door savale op 3 augustus 2026 17:09]
Wat doe je dan met die 256 GB Ram voor de CPU?
Enkel CPU ~4 tokens/sec
CPU + RTX3090 ~10 tokens/sec.
hoogstwaarschijnlijk zou een 2e RTX3090 het geheel wel boven de 15 tokens/sec tillen.
OpenAI verlaagde de prijzen van GPT-5.6 Luna onlangs met 80 procent. Zelfs na die prijsdaling zijn de kosten per taak bij DeepSeek V4 Flash 60 procent lager dan bij GPT-5.6 Luna, aldus de Intelligence Index.
de enige echte open source modellen komen voornamelijk uit labs in de VS, en volgens mij eentje uit FR, eentje uit JP, eentje is een UAE + VS samenwerking
er bestaan geen chinese open source modellen, op mogelijk kleinschalige uni projecten na
[Reactie gewijzigd door angushansen op 3 augustus 2026 14:21]
Om wat objectieve informatie erbij te halen, OSI's definitie van open source modellen https://opensource.org/ai/open-source-ai-definition - hier staat omschreven dat trainingsdata ook beschikbaar dient te zijn, om als Open Source model te worden aangemerkt.
Voor eindgebruikers maakt de definitie denk ik niet heel veel uit, als in: Ik denk dat de meesten al geholpen zijn met open weights, en een OSI-approved open source license als bijvoorbeeld Qwen3.6's Apache 2.0 (zie https://opensource.org/license/apache-2.0 en https://github.com/QwenLM/Qwen3.6/blob/main/LICENSE ).Code: The complete source code used to train and run the system. The Code shall represent the full specification of how the data was processed and filtered, and how the training was done. Code shall be made available under OSI-approved licenses.
- For example, if used, this must include code used for processing and filtering data, code used for training including arguments and settings used, validation and testing, supporting libraries like tokenizers and hyperparameters search code, inference code, and model architecture."
Om te kunnen reageren moet je ingelogd zijn
/u/396954/crop5ff1ad3a8a19d_cropped.png?f=community)
:strip_icc():strip_exif()/u/12112/snake_av.jpg?f=community)
:strip_exif()/u/454619/crop58a2ea512054d_cropped.gif?f=community)
:strip_icc():strip_exif()/u/432714/crop6287e94322cf6_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/190828/crop59a0f3ded6163_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/1318532/crop5f6baa8470c0d_cropped.jpeg?f=community)
/u/2384058/crop690f922f9407c_cropped.png?f=community)
:strip_exif()/u/13821/savale.gif?f=community)
/u/148738/crop56ff7585390b7_cropped.png?f=community)
:strip_icc():strip_exif()/u/290377/tweak.jpg?f=community)