De meeste modellen beslissen zelf hoe lang ze nadenken. DeepSeek V4 legt die knop bij jou neer, en het verschil tussen de standen is groter dan je zou verwachten.
Drie standen, één model
DeepSeek-V4-Pro en het lichtere V4-Flash ondersteunen allebei drie redeneermodi. Je kiest ze per verzoek, dus je hoeft niet van model te wisselen.
Non-think slaat het redeneerspoor over en antwoordt meteen. Think High doet bewuste, stapsgewijze analyse: langzamer, maar preciezer. Think Max rekt dat op tot het uiterste, met een speciale systeemprompt en een fors langer denkspoor.
Wat het oplevert
DeepSeek publiceert per stand benchmarkscores voor V4-Pro, en die maken de keuze concreet:
| Taak | Non-think | Think High | Think Max |
|---|---|---|---|
| LiveCodeBench (code) | 56,8 | 89,8 | 93,5 |
| GPQA Diamond (wetenschap) | 72,9 | 89,1 | 90,1 |
| Humanity’s Last Exam | 7,7 | 34,5 | 37,7 |
| MMLU-Pro (brede kennis) | 82,9 | 87,1 | 87,5 |
Lees die tabel van onder naar boven. Bij MMLU-Pro — feitenkennis waar het antwoord er min of meer al is — levert denken 4,6 punt op. Bij LiveCodeBench, waar het model iets moet uitwerken en testen, is het verschil 37 punten. En bij Humanity’s Last Exam, ontworpen om echt moeilijk te zijn, gaat Non-think simpelweg onderuit: 7,7 procent is bijna niets.
De sprong zit bijna helemaal tussen Non-think en Think High. Van High naar Max wint je meestal een paar punten, tegen aanzienlijk meer tokens en wachttijd.
Zo kies je
- Non-think — samenvatten, herschrijven, classificeren, vertalen, korte vragen. Alles waar het antwoord in één keer op tafel kan.
- Think High — je standaardstand voor werk. Code schrijven en debuggen, wiskunde, planning, analyses met meerdere stappen.
- Think Max — reserveer hem. Voor de lastige refactor, het bewijs dat niet wil kloppen, de agentische taak die twintig stappen moet overzien.
Praktische volgorde: begin bij Think High. Kom je er niet, zet dan Max aan voor precies dat ene verzoek. Andersom werken — altijd Max en alleen terugschakelen als het te traag wordt — kost je onnodig veel tokens aan taken die het niet nodig hadden.
Als je hem zelf draait
Beide modellen staan onder MIT-licentie op Hugging Face, dus commercieel gebruik mag en de weights zijn vrij te downloaden. Serveren gaat het makkelijkst met vLLM of SGLang, allebei met een OpenAI-compatibele API:
pip install vllm
vllm serve "deepseek-ai/DeepSeek-V4-Pro"
Drie dingen om te weten voordat je begint:
- Sampling. DeepSeek raadt lokaal
temperature = 1.0entop_p = 1.0aan. Dat is hoger dan je van andere modellen gewend bent; lager zetten maakt het redeneren juist slechter. - Contextvenster bij Think Max. Reserveer minimaal 384K tokens. Het denkspoor telt mee, en loopt de context vol, dan breekt het antwoord halverwege af.
- Geen chattemplate. V4-Pro komt zonder Jinja-template. In plaats daarvan zit er een
encoding-map bij met Python-scripts die berichten in OpenAI-formaat omzetten naar de juiste invoerstring — en het antwoord weer uit elkaar halen.
Draai je liever niet zelf, dan is het hosted alternatief er ook, maar houd dan de kanttekening bij DeepSeek in het achterhoofd: voor gevoelige bedrijfsdata weegt de Chinese herkomst van de hosted API mee in je afweging. Via een EU-provider of self-hosting speelt dat niet.
Wil je weten hoe DeepSeek V4 zich verhoudt tot de rest van de open-weight lichting, lees dan de beste open-weight AI-modellen van deze zomer. Voor de bredere context rond Chinese modellen en exportregels schreef hetlaatsteainieuws.nl over China’s antwoord op de exportban.
Stand van zaken: benchmarkscores, licentie en aanbevolen instellingen gecontroleerd op 4 september 2026 tegen de modelkaart van DeepSeek op Hugging Face. DeepSeek noemt de V4-serie daar zelf nog een preview-versie, dus reken op bijstellingen. Prijzen per token verschillen per provider en zijn hier bewust niet genoemd.
