De laatste twee dagen van juli brachten twee prijsgebeurtenissen die de API-rekening van iedere organisatie die AI inzet direct raken. Geen roadmap-aankondigingen, maar harde getallen.

DeepSeek V4-Flash: zelfde prijs, drastisch beter

Op 31 juli 2026 maakte DeepSeek de officiële algemeen beschikbare versie van V4-Flash-0731 beschikbaar. Wat opvalt: het model heeft exact dezelfde architectuur en hetzelfde parametertaantal (284 miljard) als de preview, maar DeepSeek voerde alleen de post-training opnieuw uit — gericht op agentisch redeneren.

Het resultaat is opzienbarend. Op negen gepubliceerde agent-benchmarks klopt V4-Flash nu zijn eigen vlaggenschip V4-Pro-Preview:

BenchmarkV4-Flash 0731V4-Pro-PreviewFlash Preview
Terminal Bench 2.182,772,161,8
DeepSWE54,47,3
DSBench-FullStack68,737,0

De prijs bleef ongewijzigd: $0,14 per miljoen input-tokens (cache miss), $0,0028 bij cache-hit, $0,28 output. Ter vergelijking: op Terminal Bench 2.1 behaalt Claude Opus 4.8 een score van 85,0 — een verschil van 2,3 punten, bij een veel hoger prijspunt.

Voor professionals die agentische workflows bouwen (automatische document­verwerking, codereviews, data-extractie) is dit een significante verschuiving: je krijgt nu Pro-kwaliteit tegen Flash-tarieven, zonder wijzigingen in je API-aanroepen.

OpenAI: GPT-5.6 Luna 80% goedkoper

Een dag eerder, op 30 juli, kondigde OpenAI via CNBC aan dat GPT-5.6 Luna 80% goedkoper wordt. De nieuwe tarieven:

  • Luna input: $0,20/M tokens (was $1,00)
  • Luna output: $1,20/M tokens (was $6,00)
  • Terra input: $2,00/M tokens (was $2,50, -20%)
  • Sol: ongewijzigd

OpenAI verklaart de verlaging door efficiëntiewinsten in het inferentieproces, deels gerealiseerd door Sol zelf zijn eigen inferentiestack te laten herschrijven. Luna en Terra kunnen nu werklasten aan die voorheen een duurder model vereisten.

Wat betekent dit voor je toolkeuze? Luna is nu goedkoper dan Claude Sonnet 4.6 ($3,00/M input) en goedkoper dan DeepSeek V4-Flash voor output, maar duurder voor input. Terra begeeft zich in het segment van GPT-klasse modellen voor gestructureerde verwerkingstaken.

Wat verander je nu?

Een paar praktische overwegingen:

Agentische pipelines: DeepSeek V4-Flash is nu de meest kostenefficiënte keuze als agent-backbone, mits je de AVG-aandachtspunten van een Chinees model accepteert (verwerking buiten EU, geen SCCs gepubliceerd). Organisaties met strenge data-locatie-eisen kunnen beter bij EU-gehoste modellen blijven.

Batch-verwerking en extractie: OpenAI Luna op $0,20/M input is nu interessant voor grote documentvolumes waarbij je eerder GPT-5.6 Sol te duur vond. Check of nauwkeurigheid voldoet aan jouw use case voor je switcht.

Rekensom bij overstap: zet de benchmarkverschillen af tegen je feitelijke workload. Terminal Bench 2.1 meet agentic code-taken; voor juridische samenvatting of klantenservice-antwoorden kunnen de verhoudingen anders liggen.

Voor een volledig overzicht van prijzen per model zie onze modellenpagina. Branchespecifieke tools per sector vind je onder /voor/.


Bronnen: DeepSeek blog – V4-Flash GA · CNBC – OpenAI prijsverlaging · American Bazaar – Luna -80% · Cosmic JS – V4-Flash benchmarks