Search this site
14069 resultaten gevonden met een lege zoekopdracht
- Hoeveel houdt Microsoft na de AI-rekening over voor dividend?
In het kort Microsoft verhoogde in september het kwartaaldividend naar $0,98 per aandeel. Dat is een tastbare uitkering en past bij een onderneming die in boekjaar 2026 $331,8 miljard omzet en $133,7 miljard nettowinst rapporteerde. Toch vertelt het dividend niet hoeveel kas structureel overblijft. Microsoft investeert tegelijk uitzonderlijke bedragen in datacenters, chips, netwerk en langlopende leases voor AI. Bij $525,18 op 5 oktober aan de Nasdaq en ruim 31 keer de recente winst moet die capaciteit sneller omzet en vrije kas opleveren dan zij kapitaal opslokt. Microsoft heeft meerdere kasmachines. Office en andere productiviteitssoftware leveren terugkerende abonnementen. Azure verkoopt cloudcapaciteit. Beveiliging, Dynamics, LinkedIn, Windows, gaming en advertenties vullen de mix aan. Die spreiding maakt de winst stabieler dan bij een pure cloudleverancier. AI verandert echter de kapitaalintensiteit. Software kon historisch groeien met relatief weinig fysieke activa; generatieve AI vraagt veel servers en energie voordat de omzet volledig zichtbaar is. Direct naar een onderdeel van dit artikel Het dividend is betaalbaar, maar niet gratis AI-capex loopt eerder door de kas dan de winst De waardering vraagt meer dan omzetgroei Concurrentie en kapitaaldiscipline Drie scenario’s Het dividend is betaalbaar, maar niet gratis Een kwartaaldividend van $0,98 betekent $3,92 per aandeel op jaarbasis. Bij ongeveer 7,4 miljard aandelen kost dat grofweg $29 miljard per jaar. Tegen de koers van $525,18 is het directe rendement rond 0,75%. Dat is laag. De beleggingsthese draait dus niet om het dividend als inkomen, maar om groei van winst en vrije kas per aandeel. Bij de resultaten over het vierde kwartaal en boekjaar 2026 meldde Microsoft $90 miljard kwartaalomzet, $40,6 miljard operationele winst en 43% groei van Azure. Tegelijk zijn de investeringen zwaar. Vrije kasstroom is operationele kasstroom minus contante investeringen. Die maatstaf laat sneller dan de winst zien hoeveel de bouw van AI-infrastructuur vandaag kost. De kasbrug maakt de keuze zichtbaar. Bij $150 miljard operationele kas, $110 miljard contante capex, $29 miljard dividend en $16 miljard inkoop blijft in het voorbeeld $5 miljard negatief over. Microsoft kan zo’n tekort tijdelijk opvangen met kas of schuld. Structureel moet de operationele kas sneller groeien, capex normaliseren of de uitkering worden aangepast. In onze eerdere analyse van Microsofts kapitaalkeuzes staat waarom zelfs een zeer winstgevende onderneming niet iedere dollar tweemaal kan uitgeven. De analyse van het orderboek laat daarnaast zien dat contractwaarde pas omzet en kas wordt wanneer Microsoft de dienst levert. AI-capex loopt eerder door de kas dan de winst Een datacenter wordt niet volledig als kostenpost geboekt in het jaar van betaling. De investering komt op de balans en wordt over jaren afgeschreven. Daardoor kan de vrije kasstroom vandaag dalen terwijl de winst pas later de volledige last voelt. Leases maken het beeld nog complexer: capaciteit kan economisch zijn vastgelegd zonder dat alle toekomstige betalingen al in contante capex staan. Dat verschil is voor beginners belangrijk. Winst meet opbrengsten en kosten volgens boekhoudregels. Vrije kas meet hoeveel geld na de investeringen overblijft. Geen van beide is op zichzelf perfect. Samen laten zij zien of groei al rendabel is of vooral vooruit wordt gekocht. Microsoft kan zware investeringen rechtvaardigen wanneer Azure en AI-diensten jarenlang sterke omzet tegen goede marges leveren. Bezettingsgraad is daarbij cruciaal. Een datacenter dat vol zit met betalende workloads kan hoge vaste kosten verdelen. Ongebruikte capaciteit drukt het rendement. De relevante controlepunten zijn Azure-groei, Microsoft Cloud-brutomarge, operationele kas, nieuwe infrastructuurverplichtingen en vrije kas per aandeel. Bij $55 miljard vrije kas en drie jaar 8% dividendgroei is de dekking in de module ongeveer 1,5 keer. Dat is ruim genoeg, maar veel smaller dan een vergelijking met de nettowinst suggereert. Als vrije kas door capex naar $35 miljard daalt, wordt dezelfde dividendgroei veel krapper. Dividendgroei is dus een vertrouwenstekens, geen garantie dat de capexcyclus al rendabel is. De waardering vraagt meer dan omzetgroei Microsoft sloot op 5 oktober op $525,18. De recente winst per aandeel lag rond $16,80. Dat geeft ongeveer 31 keer winst en een beurswaarde rond $3,9 biljoen. De markt kent een premie toe voor de kwaliteit van Office, Azure en de balans. Die premie kan blijven wanneer de winst per aandeel dubbelcijferig groeit en de vrije kas later herstelt. Bij 29 keer winst in 2029 en 7% gewenst jaarlijks koersrendement is ongeveer $22,40 winst per aandeel nodig. Dat vraagt een duidelijke stijging tegenover de recente basis, maar sluit aan bij de huidige groeikracht wanneer cloud en AI sterk blijven. De gevoeligheid zit in de eindmultiple. Bij 23 keer winst is veel meer EPS nodig voor dezelfde koers. De volgende cijfers worden volgens de koersendienst op 4 november verwacht. De markt verwacht ongeveer $4,70 winst per aandeel. Let naast omzet en EPS op de toelichting over capex, beschikbare capaciteit en cloudmarge. Een kwartaal met snelle Azure-groei maar een veel lagere kasstroom kan nog steeds economisch aantrekkelijk zijn, mits management overtuigend laat zien wanneer het rendement volgt. Concurrentie en kapitaaldiscipline Amazon en Google investeren eveneens in AI-datacenters. OpenAI, Anthropic en andere modellen kunnen vraag naar Azure vergroten, maar vragen ook onderhandelingsmacht en infrastructuur. Microsoft ontwikkelt eigen chips en software om kosten te beheersen. Eigen silicium verlaagt niet automatisch de totale kosten; benutting, softwarecompatibiliteit en productievolume bepalen het voordeel. Het sterkste positieve argument is distributie. Microsoft kan Copilot en AI-functies aanbieden aan bestaande Office-, GitHub-, beveiligings- en Azure-klanten. Dat verlaagt verkoopkosten en maakt bundeling mogelijk. Het sterkste tegenargument is dat bundeling de zichtbare omzet per product vertroebelt. Een hogere contractwaarde zegt niet hoeveel extra kas specifiek uit AI komt. Aandeleninkoop moet eveneens nuchter worden bekeken. Microsoft koopt aandelen in maar geeft ook aandelen aan werknemers. Alleen netto daling van het verwaterde aandeelental verhoogt het winstrecht per aandeel. Dividend, inkoop en kas op de balans mogen niet nogmaals als aparte groeimotor bovenop EPS worden gezet. Drie scenario’s De drie paden zetten verschillende kas- en waarderingsaannames naast elkaar. Het bearscenario combineert hoge capex, lagere cloudmarge en multiplekrimp. Het middenpad veronderstelt sterke Azure-groei, herstel van vrije kas en dividendgroei rond 8%. In het gunstige scenario raakt AI-capaciteit snel gevuld en groeit kas per aandeel sterk. De mogelijke koersen in dollars voor 2027, 2028 en 2029 zijn scenario’s, geen koersdoelen. Dividend staat los van deze koersen en komt bovenop of wordt door de vrije kas beperkt. De dividendverhoging is een positief signaal van vertrouwen. De belangrijkste rekensom staat echter in de datacenters. Wanneer iedere nieuwe capexdollar genoeg cloudomzet en kas oplevert, kan Microsoft groei en uitkeringen samen dragen. Wanneer vrije kas lang achterblijft, wordt $525,18 vooral een weddenschap op later rendement. De auteur heeft geen positie in Microsoft.
- DeepSeek halveert buiten piekuren de prijs maar niet het risico
In het kort DeepSeek V4.1 Flash kost buiten de opgegeven piekuren de helft. Voor grote batchvolumes is dat nuttig, maar bij kleine volumes blijven herstelwerk en versiecontrole belangrijker. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij DeepSeek draait de dragende vraag om off-peakplanning afzetten tegen de veel grotere kosten van fouten en herhaalrondes. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is DeepSeek V4.1 Flash ondersteunt volgens de officiële documentatie een contextvenster van een miljoen tokens, beeldinvoer en standaard ingeschakeld denken. Tijdens piekuren kost een cachemiss $0,30 per miljoen inputtokens en output $1,20. Buiten die uren zijn de tarieven respectievelijk $0,15 en $0,60. De documentatie noemt als piekblokken 01.00 tot 04.00 en 06.00 tot 10.00 UTC op werkdagen, met uitzonderingen voor Chinese feestdagen. De cachehitprijs daalt van $0,006 naar $0,003. De DeepSeek API-prijsdocumentatie dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Een bedrijf met uitstelbaar nachtwerk kan taken buiten de piekblokken plannen en de directe tokenrekening halveren. Dat is vooral relevant bij miljoenen vergelijkbare documenten. Bij een klein team gaat het echter om enkele euro’s per maand. Dan is één uur menselijk herstel duurder dan een groot deel van de API-factuur. De planner moet dus eerst foutpercentages en doorlooptijd meten en pas daarna op daluren optimaliseren. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Piekuren € 11, Daluren € 5, Dal met 75% cachehit € 4. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 65 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 1.2 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 2 uur, het middenscenario bij 8 uur en het hoge bij 20 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Piekuren kunnen in lokale tijd verschuiven door zomertijd en de feestdagenuitzondering maakt een vaste kalender kwetsbaar. Ook kan een wachtrij te laat klaar zijn voor een bedrijfsproces. Ten slotte verandert een lage tokenprijs niets aan privacy, beschikbaarheid of aliaswijzigingen. Een vaste testset en versieadministratie blijven nodig. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is DeepSeek interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat off-peakplanning afzetten tegen de veel grotere kosten van fouten en herhaalrondes de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Vanaf 200.000 tokens wordt de hele Grok-prompt duurder
In het kort xAI hanteert voor Grok 4.7 een hogere prijs zodra een prompt 200.000 tokens of meer bevat. Dan worden niet alleen de extra tokens, maar de hele invoer en uitvoer duurder. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij Grok draait de dragende vraag om de scherpe prijsdrempel bij 200.000 prompttokens en het nut van vooraf compacten. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is xAI noemt voor Grok 4.7 een contextvenster van 500.000 tokens. Bij een prompt onder 200.000 tokens geldt $2 per miljoen inputtokens en $6 per miljoen outputtokens. Vanaf 200.000 prompttokens wordt de hele aanvraag afgerekend tegen $4 en $12. De cached-inputprijs verdubbelt tegelijk van $0,50 naar $1. Voor de regionale endpoint in de Verenigde Staten geldt daarnaast een factor 1,1. Dat is een klif, geen geleidelijk tarief. De xAI-prijsdocumentatie dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Een dossier van 198.000 tokens kan daardoor veel goedkoper zijn dan hetzelfde dossier met één extra bijlage. Vooraf dedupliceren, oude conversatiegeschiedenis samenvatten en irrelevante bestanden uitsluiten heeft direct financieel effect. Het gaat niet alleen om de paar verwijderde tokens. Onder de grens blijft de volledige aanvraag in de lagere tariefklasse. Een teller vóór verzending en een waarschuwing rond 185.000 tokens zijn daarom zinvoller dan achteraf alleen de maandfactuur bekijken. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: 190.000 prompttokens € 440, 210.000 prompttokens € 960, Verschil € 520. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 11.520 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 209.5 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 120 uur, het middenscenario bij 240 uur en het hoge bij 390 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Compactie kan context verliezen en een opdracht kunstmatig onder de grens duwen. Een financieel document met meerdere bijlagen mag niet worden ingekort zonder te controleren wat wegvalt. Ook is de drempel gebaseerd op de prompt, niet op het geadverteerde contextvenster. Teams moeten hun daadwerkelijke tokenisatie meten en niet afgaan op pagina’s, woorden of bestandsgrootte. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is Grok interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat de scherpe prijsdrempel bij 200.000 prompttokens en het nut van vooraf compacten de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Claude kan sneller of goedkoper werken maar niet tegelijk
In het kort Anthropic biedt bij Opus 5.5 een snelle modus en daarnaast batchverwerking met korting. De ene route koopt wachttijd terug, de andere halveert de tokenrekening. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij Anthropic Claude draait de dragende vraag om de keuze tussen snelle interactieve verwerking en batchkorting voor uitstelbaar werk. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is Anthropic rekent voor Opus 5.5 standaard $4 per miljoen inputtokens en $20 per miljoen outputtokens. Fast mode staat als preview op $8 en $40. De batchroute halveert de standaardprijzen naar $2 en $10, maar fast mode is niet samen met Batch te gebruiken. Voor Claude 4.6 en nieuwer voegt de keuze voor uitsluitend verwerking in de Verenigde Staten bovendien een factor 1,1 toe aan alle tokenprijscategorieën. Snelheid, verwerkingstijd en datalocatie zijn daarmee afzonderlijke prijsbeslissingen. De Anthropic-prijsdocumentatie dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Interactief werk heeft waarde wanneer een medewerker op het antwoord wacht en onmiddellijk door moet. Nachtelijke classificatie, rapportage en evaluatie hebben die wachttijd vaak niet. Daar kan batchverwerking dezelfde Opus-laag gebruiken tegen de helft van het standaardtarief. Een werkverdeler kan urgente verzoeken naar standaard of fast mode sturen en uitstelbaar werk verzamelen voor batch. Zo koopt het bedrijf alleen snelheid op het moment dat die de doorlooptijd echt verkort. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Fast mode € 320, Standaard € 160, Batch € 80. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 1.920 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 34.9 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 24 uur, het middenscenario bij 58 uur en het hoge bij 104 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Fast mode belooft geen betere inhoud, alleen een snellere route. Een duurder antwoord dat daarna toch menselijke correctie vraagt, levert weinig op. Batch heeft op zijn beurt een andere operationele dynamiek: fouten worden later ontdekt en een hele verzameling taken kan opnieuw moeten. Ook de 10 procent toeslag voor een specifieke datalocatie hoort in een privacybesluit, niet als losse IT-korting te worden weggepoetst. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is Anthropic Claude interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat de keuze tussen snelle interactieve verwerking en batchkorting voor uitstelbaar werk de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Bij Gemini kan bronzoeken duurder worden dan het antwoord
In het kort Gemini 3.5 Flash combineert goedkope batchtokens met Google Search-grounding. Bij veel zoekopdrachten groeit juist de gereedschapsrekening sneller dan de taalmodelkosten. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij Google Gemini draait de dragende vraag om de kosten van zoekgrounding scheiden van de tokenrekening. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is Google vermeldt voor Gemini 3.5 Flash $1,50 per miljoen inputtokens en $9 per miljoen outputtokens. Batchverwerking halveert die bedragen naar $0,75 en $4,50. Voor Google Search-grounding geldt over Gemini 3.x-modellen een gedeelde vrije ruimte van 5.000 verzoeken per maand. Daarna rekent Google $14 per 1.000 zoekverzoeken. De opslag van expliciet gecachte context staat los op $1 per miljoen tokens per uur, naast $0,15 voor de gecachte input. De Google Gemini API-prijzen dienen daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Een nieuwsagent kan weinig tokens gebruiken en toch veel zoeken. De rekening loopt dan per groundingverzoek, terwijl een lange samenvatting vooral outputtokens kost. De eerste optimalisatie is daarom niet automatisch een kleiner model, maar minder dubbele zoekopdrachten, een cache voor reeds gecontroleerde bronnen en een heldere stopregel. Batch helpt vervolgens bij samenvattingen die niet direct hoeven te verschijnen. Zo worden bronverwerving en tekstgeneratie twee afzonderlijk meetbare kostenposten. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Tokens standaard € 66, Zoeken na vrije ruimte € 42, Totaal € 108. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 1.296 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 23.6 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 17 uur, het middenscenario bij 43 uur en het hoge bij 82 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Minder zoeken kan ook minder dekking betekenen. Een harde limiet zonder kwaliteitsmeting vergroot de kans dat een afwijkende bron wordt gemist. Caching heeft bovendien een tijdsdimensie: langdurige opslag kan duurder worden dan de tokenkorting bespaart. De optimale instelling verschilt dus tussen een actuele nieuwsmonitor en een stabiel documentarchief. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is Google Gemini interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat de kosten van zoekgrounding scheiden van de tokenrekening de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Een miljoen tokens context maakt GPT-6 nog geen archiefkast
In het kort OpenAI geeft Astra, Sol en Luna een contextvenster van 1,05 miljoen tokens, maar lang invoeren is nog geen zorgvuldig zoeken. De zakelijke winst zit vaak in selectie en hergebruik. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij OpenAI GPT draait de dragende vraag om de economische grens tussen een groot contextvenster en gerichte documentselectie. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is De actuele OpenAI-modelpagina noemt voor GPT-6 Astra een invoerprijs van $10 en een uitvoerprijs van $50 per miljoen tokens. GPT-6.1 Sol staat op $2 en $10, terwijl GPT-6 Luna $0,10 en $0,50 kost. Alle drie vermelden een contextvenster van 1,05 miljoen tokens en maximaal 128.000 outputtokens. De kennisgrens ligt bij Astra en Sol op 30 april 2026 en bij Luna op 18 mei 2026. Dat grote venster is een technische bovengrens, geen kwaliteitsbewijs voor een willekeurige stapel documenten. De OpenAI-modeldocumentatie dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Wie een volledig data-archief bij iedere vraag meestuurt, betaalt niet alleen meer input. Het model moet ook langer voorbewerken en de kans groeit dat een belangrijk detail tussen irrelevante pagina’s verdwijnt. Een betere route maakt eerst een kleine zoekindex, selecteert relevante passages en stuurt alleen die context mee. De duurdere Astra-laag kan vervolgens worden gereserveerd voor dossiers waarin interpretatiefouten werkelijk kostbaar zijn. De architectuur verdient zich dus terug via contextdiscipline, niet via het grootste mogelijke venster. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Astra € 550, Sol € 110, Luna € 6. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 1.320 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 24.0 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 18 uur, het middenscenario bij 42 uur en het hoge bij 78 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Samenvatten en retrieval kunnen relevante uitzonderingen wegfilteren. Daarom moet een testset ook vragen bevatten waarvan het antwoord in een voetnoot, bijlage of afwijkende tabel staat. Daarnaast zijn uitvoertokens bij alle drie de varianten vijf keer zo duur als inputtokens. Een workflow die onnodig lange analyses laat schrijven, kan de besparing van contextselectie weer weggeven. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is OpenAI GPT interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat de economische grens tussen een groot contextvenster en gerichte documentselectie de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Krijg je de btw op een thuisbatterij echt helemaal terug?
In het kort Een thuisbatterij valt nog steeds onder het btw-tarief van 21 procent. Teruggaaf is onder voorwaarden mogelijk bij stroomhandel, maar alleen zonnestroom bewaren voor eigen gebruik geeft dat recht niet. Wie alle aanschaf-btw terugvraagt en de batterij ook privé gebruikt, kan daarna jaarlijks btw verschuldigd zijn over dat privégebruik. Bij een aankoop van 6.050 euro laat onze berekening zien waarom de teruggaaf van 1.050 euro niet het eindbedrag van het voordeel is. 6.050 euro betalen en 1.050 euro terugkrijgen klinkt als een eenvoudige besparing. Het is ook een echte verlaging van de eerste netto uitgave, als de koper aan de voorwaarden voldoet. Alleen is het geen korting van 21 procent op de consumentenprijs. De teruggaaf bedraagt 1.050 gedeeld door 6.050, oftewel 17,36 procent van het betaalde bedrag. En daarmee is de fiscale rekening nog niet af. De Consumentenbond wijst er in zijn op 12 september bijgewerkte uitleg op dat leveranciers vaak prijzen exclusief btw tonen, terwijl teruggaaf slechts onder voorwaarden mogelijk is. Met het einde van salderen op 1 januari 2027 in zicht verdient juist die kleine regel onder de prijs aandacht. Een batterij moet geld besparen door passend gebruik. Een belastingteruggaaf kan helpen, maar vervangt die besparing niet. Direct naar een onderdeel van dit artikel Een prijs zonder btw is geen nieuw nultarief Alleen eigen zonnestroom opslaan geeft geen recht op teruggaaf Privégebruik kan een deel van de teruggaaf weer kosten De kleineondernemersregeling vraagt om de juiste volgorde De batterij moet na de teruggaaf nog steeds geld verdienen Drie scenario's tonen wat er in 2027 tot en met 2029 overblijft Een prijs zonder btw is geen nieuw nultarief Volgens de actuele tariefuitleg van de Belastingdienst blijven de levering en installatie van een thuisbatterij belast met 21 procent btw. Het nultarief voor zonnepanelen op of bij woningen geldt dus niet automatisch voor de opslag ernaast. De politiek heeft wel over verandering gesproken. De motie-Grinwis van 3 juni 2026, gepubliceerd op 4 juni, vroeg het kabinet te onderzoeken of een regeling zoals in Duitsland nuttig en nodig is. Een verzoek om zo'n regeling te bezien is nog geen ingevoerde vrijstelling. Voor de koper telt de geldende behandeling van de factuur, niet de verwachting dat een volgend plan gunstiger wordt. Bij een prijs van 5.000 euro exclusief btw hoort daarom een factuur van 6.050 euro. Het btw-deel is 5.000 × 21 procent, of 6.050 × 21 ÷ 121. Trek niet nog eens 21 procent van die 6.050 euro af: dan zou ten onrechte 1.270,50 euro als teruggaaf worden ingeboekt. De teruggaaf wordt bovendien niet door de verkoper toegekend. Een aangeboden aanvraagservice verandert de fiscale voorwaarden niet. Leg vóór een opdracht vast welk totaalbedrag verschuldigd is wanneer de teruggaaf kleiner uitvalt of uitblijft. Dat voorkomt dat een aantrekkelijke prijs exclusief btw als een gegarandeerde eindprijs wordt behandeld. Alleen eigen zonnestroom opslaan geeft geen recht op teruggaaf De Belastingdienst stelt voor btw-aftrek op de thuisbatterij onder meer betaalde stroomhandel, een energiemanagementsysteem en een dynamisch contract als voorwaarden. Factuur en energiecontract moeten op dezelfde naam staan. Op het moment van aanschaf en installatie mag de koper niet aan de kleineondernemersregeling deelnemen. Alleen privégebruik geeft geen recht op aftrek. Bij volledige toerekening aan het bedrijfsvermogen kan volledige aanschaf-btw worden teruggevraagd, gevolgd door btw over privégebruik. Dat onderscheid kan de keuze voor een systeem veranderen. Een eenvoudige batterij die uitsluitend eigen zonnestroom voor de avond bewaart, kan precies passen bij een woning. Een uitgebreidere handelsoplossing kan meer functies en kosten meebrengen. Een fiscale mogelijkheid maakt die uitbreiding niet vanzelf verstandig. Vergelijk eerst dezelfde prestaties, installatie en voorwaarden, met alle bedragen op een gelijke btw-basis. Btw-ondernemerschap is bovendien een administratieve positie. De Belastingdienst legt bij ondernemerschap voor de btw uit hoe ontvangen btw wordt afgedragen en zakelijke voorbelasting wordt verrekend. Ontvangen btw is dus geen handelswinst. Een app die betalingen inclusief btw toont, toont daarmee nog niet wat de eigenaar netto overhoudt. Vraag daarom om een uitsplitsing van de energiestromen én de geldstromen. Welke kilowatturen gaan naar de woning, welke naar het net en welke kosten horen daarbij? Zonder die scheiding is niet te beoordelen of de beloofde opbrengst een energiebesparing, handelsmarge of belastingbedrag is. Privégebruik kan een deel van de teruggaaf weer kosten Voor privégebruik hanteert de Belastingdienst bij volledige aftrek een berekening over een vijfde van de aanschafkosten exclusief btw, in het gebruiksjaar en de vier daaropvolgende kalenderjaren. Het aandeel privégebruik wordt onderbouwd met gegevens uit het energiemanagementsysteem en eventueel energienota's. Voor de thuisbatterij bestaat geen vast forfait. Neem een eigen voorbeeld: aanschaf en ingebruikname begin 2027, een prijs van 5.000 euro exclusief btw en volledige aftrek van 1.050 euro. We veronderstellen dat de batterij ieder jaar aantoonbaar voor 60 procent privé wordt gebruikt en dat de eigenaar buiten de kleineondernemersregeling blijft. De jaarlijkse btw over dat privégebruik is dan 5.000 ÷ 5 × 60 procent × 21 procent = 126 euro. Vijf jaar dezelfde verhouding betekent 630 euro aan deze afdracht. Van de aanvankelijke 1.050 euro resteert dan nominaal 420 euro vóór administratiekosten en andere fiscale gevolgen. Dit is een berekening van één onderdeel, geen totaalvergelijking tussen privé opslaan en stroomhandel. De verhouding kan veranderen. Als na 2027 meer energie voor de woning wordt gebruikt en minder voor belaste stroomhandel, past een vast percentage uit de aankoopofferte mogelijk niet meer. De Belastingdienst benoemt die mogelijkheid expliciet bij het einde van salderen. Laat een ingewikkelde combinatie met zonnepanelen of andere ondernemingsactiviteiten daarom vooraf beoordelen. Een gekozen percentage is geen vrij te gebruiken kortingsknop. De kleineondernemersregeling vraagt om de juiste volgorde De kleineondernemersregeling, meestal KOR genoemd, is een btw-vrijstelling voor ondernemers die aan de voorwaarden voldoen, waaronder een jaaromzet van maximaal 20.000 euro. De vereenvoudiging gaat samen met het ontbreken van aftrek op kosten en investeringen. Wie de KOR gebruikt, kan dus niet tegelijkertijd de aanschaf-btw behandelen alsof gewone belaste activiteiten worden verricht. Voor vrijwillige afmelding noemt de Belastingdienst de eerste dag van een aangiftetijdvak en een afmelding uiterlijk vier weken vóór de gewenste ingangsdatum. Na beëindiging geldt een uitsluitingsperiode: de rest van dat kalenderjaar en het volgende jaar. Eerst kopen en daarna de administratie passend maken is daardoor geen veilige standaardroute. Ook later terugkeren naar de KOR verdient een afzonderlijke berekening. De regels over herziening kennen een uitzondering voor bepaalde investeringen uit eerdere jaren wanneer het totale jaarlijkse herzieningsbedrag door de KOR-wijziging onder 500 euro blijft. Dat is geen algemene toestemming om eerst alle btw terug te krijgen en direct belastingvrij verder te gaan. Het moment van ingebruikname en eventuele andere investeringen tellen mee. Voor iemand met ander zelfstandig werk is nog een punt belangrijk: de KOR geldt per ondernemer, niet los per activiteit of subnummer. Een keuze vanwege de batterij kan dus verder doorwerken dan de energierekening. Het is verstandig die gevolgen te kennen voordat een verkoper de teruggaaf alvast van de prijs aftrekt. De batterij moet na de teruggaaf nog steeds geld verdienen Draai de aankoopbeslissing om. In ons voorbeeld resteert na volledige teruggaaf een eerste netto investering van 5.000 euro. Bij tien gebruiksjaren, geen restwaarde en 4 procent rekenrente vraagt dat om 616,45 euro gelijkblijvende netto kasbesparing per jaar. De formule is 5.000 × 0,04 ÷ [1 − 1,04 tot de macht −10]. Die besparing moet overblijven nadat lopende kosten zijn betaald. Rekenen met tien jaar betekent niet dat een fabrikant tien kosteloze jaren garandeert. Bij vervanging of een kortere levensduur ligt de benodigde besparing hoger. De rekenrente vergoedt het vastleggen van eigen geld; werkelijke leningbetalingen zitten hier niet in. Ook moet de koper aanvankelijk de volle factuur kunnen betalen. De berekening behandelt de teruggaaf voor eenvoud alsof die meteen beschikbaar is. We voegen 60 euro administratiekosten per jaar toe, een eigen aanname. Bij 60 procent privégebruik komt daar in 2027 tot en met 2031 jaarlijks 126 euro btw over privégebruik bij. Vanaf 2032 vervalt in dit model die aanschafgerelateerde privégebruikscorrectie. Dan is over tien jaar een gelijkblijvende operationele kasmarge van 745,61 euro per jaar nodig vóór deze twee posten. Die 745,61 euro volgt uit de contante waarde van de betalingen. De tienjaarsfactor bij 4 procent is 8,1109; voor vijf jaar is hij 4,4518. De formule wordt (5.000 + 126 × 4,4518) ÷ 8,1109 + 60. Daarmee wordt de privégebruikscorrectie vijf jaar meegerekend, niet ten onrechte tien. Met operationele kasmarge bedoelen we hier het totale extra voordeel tegenover dezelfde woning zonder batterij, ná stroominkoop, verliezen, misgelopen netto terugleververgoeding, handelsdiensten en onderhoud, maar vóór deze administratiekosten en privégebruik-btw. Btw die voor de fiscus wordt ontvangen of aftrekbaar betaald, is uit die marge gehaald. Een offerte moet juist dat bedrag kunnen onderbouwen. Een hoog bruto handelsbedrag alleen volstaat niet. Drie scenario's tonen wat er in 2027 tot en met 2029 overblijft De scenario's hebben 6 oktober 2026 als peildatum en gebruiken de huidige fiscale regels. Ze veronderstellen aanschaf begin 2027, volledige eerste teruggaaf en geen toetreding tot de KOR. De bedragen zijn gevoeligheidsaannames, geen producttest of voorspelling van toekomstige stroomprijzen. In het lage scenario bedraagt de operationele kasmarge 300, 280 en 260 euro. We nemen 80 procent privégebruik aan, waardoor de jaarlijkse privégebruik-btw 168 euro is. Na daarnaast 60 euro administratie blijft 72 euro in 2027, 52 euro in 2028 en 32 euro in 2029 over. Het middenscenario gebruikt marges van 500, 480 en 460 euro en 60 procent privégebruik. Na 126 euro privégebruik-btw en 60 euro administratie resteert 314, 294 en 274 euro. In het hoge scenario zijn de marges 700, 680 en 660 euro bij 40 procent privégebruik. Na 84 euro btw en 60 euro administratie blijft 556, 536 en 516 euro over. De daling met 20 euro per jaar is een gekozen gevoeligheid voor lagere opbrengsten of hogere kosten. Het is geen technische degradatiefactor. De percentages privégebruik zijn afzonderlijke aannames; minder privégebruik garandeert geen hogere handelswinst. In geen van de drie scenario's is de netto investering van 5.000 euro na drie jaar terugverdiend. De opgetelde kasbesparing is respectievelijk 156, 882 en 1.608 euro. Voor een echte berekening begint de onderbouwing bij het resterende stroomprofiel nadat eenvoudig verschuifbaar verbruik al naar geschikte uren is verplaatst. Volumes moeten verliezen en de verdeling tussen woning en handel laten zien. Een volle zelfverbruiksopbrengst boven op onbeperkte handelsinkomsten tellen kan niet. Ons eerdere stuk over een tweede thuisbatterij laat zien waarom juist extra benutting de investering moet dragen. Btw-teruggaaf kan een passende batterij dus aantrekkelijker maken. De fout ontstaat wanneer zij als onvoorwaardelijke korting wordt gebruikt en latere afdrachten buiten beeld blijven. Vergelijk offertes op de volledige betaalde prijs, de werkelijk toepasbare teruggaaf en wat daarna jaarlijks netto overblijft. Als de aankoop alleen klopt wanneer belastingverplichtingen worden weggelaten, klopt de aankoopberekening niet. Pak je kans! Word lid met de code GRAAG en krijg 50 procent korting. Foto: Eelco Eerenberg, staatssecretaris van Financiën met fiscale aangelegenheden en de Belastingdienst in zijn portefeuille. Officieel archiefportret van 20 februari 2026, Martijn Beekman via Rijksoverheid. Beschikbaar voor redactioneel gebruik door nieuwsmedia.
- MiniMax verkoopt nu vooral gebruiksvensters naast tokens
In het kort MiniMax heeft naast pay-as-you-go een M Plan met vijfuurs- en weekvensters. Wie alleen naar het jaartarief kijkt, mist dat ongebruikte ruimte niet wordt meegenomen. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij MiniMax draait de dragende vraag om abonnementswaarde bepalen met gebruiksvensters, rollover en productiebeperkingen. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is MiniMax toont voor jaarlijkse betaling $220 voor Go, $550 voor Explore en $1.320 voor Build. De twee hogere niveaus bieden respectievelijk drie en 7,5 keer het gebruik van Go. Alle drie noemen M3.1 Flash Preview, beeld- en spraakmodellen, web search en multimodaal begrip. Het gebruik valt tegelijk onder een vijfuursvenster en een weekvenster en ongebruikte ruimte wordt niet meegenomen. MiniMax adviseert pay-as-you-go voor productie en beschrijft M Plan als individueel, interactief gebruik. De MiniMax M Plan dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Een abonnement is aantrekkelijk wanneer het werk regelmatig genoeg binnen de vensters past. Een team met één drukke rapportagedag en zes stille dagen kan tegen een weekgrens lopen terwijl eerdere vijfuursruimte ongebruikt bleef. Pay-as-you-go sluit beter aan op grillige productie. De juiste vergelijking telt daarom niet alleen tokens per maand, maar ook piekuren, wachtrijen en het deel van de inbegrepen ruimte dat werkelijk wordt benut. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Go € 220, Explore € 550, Build € 1.320. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 550 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 10.0 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 8 uur, het middenscenario bij 24 uur en het hoge bij 58 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan De abonnementssleutel en gewone API-sleutel zijn niet uitwisselbaar. Een verkeerde sleutel kan onverwacht het accountsaldo belasten. Daarnaast kan MiniMax tijdens piekverkeer dynamisch begrenzen. Een plan is dus geen gegarandeerde productieservice voor onbeperkte gelijktijdigheid. Teams moeten een harde maandgrens en een terugvalroute instellen. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is MiniMax interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat abonnementswaarde bepalen met gebruiksvensters, rollover en productiebeperkingen de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Kimi praat OpenAI maar de migratie blijft gewoon werk
In het kort Kimi gebruikt een OpenAI-compatibele API, maar K3 en K2.6 hebben eigen modellen, denkstanden en ontbrekende productfuncties. De aansluiting verkleint codewerk, niet het hele migratierisico. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij Kimi van Moonshot draait de dragende vraag om het verschil tussen protocolcompatibiliteit en echte functie- en gedragscompatibiliteit. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is Moonshot beschrijft Kimi K3 als vlaggenschip voor langdurige code- en kennistaken met native beeldinvoer, een miljoen tokens context en instelbare reasoning_effort. K2.6 ondersteunt tekst, afbeeldingen en video met 256.000 tokens context en kan thinking in- of uitschakelen. De API gebruikt het OpenAI-formaat. Tegelijk zijn Deep Research en PPT Generation volgens de modelselectiedocumentatie niet via de API beschikbaar. Web search kost afzonderlijk $0,004 per aanroep en elke afbeelding telt vast als 1.024 inputtokens. De Kimi API-overzicht dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Een bestaande client kan daardoor vaak snel een eerste Kimi-aanroep doen. Daarna begint het echte werk: modelnamen, denkparameters, multimodale velden, toolresultaten en foutafhandeling moeten opnieuw worden getest. Een functie die in de consumentenapp bestaat, hoeft niet via de API bereikbaar te zijn. De migratiebesparing zit dus vooral in de basislaag. Productgedrag en acceptatietests blijven leveranciersspecifiek. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Client en authenticatie 12 uur € 780, Functietests 28 uur € 1.820, Monitoring en terugvalroute 20 uur € 1.300. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 3.900 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 70.9 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 46 uur, het middenscenario bij 92 uur en het hoge bij 165 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Een snelle proof of concept kan de hoeveelheid herstelwerk onderschatten. Streaming, JSON-schema’s en tool calls moeten op dezelfde eigen taken worden vergeleken. Ook kan een vaste afbeeldingsrekening gunstig zijn voor grote beelden, maar ongunstig voor kleine pictogrammen. Zonder een verkeersprofiel is die regel niet automatisch goedkoop. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is Kimi van Moonshot interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat het verschil tussen protocolcompatibiliteit en echte functie- en gedragscompatibiliteit de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Wanneer levert de cachekorting van GLM-5.3 echt geld op?
In het kort GLM-5.3 rekent een tiende van de normale inputprijs voor cached input. Dat voordeel bestaat alleen wanneer dezelfde grote context werkelijk opnieuw wordt gebruikt. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij GLM van Z.ai draait de dragende vraag om promptcaching als voorwaarde voor de economische waarde van GLM-5.3. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is Mistral beschrijft GLM-5.3 als een model van Z.ai dat zonder wijzigingen wordt gehost. De release dateert van 15 september 2026 en de status is algemeen beschikbaar. Het model heeft een contextvenster van een miljoen tokens, maximaal 128.000 outputtokens en ondersteunt onder meer function calling, structured outputs en batching. Nieuwe input kost $1,40 per miljoen tokens, cached input $0,14 en output $4,40. Beeldinvoer wordt in deze route niet ondersteund. De Mistral-hostingdocumentatie voor GLM-5.3 dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening Een lang handboek, codebeleid of juridisch dossier kan bij veel opeenvolgende taken grotendeels gelijk blijven. Dan daalt de inputprijs voor het herkende deel met 90 procent. Wie iedere prompt anders ordent of steeds het hele document wijzigt, mist dat voordeel. De workflow moet stabiele context daarom scheiden van de variabele vraag en cachehits daadwerkelijk meten. Het grote venster wordt pas economisch wanneer hergebruik structureel is. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Zonder cache € 46, Met 75% cachehit € 27, Maandverschil € 19. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 320 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 5.8 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 5 uur, het middenscenario bij 18 uur en het hoge bij 42 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Een cachehit is geen garantie dat het antwoord goed is. Verouderde vaste context kan juist consequent dezelfde fout veroorzaken. Versiebeheer en vervaldatums zijn daarom nodig. Ook blijft output relatief duur. Een agent die lang redeneert of veel tekst produceert, kan de besparing aan de invoerkant snel weer opeten. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is GLM van Z.ai interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat promptcaching als voorwaarde voor de economische waarde van GLM-5.3 de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Nemotron 3 Ultra is open maar vraagt minstens vier topchips
In het kort Nemotron 3 Ultra heeft open gewichten en activeert 55 van 550 miljard parameters. De minimale GPU-opstelling is zo groot dat benutting belangrijker wordt dan de tokenprijs. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij NVIDIA Nemotron draait de dragende vraag om bezettingsgraad en gelijktijdigheid als doorslag bij zelfhosting van Nemotron 3 Ultra. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is NVIDIA’s modelkaart noemt Nemotron 3 Ultra 550B-A55B, uitgebracht op 4 juni 2026 onder de OpenMDW 1.1-licentie. Het mixture-of-expertsmodel heeft 550 miljard totale en 55 miljard actieve parameters en ondersteunt context tot een miljoen tokens. NVIDIA noemt als minimum vier B200-, GB200-, B300- of GB300-GPU’s, of acht H100’s. De voorbeeldconfiguratie van vLLM start standaard op 256.000 tokens; voor een miljoen context is een aparte instelling nodig. De NVIDIA Nemotron 3 Ultra-modelkaart dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening De vaste infrastructuur kan meerdere verzoeken tegelijk verwerken en batching maakt de rekeneenheid efficiënter. Bij één sporadische gebruiker blijft dure capaciteit ongebruikt. Een organisatie moet daarom taken bundelen, wachtrijen plannen en meten hoeveel nuttige outputtokens per GPU-uur ontstaan. Het actieve parameteraantal helpt bij de rekensnelheid, maar verlaagt niet automatisch het gewichtengeheugen of de KV-cache voor lange context. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Rekenhuur en afschrijving € 72.000, Stroom, beheer en netwerk € 24.000, Totaal per jaar € 96.000. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 96.000 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 1745.5 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 1050 uur, het middenscenario bij 2100 uur en het hoge bij 3600 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Theoretisch passen is geen productiegarantie. Drivers, interconnect, koeling, modelstart, failover en observatie horen bij de dienst. Langere context verlaagt vaak het aantal gelijktijdige sessies. De OpenMDW-licentie moet bovendien voor de eigen distributie- en gebruiksvorm worden gelezen. Zonder belastingsproef is een lokale kostprijs slechts een schatting. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is NVIDIA Nemotron interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat bezettingsgraad en gelijktijdigheid als doorslag bij zelfhosting van Nemotron 3 Ultra de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.
- Gemma 4 maakt overcapaciteit duurder dan tokens
In het kort Gemma 4 loopt van kleine edgevarianten tot een 31B-model en combineert dense en mixture-of-experts-architecturen. Wie te groot kiest, betaalt vooral voor ongebruikte hardware. De actuele modelkaart en prijsdocumentatie zijn belangrijker dan een losse benchmark of productnaam. We rekenen terug vanaf de kosten en toetsen welke inzet in 2027, 2028 en 2029 nodig is. De conclusie is voorwaardelijk: alleen aantoonbaar geslaagde taken tellen mee. De AI-markt lijkt op het eerste gezicht steeds eenvoudiger. Iedere leverancier heeft een vlaggenschip, een goedkoper model en een indrukwekkende contextlengte. In de praktijk wordt de keuze juist lastiger. Toegang kan beperkt zijn, een introductietarief kan aflopen en open gewichten kunnen onder verschillende licenties vallen. De modelnaam is daarom hooguit het begin van het onderzoek. Bij Gemma van Google draait de dragende vraag om het juiste Gemma 4-formaat kiezen op basis van geheugen, modaliteit en werkelijke benutting. Dat is geen academisch verschil. Het bepaalt of een experiment ook als vaste dienst kan draaien, of de rekening beheersbaar blijft en hoeveel menselijk herstelwerk nodig is. Een goed model dat te vaak op de verkeerde taak wordt gezet, is economisch nog steeds een slechte keuze. Direct naar een onderdeel van dit artikel Wat er werkelijk beschikbaar is De techniek verandert de rekening De beslissende rekensom Drie jaar vooruit rekenen Waar het nog mis kan gaan Wat dit economisch betekent Wat er werkelijk beschikbaar is Google DeepMind publiceert Gemma 4 onder Apache 2.0 met open gewichten voor vooraf getrainde en instructievarianten. De familie omvat E2B, E4B, 12B, 26B-A4B en 31B. Afhankelijk van de variant worden tekst, afbeeldingen en audio als invoer ondersteund, met tekst als uitvoer. De modelkaart noemt ondersteuning voor meer dan 140 talen en context tot 256.000 tokens. De familie bevat zowel dense als mixture-of-expertsmodellen. De officiële Gemma 4-modelkaart dient daarbij als uitgangspunt, met de stand van 6 oktober 2026. De woorden algemeen beschikbaar, preview en beperkt toegankelijk horen niet op één hoop. Een aangekondigd model kan technisch bestaan zonder dat een normaal bedrijf het vandaag via een stabiele API kan afnemen. Andersom kan een downloadbaar model open gewichten bieden terwijl de licentie aanvullende voorwaarden stelt. Gratis proberen in een chatdienst geeft nog geen recht om het model zelf te hosten. Ook contextlengte vraagt nuchterheid. Een bovengrens van honderdduizenden of een miljoen tokens vertelt hoeveel invoer technisch mogelijk is. Zij zegt niet dat zoveel context snel, goedkoop of zorgvuldig wordt verwerkt. Lange prompts vergroten de prefilltijd, vragen cachegeheugen en kunnen relevante details tussen ruis laten verdwijnen. Voor een vergelijking moeten daarom dezelfde taak, dezelfde context en dezelfde succesdefinitie worden gebruikt. De techniek verandert de rekening De kleinste variant kan op een edgeapparaat een eenvoudige classificatie uitvoeren zonder iedere vraag naar de cloud te sturen. Een groter model kan meer complexe dossiers behandelen, maar vraagt meer geheugen en stroom. Een bedrijf moet daarom per taak het kleinste formaat kiezen dat de kwaliteitsgrens haalt. De besparing ontstaat niet doordat de gewichten gratis te downloaden zijn, maar doordat hardware voldoende wordt benut en cloudverkeer werkelijk verdwijnt. Dat maakt kosten per miljoen tokens nuttig, maar onvoldoende. De betere maat is kosten per succesvol afgeronde taak. Daarin horen input, output, redenering, gereedschap, cache, herhaalpogingen en menselijke controle. Wanneer een goedkoper model twee herstelrondes nodig heeft, kan de duurdere route alsnog winnen. Wanneer een topmodel een eenvoudige extractietaak niet beter uitvoert, betaalt een bedrijf alleen voor ongebruikte capaciteit. Voor lokale modellen komt daar een andere kostenlaag bij. Alle gewichten moeten in opslag en meestal in werkgeheugen beschikbaar zijn, ook wanneer een mixture-of-expertsmodel per token slechts een deel activeert. Quantisatie kan het beslag verlagen, maar kan kwaliteit en snelheid veranderen. Gelijktijdige gebruikers en lange context voegen KV-cache toe. Een model dat één keer op een werkstation antwoord geeft, is daarmee nog geen productiesysteem. De beslissende rekensom Voor een vergelijkbaar voorbeeld gebruiken we deze kostenbrug: Kleine edgeopstelling € 2.400, Grotere server € 9.000, Beheer drie jaar € 4.500. De waarden zijn afkomstig uit het gepubliceerde tarief of, waar geen controleerbaar tarief bestaat, uit een expliciet gemarkeerd eigen kostenbudget. Dat verschil is belangrijk. Een scenario-aanname is geen prijsclaim van de leverancier en een dollarbedrag is zonder belasting en wisselkoers geen Nederlandse factuur. De omgekeerde berekening begint niet bij een mooie benchmark, maar bij de vraag hoeveel productiviteit nodig is om € 4.500 per jaar terug te verdienen. Bij een interne waarde van € 55 per aantoonbaar bespaard uur is dat 81.8 uur per jaar. De formule is eenvoudig: jaarlijkse kosten gedeeld door € 55. De moeilijke stap is bewijzen dat die uren werkelijk vrijkomen bij gelijkblijvende kwaliteit. Een team moet daarom een vaste proefset gebruiken en per taak noteren of het eerste antwoord bruikbaar was, hoeveel correctietijd nodig was en of een mens dezelfde controle toch moest uitvoeren. Alleen het verschil met de bestaande werkwijze telt. Tijd die wel op papier wordt bespaard maar later terugkomt als herstelwerk, mag niet dubbel als voordeel worden geboekt. Drie jaar vooruit rekenen De scenario’s voor 2027 tot en met 2029 gebruiken drie niveaus van aantoonbaar bespaarde tijd en laten het volume jaarlijks met 12 procent groeien. Het lage scenario start bij 52 uur, het middenscenario bij 108 uur en het hoge bij 190 uur. De jaarlijkse kosten blijven bewust gelijk, zodat zichtbaar wordt welke benutting de doorslag geeft. Het zijn aannames, geen voorspellingen van gebruik of tarieven. De netto productiviteitswaarde is bespaarde uren maal € 55, minus de jaarlijkse kosten. Implementatie-uren in het eerste jaar horen daar in een echte businesscase nog vanaf. Hetzelfde geldt voor kwaliteitsverlies, uitval en extra gegevensbeheer. Een positieve uitkomst bewijst dus niet dat het model winst oplevert. Zij laat alleen zien hoeveel economische ruimte overblijft om die overige kosten op te vangen. Voor kleine teams kan de lage variant al ruim voldoende zijn wanneer de vaste kosten gering zijn. Bij eigen hardware of een omvangrijk abonnement ligt de drempel hoger en wordt bezettingsgraad doorslaggevend. Andersom kan een goedkoop API-model zo weinig kosten dat vooral foutpreventie telt. Dan is één vermeden uur herstelwerk meer waard dan een jaar aan tokens. Waar het nog mis kan gaan Open gewichten betekenen niet dat implementatie gratis is. Quantisatie, drivers, beveiliging, modelupdates en observatie vragen tijd. Audio- of beeldondersteuning geldt bovendien niet automatisch identiek voor iedere variant. De modelkaart en concrete repository moeten per gekozen formaat worden gecontroleerd. Daarnaast blijft leveranciersrisico bestaan. Modellen verdwijnen, aliassen verschuiven en prijzen kunnen veranderen. Een goede integratie bewaart prompts en evaluaties buiten het model, houdt een alternatieve route beschikbaar en legt vast welke versie op welk moment is gebruikt. Daardoor wordt een upgrade een gecontroleerde keuze in plaats van een verrassing in productie. Privacy verdient dezelfde concrete aanpak. Cloudgebruik vraagt duidelijkheid over opslag, training en gegevenslocatie. Lokale inzet voorkomt niet automatisch alle risico’s, want logbestanden, toegangsrechten en onveilige plug-ins kunnen gegevens alsnog blootleggen. Het juiste antwoord is dus niet altijd lokaal of altijd cloud. Het is een aantoonbare keuze per datastroom. Wat dit economisch betekent Voor bedrijven is Gemma van Google interessant wanneer de gekozen route aantoonbaar beter past bij het werk dan een goedkoper of eenvoudiger alternatief. Dat bewijs komt uit eigen taken, niet uit één benchmark. Het minimum is een vergelijking van eerste-poging-succes, totale doorlooptijd, menselijk herstel en alle directe kosten. Pas daarna kan een groter contextvenster, een open licentie of een sterkere redeneermodus economische waarde krijgen. Voor beleggers ligt de les een niveau hoger. Lagere tokenprijzen kunnen het gebruik vergroten, maar leiden niet automatisch tot hogere winst bij de modelleverancier of chipmaker. Open modellen kunnen hardwarevraag stimuleren en tegelijk prijsdruk op API’s zetten. De waarde verschuift naar distributie, gereedschappen, datatoegang, betrouwbaarheid en capaciteit. Wie alleen naar de nieuwste modelnaam kijkt, mist precies het deel waar het verdienmodel wordt gemaakt. De nuchtere conclusie is daarom dat het juiste Gemma 4-formaat kiezen op basis van geheugen, modaliteit en werkelijke benutting de keuze moet sturen. Begin met de kleinste route die de taak aantoonbaar goed afrondt. Schaal pas op wanneer de extra kwaliteit meer waard is dan de extra kosten. Zo blijft een indrukwekkend model een productiemiddel en wordt het geen dure demonstratie. Een maandelijkse herhaling van dezelfde proef maakt prijswijzigingen en kwaliteitsverschuivingen zichtbaar voordat ze de begroting of de dienstverlening raken. Dat kleine meetritme is uiteindelijk waardevoller dan een eenmalige ranglijst.










