Wat er gebeurde: drie topmodellen, gelanceerd in dezelfde week
In slechts een paar dagen, begin september 2026, verschenen drie top-AI-modellen van drie verschillende leveranciers: een nieuw model van OpenAI, een nieuwe versie uit de Claude-familie en een snelle variant uit de Gemini-familie van Google. Elke lancering kwam met eigen records op gespecialiseerde tests, gepresenteerd als een belangrijke sprong ten opzichte van de vorige generatie. Voor een bedrijf dat probeert te beslissen „met welke AI gaan we werken”, creëert dit lanceringstempo een constante druk om achter de nieuwste optie aan te rennen, uit angst achterop te raken.
De realiteit achter deze lanceringen is minder dramatisch dan de aankondigingskoppen. Het nieuwste en duurste model van de drie verzadigt inderdaad een paar extreem moeilijke tests, speciaal gebouwd om lastig op te lossen te zijn — maar op een algemene capaciteitsindex, die de prestatie over een breed scala aan gewone taken meet, was het verschil met de vorige generatie in de praktijk verwaarloosbaar.
Enorme sprong op gespecialiseerde tests, plateau op de algemene capaciteit
Het duurste model van de drie lanceringen loste bijna volledig twee extreem moeilijke tests op, gebruikt als ijkpunt voor geavanceerd wiskundig redeneren en complexe abstracte logicaproblemen — een echt resultaat, niet overdreven door de lanceringscommunicatie. Op de algemene index van een onafhankelijke evaluatieorganisatie, die veel soorten taken combineert in één vergelijkende score, was het verschil met de vorige generatie echter minder dan één punt.
Dit patroon geldt voor elk bedrijf dat niet net aan die extreem gespecialiseerde problemen werkt — dus de grote meerderheid. Een enorme sprong op een geavanceerde wiskundetest vertaalt zich niet automatisch naar een even grote sprong bij het schrijven van een e-mail, het samenvatten van een document of het orkestreren van een intern proces — precies de taken die de meeste AI-implementaties bij kleine en middelgrote bedrijven in werkelijkheid oplossen.
Waarom het nieuwste model niet automatisch de beste budgetkeuze is
Het meest geavanceerde model van de drie lanceringen komt ook met de hoogste kost per aanvraag van alle op dat moment beschikbare opties op de markt — een kost per verwerkte tekst-eenheid die ver boven de rest van de markt ligt, moeilijk te verantwoorden als standaardkeuze voor de gewone processen van een klein of middelgroot bedrijf. Het kostenverschil is niet symbolisch, maar groot genoeg om de rekensom van een project met een groot maandelijks aanvraagvolume volledig te veranderen.
Automatisch overstappen op het nieuwste en duurste model, alleen omdat het het nieuwste is, is een marketingbeslissing, geen technische. De nuttige vraag is niet „welk model is op dit moment het meest geavanceerde op de markt”, maar „welk model lost mijn taak goed genoeg op, tegen een kost die ik kan dragen bij het werkelijke gebruiksvolume van mijn bedrijf”.
Wat er in dezelfde periode echt toe deed bij de updates
In diezelfde periode kregen de tools die dagelijks worden gebruikt om AI-agenten te bouwen en te controleren updates die niets te maken hadden met „welk model is slimmer”. Er kwamen nieuwe controlemodi die expliciet beperken wat een agent mag doen — welke commando's hij mag uitvoeren, welke bestanden hij mag aanraken — plus correcties in de manier waarop meerdere werksessies parallel draaien zonder elkaar in de weg te zitten.
Deze updates, minder spectaculair dan een nieuw benchmarkrecord, zijn precies degene die bepalen of een AI-agent veilig, op schaal, in een echt bedrijf kan worden ingezet. Het verschil tussen een goede en een middelmatige leverancier zit steeds minder in de ruwe kwaliteit van het model en steeds meer in hoe goed de controlelaag eromheen is gebouwd.
Wat het praktisch betekent voor een bedrijf dat AI wil invoeren
De praktische conclusie voor een bedrijf dat een AI-tool of -leverancier evalueert: de vraag „welk model gebruikt het” zou steeds minder moeten meewegen in de beslissing, vergeleken met vragen over integratie, controle en betrouwbaarheid op lange termijn. Een leverancier die het onderliggende model kan wijzigen zonder iets in de workflow van de klant te breken, is in feite waardevoller dan een leverancier die star aan één model vastzit, hoe goed dat er vandaag ook uitziet.
Concreet betekent dit dat je een leverancier vraagt precies te tonen wat er gebeurt als het onderliggende model verandert — wat vrijwel zeker in de komende maanden zal gebeuren — niet alleen een indrukwekkende demo die speciaal op het model van vandaag is gebouwd en morgen al door de volgende lancering kan zijn ingehaald. Een ontwijkend antwoord op deze simpele vraag zegt meestal meer dan welke verkooppresentatie dan ook.
Wanneer het echt telt om het meest geavanceerde beschikbare model te gebruiken
Er zijn taken waarbij het verschil tussen modellen wel degelijk telt: extreem complexe redeneerproblemen, of „computer-use”-taken, waarbij de agent daadwerkelijk een grafische interface moet bedienen, een scherm moet interpreteren en een lange reeks juiste acties moet bepalen, zonder stap-voor-stap toezicht. Daar kan een topmodel iets oplossen wat een ouder of goedkoper model simpelweg niet met dezelfde kwaliteit voor elkaar krijgt.
De praktische regel is om het meest geavanceerde model gericht in te zetten, voor de exacte taak die het rechtvaardigt, niet als standaardoptie voor alles wat het bedrijf doet. Deze mix — een gewoon model voor het dagelijkse volume, een topmodel alleen waar het echt een meetbaar verschil maakt — houdt de kosten onder controle zonder de werkelijke capaciteit precies daar op te offeren waar het er het meest toe doet.
Hoe je een AI-tool kiest zonder te verdwalen in de modellenoorlog
Een paar simpele vragen, gesteld aan elke leverancier of gebruikt als interne filter vóór een beslissing, helpen om de aandacht te verleggen van „welk model” naar wat op lange termijn echt telt voor een bedrijf — vooral in een markt waar de volgorde van topmodellen elke paar maanden opnieuw verandert, en wie vandaag de „kampioen” kiest, het risico loopt diezelfde beslissing over een seizoen te moeten overdoen.
- 01Wat gebeurt er als het onderliggende model verandert? een goede leverancier kan dit duidelijk beantwoorden, zonder star afhankelijk te zijn van één versie van één model.
- 02Hoe goed is gedocumenteerd wat de agent wel en niet kan? duidelijke controle en grenzen tellen meer dan een indrukwekkende benchmarkscore die irrelevant is voor jouw werkelijke taak.
- 03Werkt het goed op jouw eigen taak, rechtstreeks getest, niet op een generiek demovoorbeeld? een test op je eigen data en eigen proces verslaat elke door de leverancier gepubliceerde vergelijking.
Het model verandert om de paar maanden. Goede controle erover blijft.
Bronnen en verder lezen.
Veelgestelde vragen
Maakt het gekozen AI-model uit voor de resultaten van een bedrijf?
Het maakt uit, maar steeds minder, naarmate topmodellen een vergelijkbare algemene capaciteit bereiken. Grote verschillen doen zich vooral voor bij extreem gespecialiseerde taken, niet bij de gewone activiteiten van een bedrijf — e-mail, samenvattingen, interne automatiseringen — waar het verschil tussen goede modellen vaak verwaarloosbaar is.
Waarom zou een bedrijf niet automatisch het nieuwste en duurste AI-model moeten kiezen?
Omdat het nieuwste model doorgaans de hoogste kost per aanvraag van de markt heeft, moeilijk te verantwoorden voor gewone volumeprocessen. De juiste keuze is degene die de exacte taak goed genoeg oplost, tegen een kost die het werkelijke gebruiksvolume kan dragen, niet automatisch de meest geavanceerde beschikbare optie.
Wat betekent het dat een model een prestatietest „verzadigt”?
Het betekent dat het model bijna alle problemen oplost uit een test die speciaal is ontworpen om extreem moeilijk te zijn, en daarbij de maximaal mogelijke score benadert. Dat garandeert geen even grote verbetering bij de gewone taken, gemeten door algemene capaciteitsindices, die een veel breder scala aan activiteiten omvatten.
Wat zou meer moeten meetellen dan het model bij de keuze van een AI-leverancier?
Hoe goed gecontroleerd en beperkt is wat de agent kan doen, hoe makkelijk het onderliggende model kan worden gewisseld zonder de integratie te breken, en of de leverancier resultaten kan aantonen op jouw werkelijke taak, niet alleen op een generiek demovoorbeeld.
Wanneer loont het toch om het meest geavanceerde beschikbare model te gebruiken?
Bij extreem complexe redeneertaken of bij „computer-use”-taken, waarbij de agent een grafische interface bedient en zelf een lange reeks juiste acties moet bepalen. Voor de rest van het gewone werkvolume volstaat een goedkoper, goed gecontroleerd model doorgaans.
Hoe voorkom ik dat ik vastzit aan één AI-model of -leverancier?
Vraag vanaf het begin duidelijkheid over wat er gebeurt als het onderliggende model verandert, en geef de voorkeur aan integraties die met meerdere modellen kunnen werken, niet star aan één model gekoppeld. Een contract of tool dat impliciet uitgaat van „dit model, voor altijd” negeert het werkelijke tempo van verandering in de markt.

Laten we kijken wat we bij jou kunnen automatiseren.
Een gratis sessie van 30 minuten: we vertellen je wat er te automatiseren valt, hoe lang het duurt en wat het kost, met een vaste prijs na de discovery.
