open-weightlokale-aitaalmodellenfrontier-modellenai-hardware

Open-weight modellen in 2026: hoe ver lopen ze nog achter?

5 oktober 20267 min lezenPIXEL MANAGEMENT

Dit artikel is ook beschikbaar in het Engels

Wie in 2024 een lokaal taalmodel uitprobeerde, onthield vooral dat het slechter was dan ChatGPT. Dat oordeel was toen terecht en is inmiddels achterhaald.

Open-weight modellen zijn taalmodellen waarvan de maker de gewichten openbaar maakt, zodat je ze op eigen hardware draait zonder dat er data naar een aanbieder gaat. In 2026 lopen de beste open-weight modellen gemiddeld vier maanden achter op de duurste gesloten modellen van OpenAI, Anthropic en Google. Wat de frontier in het voorjaar kon, draai je in het najaar zelf.

Hoe groot is de achterstand van open-weight modellen nu?

De achterstand van open-weight modellen is gemeten, en ze is kleiner dan de meeste beslissers denken. Onderzoeksinstituut Epoch AI vergelijkt modellen op een samengestelde capaciteitsindex en concludeerde in mei 2026 dat de beste open-weight modellen sinds januari 2026 gemiddeld vier maanden achterlopen op de beste gesloten modellen. Het gemiddelde verschil op die index is ongeveer zo groot als het verschil tussen GPT-5 en GPT-5.5.

Vier maanden. In 2024 schatte hetzelfde instituut de achterstand nog op vijf tot tweeëntwintig maanden, afhankelijk van welke benchmark je erbij pakte, wat in de praktijk betekende dat een lokaal model voor serieus werk een generatie achterliep.

De achterstand loopt niet keurig in één richting terug. Het AI Index Report 2026 van Stanford HAI meet op de Chatbot Arena dat het beste gesloten model in maart 2026 3,3 procent voor lag op het beste open model, tegen 0,5 procent in augustus 2024. Zes van de tien best scorende modellen in die ranglijst waren gesloten. De afstand ademt mee met elke grote release: een nieuw frontier-model trekt de kloof open, de volgende open release dicht hem weer.

MetingBronUitkomst
Achterstand in tijdEpoch AI, mei 2026gemiddeld 4 maanden
Achterstand in 2024Epoch AI, november 20245 tot 22 maanden
Verschil op Chatbot ArenaStanford AI Index 20263,3% (maart 2026)
Modellen op één consumenten-GPUEpoch AI, september 2025halen de frontier binnen 6 tot 12 maanden in

Die laatste regel is voor een bedrijf de interessantste. Volgens Epoch AI halen modellen die op één consumenten-GPU passen de frontier steeds binnen zes tot twaalf maanden in. Wat vandaag een abonnement op het duurste model vereist, draait over een jaar op een werkstation. Onder je bureau.

Welke open-weight modellen kun je vandaag zelf draaien?

Open-weight modellen zijn er in 2026 in elke maat, en bijna allemaal onder een licentie die commercieel gebruik toestaat. De onderstaande selectie is gemaakt op wat een bedrijf daadwerkelijk in eigen beheer kan draaien.

ModelMakerParameters (actief)LicentieMinimale hardware
gpt-oss-20bOpenAI21B (3,6B)Apache 2.016 GB geheugen
Qwen3.6-27BAlibaba27BApache 2.0één werkstation-GPU
Gemma 4 31BGoogle31BApache 2.0één H100 (80 GB) ongekwantiseerd
gpt-oss-120bOpenAI117B (5,1B)Apache 2.0één GPU van 80 GB
Mistral Small 4Mistral AI119B (6B)Apache 2.0vier H100's
DeepSeek V4-FlashDeepSeek284B (13B)MITeen multi-GPU-server

Twee dingen vallen op. Ten eerste komt een groot deel van de sterkste open modellen van dezelfde partijen die ook gesloten modellen verkopen: OpenAI's gpt-oss-120b draait volgens de eigen modelkaart op één GPU van 80 GB, en Google bracht Gemma 4 in april 2026 uit onder Apache 2.0.

Ten tweede zegt de naam niets over de hardware. Mistral Small 4 is "small" binnen de eigen familie, maar telt 119 miljard parameters en vraagt volgens Mistral minimaal vier NVIDIA H100's. De vuistregel: het totale aantal parameters bepaalt hoeveel geheugen je nodig hebt, het actieve aantal hoe snel het model antwoordt.

Voor wie de modellen van 1 tot 15 miljard parameters zoekt: die behandelen we apart in kleine taalmodellen voor bedrijven. Het oudere overzicht van open-source AI-modellen laat zien hoe snel deze lijst veroudert.

Hoe goed zijn open-weight modellen in het Nederlands?

Voor Nederlandse bedrijven telt niet de Engelse benchmark maar de prestatie op Nederlandse tekst. De onafhankelijke EuroEval-ranglijst voor het Nederlands meet precies dat, op 170 modellen.

De uitkomst op 5 oktober 2026: de bovenste positie is voor de nieuwste GPT-6-modellen. Daarna staat het open GLM-5.3-Flash op gelijke hoogte met Googles Gemini 3.7 Flash. Qwen3.6-27B en Gemma 4 31B, beide klein genoeg voor één werkstation, scoren op het niveau van Claude Sonnet 4.5 en GPT-4.1. Een jaar geleden betaalden veel bedrijven nog per verwerking voor precies dat niveau.

Een eerlijke kanttekening: de duurste vlaggenschepen, zoals Claude Opus en Gemini Pro, staan niet in deze ranglijst. "Even goed in het Nederlands" betekent hier: even goed als de middenklasse van de gesloten aanbieders. Voor het meeste bedrijfswerk is dat de relevante vergelijking.

Welke hardware heb je nodig om open-weight modellen te draaien?

De hardware voor open-weight modellen is in 2026 een aankoop geworden, geen bouwproject. Drie klassen dekken bijna alle bedrijfsbehoeften.

De eerste is een compacte AI-werkplek. De NVIDIA DGX Spark heeft 128 GB gedeeld geheugen en draait volgens NVIDIA modellen tot 200 miljard parameters. De adviesprijs werd in februari 2026 vanwege geheugentekorten verhoogd van $3.999 naar $4.699. Een Apple Mac Studio met M5 Ultra en tot 512 GB geheugen valt in dezelfde categorie.

De tweede is een werkstation of server met één zware GPU, zoals de RTX PRO 6000 Blackwell met 96 GB, of een H100 van 80 GB. Daarop draaien gpt-oss-120b en Gemma 4 31B voor een afdeling.

De derde is een multi-GPU-server voor de grootste open modellen, of voor veel gelijktijdige gebruikers. Die stap zet je pas als de eerste twee aantoonbaar tekortschieten. Onze gids over AI-hardware voor bedrijven werkt de keuze per klasse verder uit.

[ TIJDWINST ]

Bespaar 6 uur per week op handmatig samenvatten en doorzetten van interne documenten met een lokaal model

Waar is een frontier-model nog wel zijn geld waard?

Een frontier-model loont nog op drie soorten werk, en ze hebben gemeen dat er veel stappen achter elkaar goed moeten gaan.

Lange agent-taken zijn de eerste. Een agent die twintig stappen zelfstandig uitvoert, vermenigvuldigt elke kleine fout: een model dat per stap 97 procent goed doet, voltooit een keten van twintig stappen nog maar in 54 procent van de gevallen, en bij 99 procent per stap is dat 82 procent. Dat is rekenkunde. Het moeilijkste redeneerwerk is de tweede, zoals juridische of financiële analyses waarbij de vraag zelf onduidelijk is. Complexe software schrijven of doorgronden is de derde.

Voor de rest geldt het omgekeerde. Classificeren, extraheren, samenvatten, vertalen en antwoorden op basis van je eigen kennisbank zitten ruim binnen wat open-weight modellen nu kunnen. En als een taak smal genoeg is, kan een gedistilleerd model zelfs het niveau van het grote model halen. Hoe dat werkt, en welke licenties het toestaan, staat in een AI-model distilleren.

Hoe plan je met een achterstand van vier maanden?

De meetbare achterstand van open-weight modellen geeft je een planningsregel die we in projecten gebruiken. Wat een frontier-model vandaag kan, kun je over ongeveer een kwartaal in eigen beheer draaien. Over een jaar past het waarschijnlijk op één werkstation.

Dat verandert hoe je bouwt.

Prototypeer met het beste model, maar bouw modelonafhankelijk. Een prototype met een frontier-API laat zien of de taak überhaupt te automatiseren is. Bouw de koppeling zo dat het model achter een eigen tussenlaag zit, dan is overstappen naar een lokaal model een configuratiewijziging en geen herbouw.

Teken geen meerjarige API-verplichtingen voor werk dat binnen een jaar lokaal kan. De prijs per verwerking daalt bovendien hard: het AI Index Report 2025 mat dat de kosten om een model op het niveau van GPT-3.5 te bevragen tussen november 2022 en oktober 2024 meer dan 280 keer daalden.

En houd een eigen testset bij van echte gevallen uit je bedrijf. Elke nieuwe open release toets je daarop in een middag. Meer is het niet. Zo zie je zelf wanneer jouw taak de grens passeert, in plaats van te wachten tot een leverancier het je vertelt. Of het moment daar is om over te stappen, beoordeel je met de afweging in lokale AI versus cloud-AI en de bredere gids over lokale AI voor bedrijven.

[ DIENST ]

Meer weten over lokale AI?

Bekijk dienst →

Benieuwd hoeveel tijd jij kunt besparen?

Vraag een gratis efficiëntie-audit aan. Wij analyseren je processen en laten zien waar de winst zit, vrijblijvend.