De meeste bedrijfstaken waar AI voor wordt ingezet, zijn smal. Een factuur coderen, een e-mail naar de juiste afdeling sturen, gegevens uit een pakbon halen. Daar betaal je bij een frontier-model voor brede kennis die je nooit gebruikt.
Een AI-model distilleren is een groot model als leraar laten voordoen hoe één afgebakende taak moet, en met die voorbeelden een klein model trainen dat alleen die taak uitvoert, op je eigen hardware. Het resultaat is een model van een paar honderd miljoen tot acht miljard parameters dat op die ene taak het niveau van de leraar benadert, voor een fractie van de kosten per verwerking, zonder dat je data het gebouw verlaat.
Hoe werkt distilleren in de praktijk?
Distilleren is minder exotisch dan het klinkt. Het traject heeft zes stappen, en de eerste twee bepalen of de rest zin heeft.
- Baken de taak af. Eén invoer, één type uitvoer, een vaste set mogelijke uitkomsten. "Classificeer binnenkomende e-mail in twaalf categorieën" is een taak. "Help de klantenservice" is er geen.
- Maak een goudset. Laat twee mensen die het werk kennen 300 echte gevallen beoordelen. Waar ze het oneens zijn, zit de vaagheid in de taak, niet in het model. Los dat eerst op.
- Laat de leraar labelen. Een groot model verwerkt duizenden onbewerkte voorbeelden met een zorgvuldige instructie. Hier ontstaat je trainingsset.
- Train de leerling. Een klein model leert van die gelabelde set, met LoRA of QLoRA als het een generatief model is, of met gewone fine-tuning als het een classificatiemodel is.
- Meet tegen de goudset. Niet tegen de leraar. De leraar maakt ook fouten, en je wilt weten hoe de leerling het doet ten opzichte van jouw mensen.
- Rol uit met een vangnet. Gevallen waar de leerling onzeker over is, gaan naar een mens of naar een groter model.
De goudset is waar trajecten stranden. Wie die stap overslaat, heeft na afloop een model en geen idee of het goed is. Hoe je die kwaliteitsmeting opzet, staat ook in onze uitleg over een eigen AI-model trainen op je bedrijfsdata, waar we het verschil met RAG behandelen.
Waarom haalt een klein gedistilleerd model het niveau van een groot model?
Omdat het niet hoeft te weten wat het grote model weet. Een frontier-model is getraind om bijna alles redelijk te kunnen. Een gedistilleerd model hoeft maar één ding goed te kunnen, en al zijn capaciteit gaat daarnaartoe.
Het onderzoek is hier opvallend eenduidig over. In Distilling Step-by-Step van Google Research (2023) versloeg een fine-getuned T5-model van 770 miljoen parameters het 540 miljard parameters tellende PaLM, met maar 80 procent van de beschikbare trainingsdata. Dat is een model dat zevenhonderd keer kleiner is.
LoRA Land van Predibase (2024) testte 310 fine-getunede modellen op 31 taken. De met 4-bit LoRA getrainde modellen scoorden gemiddeld 34 punten hoger dan hun basismodel en 10 punten hoger dan GPT-4. Gemiddeld, over smalle taken. Op brede redeneertaken ligt dat anders, en daar komen we op terug.
Een kanttekening die in samenvattingen van dit onderzoek vaak sneuvelt: deze resultaten gelden voor taken met een duidelijke juiste uitkomst. Zodra de taak open wordt, verdwijnt het voordeel van de leerling snel.
Welk leerlingmodel past bij welke taak?
De keuze voor het leerlingmodel is de belangrijkste technische beslissing, en ze hangt af van wat er uit het model moet komen. Een label, of tekst.
| Classificatiemodel (encoder) | Klein generatief model | |
|---|---|---|
| Voorbeeld | RobBERT-2023 (355M) | een 7-8B model met LoRA |
| Uitvoer | een label of score | tekst of JSON |
| Geschikt voor | routeren, labelen, sentiment, prioriteit | velden extraheren, korte samenvattingen, herschrijven |
| Hardware voor training | één consumenten-GPU | 6 GB VRAM (QLoRA) tot 22 GB (LoRA) |
| Hardware voor gebruik | draait op een CPU | één GPU of een Apple Silicon-machine |
| Grootste risico | taak blijkt toch tekst te vereisen | verzint velden die niet in de bron staan |
Voor Nederlandse tekst is RobBERT-2023 een logisch vertrekpunt: een Nederlands taalmodel van KU Leuven, UGent en TU Berlin, onder MIT-licentie, dat op de Nederlandse DUMB-benchmark 18,6 punten boven BERTje scoort. Met 355 miljoen parameters is het klein genoeg om duizenden e-mails per minuut te labelen op gewone serverhardware.
Moet er tekst uit komen, dan schuif je op naar een generatief model van zeven tot acht miljard parameters. Volgens de hardwarevereisten van Unsloth past QLoRA-training van een 8B-model in minimaal 6 GB videogeheugen, en 16-bit LoRA in 22 GB. Dat is één werkstation, geen datacenter. Welke hardware daarbij past, staat in onze gids over AI-hardware voor bedrijven.
Mag je de output van ChatGPT, Claude of Gemini gebruiken om te trainen?
Dit is de vraag die in vrijwel elk distillatietraject te laat wordt gesteld. De leraar is een product van een leverancier, en die leverancier heeft voorwaarden over wat je met de uitvoer mag doen.
| Leraar | Wat de voorwaarden zeggen | Gevolg voor distilleren |
|---|---|---|
| OpenAI API | Verbod op output gebruiken voor concurrerende modellen, met uitzondering voor interne classificatiemodellen | Intern classificatiemodel mag; een generatief model valt buiten de uitzondering |
| Anthropic (Claude) | Verbod op het trainen van concurrerende AI-modellen, geen uitzondering | Niet zonder schriftelijke toestemming |
| Google Gemini API | Verbod op modellen die met de dienst concurreren | Niet zonder toestemming |
| DeepSeek-R1 | MIT, distillatie expliciet toegestaan | Vrij |
| OpenAI gpt-oss, Qwen3, Gemma 4 | Apache 2.0 | Vrij |
| Llama 3.1 en later | Toegestaan | Bij distributie moet "Llama" vooraan in de modelnaam |
| Gemma 3 en eerder | Gedistilleerd model telt als afgeleide | Gemma-voorwaarden gaan mee |
De details doen ertoe. De Services Agreement van OpenAI verbiedt output te gebruiken om modellen te ontwikkelen die met OpenAI concurreren, behalve als "Permitted Exception": modellen die vooral bedoeld zijn om data te categoriseren, classificeren of ordenen, zolang je ze niet aan derden verstrekt. Een interne e-mailrouter past daarin. Een intern model dat antwoorden schrijft, niet. De Commercial Terms van Anthropic kennen zo'n uitzondering niet en verbieden het trainen van "competing AI models" zonder uitdrukkelijke toestemming. De Gemini API-voorwaarden verbieden modellen die met de dienst concurreren.
Geen van de drie definieert wat "concurrerend" is. Dat is precies waarom je er niet op wilt bouwen.
De schone route is een open-weight leraar. DeepSeek-R1 staat onder MIT en noemt "distillation for training other LLMs" letterlijk als toegestaan gebruik. OpenAI's eigen gpt-oss-modellen en Qwen3 staan onder Apache 2.0, en gpt-oss-120b draait op één GPU van 80 GB, wat het een handzame leraar maakt. Dat heeft een tweede voordeel dat zwaarder weegt dan de licentie: een open leraar draai je zelf, dus ook de ruwe trainingsdata verlaat je omgeving nooit. Dat sluit aan bij wat we schrijven over private AI onder de AVG en de EU AI Act.
Word je aanbieder onder de AI-verordening als je een model fine-tunet?
Meestal niet. De Europese Commissie heeft in haar richtsnoeren voor aanbieders van AI-modellen voor algemene doeleinden van 18 juli 2025 vastgelegd wanneer iemand die een bestaand model aanpast zelf aanbieder wordt. Het indicatieve criterium: de rekenkracht die je voor de aanpassing gebruikt is groter dan een derde van de rekenkracht waarmee het oorspronkelijke model is getraind. Fine-tunen noemen de richtsnoeren expliciet als een vorm van aanpassen.
Een LoRA-run op een paar duizend voorbeelden zit daar vele ordes van grootte onder. Een gedistilleerd classificatiemodel valt doorgaans niet eens onder de definitie van een model voor algemene doeleinden.
Dat betekent niet dat de AI-verordening niet op je toepassing slaat. De verplichtingen voor het systeem waarin je het model gebruikt, bijvoorbeeld bij beslissingen over personeel of krediet, gelden los van wie het model heeft gemaakt.
Wat kost een gedistilleerd model?
Hieronder een doorgerekend voorbeeld voor een classificatietaak: inkomende e-mail routeren naar twaalf afdelingen. De aannames staan erbij, de bedragen zijn indicatief.
| Post | Aanname | Indicatie |
|---|---|---|
| Goudset | 300 gevallen, twee beoordelaars, 1 minuut per geval | 10 uur werk |
| Labelen door de leraar | 5.000 e-mails, open-weight leraar op eigen hardware | stroom en een middag rekentijd |
| Labelen met de hand (ter vergelijking) | 5.000 e-mails, 30 seconden per stuk | 42 uur werk |
| Training classificatiemodel | RobBERT-2023 op één GPU | enkele uren rekentijd |
| Bouw, meting en integratie | koppeling met mailserver en ticketsysteem | het grootste deel van het budget |
| Gebruik | 200.000 e-mails per jaar op een CPU | geen kosten per verwerking |
Wat opvalt: de rekenkosten zijn de kleinste post. Het geld zit in het afbakenen van de taak, de goudset en de integratie met je bestaande systemen. Dat is ook waar het verschil met een frontier-API zit. Die API rekent per verwerking, dus elke uitbreiding naar een nieuwe mailbox of afdeling maakt de rekening hoger. Een eigen model kost hetzelfde bij 200.000 als bij 2 miljoen berichten per jaar.
[ TIJDWINST ]
Bespaar 8 uur per week op handmatig doorzetten en labelen van binnenkomende e-mail
De bredere rekensom van eigen modellen tegenover API-kosten staat in kleine taalmodellen voor bedrijven, inclusief hoe je met modelrouting een klein en een groot model combineert.
Wanneer is distilleren de verkeerde keuze?
In drie situaties, en de laatste wordt het vaakst over het hoofd gezien.
Bij laag volume. Verwerk je een paar honderd gevallen per maand, dan verdient de bouw van een eigen model zich niet terug. Een API met een goede instructie is dan goedkoper en sneller live.
Bij een taak die blijft veranderen. Een gedistilleerd model leert een momentopname. Komen er elk kwartaal nieuwe categorieën of regels bij, dan train je elk kwartaal opnieuw, en moet je ook de goudset bijwerken.
Bij een taak die in werkelijkheid breed is. "Beantwoord klantvragen" lijkt één taak, maar is er honderd. Een leerling die op de gangbare vragen goed scoort, faalt op precies de uitzonderingen waar een klant het verschil merkt. Daar hoort een groter model, eventueel met een gedistilleerd model als filter ervoor. Hoe je die afweging voor je hele organisatie maakt, staat in onze gids over lokale AI voor bedrijven.