lokale-aiprivate-aidigitale-soevereiniteit

Lokale AI voor bedrijven: gids voor private AI

11 juli 202612 min lezenPIXEL MANAGEMENT

Dit artikel is ook beschikbaar in het Engels

Steeds meer Nederlandse bedrijven willen de kracht van taalmodellen inzetten zonder hun gevoelige data naar een Amerikaanse cloud te sturen. Dat kan: je draait een AI-model gewoon op je eigen hardware, achter je eigen firewall.

Lokale AI is kunstmatige intelligentie die volledig op je eigen infrastructuur draait, dus op servers die jij beheert, in plaats van via een externe API van een leverancier als OpenAI, Google of Anthropic. Het model, de rekenkracht en je data blijven binnen je eigen netwerk. Er gaat geen enkele prompt, geen document en geen klantgegeven naar buiten. Je betaalt niet per vraag, maar voor de hardware en het beheer, en je bent zelf eigenaar van het hele systeem.

  • Waar het draait: op je eigen GPU-server, in je datacenter of in een private cloud die alleen jij gebruikt.
  • Wat er met data gebeurt: die blijft binnen je netwerk en verlaat de EU nooit, waardoor de AVG-vraag "waar staat mijn data" simpel te beantwoorden is.
  • Hoe je betaalt: een vaste investering in hardware plus beheer, in plaats van een variabele rekening per token of per API-aanroep.
  • Welke modellen je gebruikt: open-source modellen zoals Llama, Mistral, Qwen of Gemma, die je vrij mag draaien en aanpassen.
  • Voor wie het loont: organisaties met gevoelige data, hoge gebruiksvolumes of harde eisen rond soevereiniteit en compliance.
  • Wat het niet is: geen magie en geen gratis lunch. Je hebt kennis, hardware en beheer nodig, en de allergrootste frontier-modellen blijven voorlopig een cloud-verhaal.

Wat is lokale AI precies?

Lokale AI, ook wel private AI of on-premise AI genoemd, betekent dat het volledige AI-systeem onder jouw controle staat. Waar je bij een clouddienst een vraag stuurt naar de servers van een leverancier en daar een antwoord terugkrijgt, gebeurt bij lokale AI alles binnen je eigen muren. Het taalmodel staat op jouw schijf, draait op jouw processor of GPU, en verwerkt jouw data zonder tussenkomst van derden.

Belangrijk om te begrijpen: een modern taalmodel is uiteindelijk een bestand. Een verzameling getallen (de gewichten, oftewel de "weights") die tijdens de training zijn geleerd. Bij open-source modellen kun je dat bestand gewoon downloaden. Zodra het op je eigen server staat, heb je software nodig die het model kan uitvoeren, zogeheten inference-software zoals Ollama, vLLM of llama.cpp. Die software neemt een prompt aan, laat het model er woord voor woord een antwoord op berekenen, en geeft dat terug. Geen internet nodig, geen account, geen externe factuur.

Dat is meteen het grote mentale omslagpunt. Bij een cloud-API huur je toegang tot iemand anders zijn model; je bezit niets en je kunt op elk moment worden afgesloten. Bij lokale AI koop je in feite een gereedschap dat je vervolgens onbeperkt en zonder afrekenen mag gebruiken. Het verschil lijkt op dat tussen een taxi nemen en een auto kopen: de taxi is handig voor incidentele ritten, maar wie elke dag rijdt, is uiteindelijk goedkoper en vrijer uit met een eigen wagen. Precies die afweging maken bedrijven nu massaal opnieuw, omdat AI-gebruik in veel organisaties van incidenteel naar dagelijks is verschoven.

Lokale AI komt in de praktijk in een paar smaken voor, afhankelijk van hoe streng je isolatie-eisen zijn:

On-premise

Het model draait op fysieke servers in je eigen pand of datacenter. Dit is de klassieke vorm van digitale soevereiniteit: je bezit de hardware, je beheert het netwerk, en niemand anders heeft fysieke toegang. Ideaal voor organisaties die om juridische of contractuele redenen alles binnenshuis moeten houden, zoals zorginstellingen, advocatenkantoren en overheidsdiensten.

Private cloud

Het model draait op gehuurde, maar exclusief voor jou gereserveerde infrastructuur bij een Europese hostingpartij zoals Hetzner, Scaleway of OVHcloud. Je deelt de hardware met niemand, de data blijft in de EU, maar je hoeft zelf geen serverkast te beheren. Dit is voor veel bedrijven de praktische middenweg: bijna alle voordelen van on-premise, zonder de operationele last van eigen hardware.

Air-gapped

De meest extreme variant: het systeem heeft helemaal geen verbinding met het internet. Alles gebeurt in een gesloten netwerk. Dit zie je bij defensie, kritieke infrastructuur en organisaties die met staatsgeheimen of extreem gevoelige intellectuele eigendom werken. Lokale AI is de enige manier waarop deze partijen überhaupt taalmodellen kunnen inzetten, omdat een cloud-API per definitie een internetverbinding vereist.

De rode draad: bij elke variant blijft de controle bij jou. Dat is precies waarom de interesse in lokale AI de afgelopen jaren zo hard is gestegen, en waarom het onlosmakelijk verbonden is met het bredere thema van digitale soevereiniteit voor Nederlandse bedrijven.

Lokale AI vs cloud-AI: wat is het verschil?

De keuze tussen lokale AI en cloud-AI is geen kwestie van "goed" of "fout", maar van afwegen wat past bij je situatie. Beide leveren dezelfde soort output (tekst, samenvattingen, classificaties, antwoorden), maar de manier waarop ze dat doen verschilt fundamenteel. Onderstaande tabel zet de belangrijkste verschillen op een rij.

AspectLokale AI (eigen model)Cloud-AI (API)
Waar draait hetOp je eigen servers of private cloudOp de datacenters van de leverancier
Data-locatieBlijft binnen je netwerk, verlaat de EU nooitGaat naar de leverancier, vaak buiten de EU
Kosten-modelVaste investering in hardware plus beheerVariabel, per token of per API-aanroep
Privacy en AVGVolledige controle, geen data-doorgifte aan derdenAfhankelijk van het datacontract en de verwerkersovereenkomst
Vendor lock-inGeen, je bezit het model en de infrastructuurHoog, je bent afhankelijk van de leverancier en zijn prijzen
LatencyLaag en voorspelbaar, geen internet-heen-en-weerAfhankelijk van internetverbinding en drukte bij de leverancier
MaatwerkVolledig, je kunt fine-tunen op je eigen dataBeperkt tot wat de API-aanbieder toestaat

De tabel maakt duidelijk waar lokale AI sterk in is: controle, privacy en voorspelbaarheid. Cloud-AI scoort daar tegenover op gemak en toegang tot de allergrootste, allernieuwste modellen. Een groot cloudmodel zoals de nieuwste generatie GPT of Claude is vandaag nog steeds capabeler dan wat je realistisch op een eigen server draait, zeker voor complexe redeneertaken. Maar het gat wordt kleiner, en voor veruit de meeste zakelijke taken (documenten samenvatten, e-mails classificeren, klantvragen beantwoorden, data extraheren) is een goed open-source model ruimschoots voldoende.

Waarom kiezen bedrijven voor private AI?

De motieven om voor lokale AI te kiezen lopen uiteen, maar draaien bijna altijd om een van deze vier redenen.

Digitale soevereiniteit

Je wilt niet afhankelijk zijn van een buitenlandse leverancier die eenzijdig prijzen kan verhogen, voorwaarden kan wijzigen of de toegang kan afsnijden. Met een eigen model op eigen infrastructuur bepaal jij de spelregels. Deze afhankelijkheid is geen theoretisch risico: een handvol Amerikaanse bedrijven domineert de markt, en geopolitieke spanningen kunnen die toegang van de ene op de andere dag beïnvloeden. Wie wil zien welke Europese antwoorden er op die afhankelijkheid komen, leest ons stuk over GPT-NL en Europese modellen.

AVG en de EU AI Act

Voor organisaties die met persoonsgegevens of bijzondere categorieën data werken, is de vraag "waar gaat mijn data heen" cruciaal. Bij een cloud-API stuur je in het slechtste geval patiëntgegevens, dossiers of financiële data naar servers buiten de EU, wat op gespannen voet staat met de AVG en het Schrems II-arrest. Bij lokale AI is het antwoord simpel: nergens heen, de data blijft binnen je netwerk. Dat maakt niet alleen je privacy-verantwoording eenvoudiger, maar ook de documentatieplicht onder de EU AI Act, die vereist dat je precies kunt aantonen waar en hoe AI-systemen data verwerken.

Geen vendor lock-in

Zodra je bedrijfsprocessen leunen op een externe API, ben je overgeleverd aan die leverancier. Verandert het prijsmodel, wordt een model uitgefaseerd of gaat een dienst dicht, dan zit je met een probleem. Een eigen model dat je bezit en beheert, kun je jarenlang blijven draaien precies zoals het is. Je bepaalt zelf wanneer je upgradet.

Gevoelige en waardevolle data

Sommige data mag simpelweg je pand niet uit: broncode, R&D-resultaten, contractonderhandelingen, medische dossiers. Voor die gevallen is lokale AI niet de goedkoopste optie maar de enige verantwoorde. Wil je AI inzetten op precies dit soort data, dan is de combinatie met stevige AI-databeveiliging essentieel.

[ TIJDWINST ]

Bespaar 15 uur per week op handmatig zoeken en samenvatten in interne documenten en dossiers, met een AI die veilig binnen je eigen netwerk draait

De optelsom van deze vier redenen verklaart waarom private AI niet langer alleen iets is voor techreuzen en overheden. Elke organisatie die serieus met gevoelige data werkt, komt vroeg of laat op deze afweging uit.

Wanneer is een eigen model goedkoper dan een cloud-API?

Dit is de vraag waar de meeste beslissingen op stranden of juist doorbreken, dus laten we de rekensom eerlijk maken. Cloud-AI kost geld per gebruik: je betaalt per token, oftewel per stukje tekst dat het model in- en uitleest. Bij laag gebruik is dat spotgoedkoop. Een paar honderd vragen per maand kost je een handvol euro's, en dan is een eigen server nergens voor nodig.

Het kantelpunt ligt bij volume. Een cloud-API schaalt lineair mee met je gebruik: tien keer zoveel vragen betekent tien keer zoveel kosten, oneindig door. Een eigen server heeft daarentegen een grotendeels vaste kostenpost. Of je er nu duizend of een miljoen vragen per maand doorheen jaagt, de hardware en het stroomverbruik veranderen nauwelijks. Ergens kruisen die twee lijnen elkaar, en dat kruispunt heet het break-evenpunt.

Waar dat punt precies ligt, hangt af van je situatie, maar een indicatief rekenvoorbeeld: een fatsoenlijke GPU-server in een Europese private cloud kost al snel enkele honderden tot ruim duizend euro per maand, afhankelijk van de zwaarte. Draai je daar hoog-volume taken op (denk aan het automatisch verwerken van tienduizenden documenten, e-mails of chatgesprekken per maand), dan kan een vergelijkbare workload via een cloud-API duizenden euro's per maand aan API-kosten kosten. Bij dat soort volumes verdient een eigen model zich in de praktijk vaak binnen enkele maanden tot een jaar terug. Bij laag volume gebeurt dat niet, en is de cloud gewoon slimmer.

Vuistregel: bij lage, wisselende volumes wint de cloud op kosten en gemak. Zodra je AI-gebruik hoog en voorspelbaar wordt, kantelt de rekensom richting een eigen model, en tellen privacy en soevereiniteit als extra winst bovenop de kostenbesparing.

Er zit nog een verborgen kant aan de kostenvergelijking: beheer. Een eigen model betekent dat iemand de server draaiend houdt, updates uitvoert en problemen oplost. Reken dat mee. Voor veel bedrijven is dat precies de reden om lokale AI door een partner te laten opzetten en beheren, in plaats van er intern een team op te zetten. Zo krijg je de voordelen van een eigen model zonder de operationele hoofdpijn.

Vergeet ook de niet-financiële kant van de rekensom niet. Bij een cloud-API betaal je soms een prijs die niet op de factuur staat: onvoorspelbaarheid. Prijzen kunnen stijgen, modellen kunnen worden uitgefaseerd, en gebruikslimieten kunnen zomaar veranderen. Een eigen model haalt die onzekerheid weg. Je weet precies wat je maandelijks kwijt bent, ongeacht hoeveel je het gebruikt, en je bent niet overgeleverd aan beslissingen van een leverancier aan de andere kant van de oceaan. Voor organisaties die AI diep in hun processen willen verweven, is die voorspelbaarheid vaak net zo waardevol als de directe kostenbesparing zelf.

[ DIENST ]

Meer weten over lokale AI?

Bekijk dienst

Welke technologie zit achter lokale AI?

Lokale AI is geen exotische technologie meer. De bouwstenen zijn volwassen, breed beschikbaar en grotendeels open source. Drie lagen zijn belangrijk om te snappen.

Open-source modellen

De motor van lokale AI zijn open-source taalmodellen. Denk aan Llama van Meta, Mistral uit Frankrijk, Qwen van Alibaba en Gemma van Google. Deze modellen zijn vrij te downloaden en te draaien, ook commercieel (let wel altijd even op de specifieke licentie per model). Ze komen in verschillende groottes, uitgedrukt in het aantal parameters: een model van 7 of 8 miljard parameters draait comfortabel op bescheiden hardware, terwijl modellen van 70 miljard of meer zwaardere GPU's vragen. Voor een dieper overzicht van wat er beschikbaar is, lees je onze gids over open-source AI-modellen.

De kwaliteit van deze open modellen is de afgelopen twee jaar spectaculair gestegen. Waar open source ooit een compromis was, presteren de beste open modellen inmiddels op het niveau van de commerciële cloudmodellen van een generatie geleden. Voor het gros van de zakelijke taken is dat meer dan genoeg.

Fine-tunen op je eigen data

Een generiek model kun je bijscholen op jouw specifieke context, een proces dat fine-tunen heet. Je voedt het model met voorbeelden uit je eigen domein (jouw producten, jouw toon, jouw vakjargon) zodat het antwoorden geeft die passen bij jouw organisatie. Fine-tunen is krachtig, maar niet altijd nodig. Het kost data, tijd en rekenkracht, en voor veel toepassingen is de volgende techniek een slimmere eerste stap.

RAG: het model laten werken met jouw kennis

De meest gebruikte techniek om een taalmodel jouw specifieke kennis te laten gebruiken, is RAG, oftewel Retrieval-Augmented Generation. In plaats van het model opnieuw te trainen, geef je het bij elke vraag de relevante stukken uit jouw documenten mee. Het model zoekt (retrieval) de juiste passages op uit jouw kennisbank en gebruikt die om een onderbouwd antwoord te formuleren (generation). Zo kan een lokaal model vragen beantwoorden over jouw handleidingen, contracten of procedures, zonder dat die kennis ooit in de cloud terechtkomt. We hebben een volledige uitleg over RAG op je eigen data waarin we dit stap voor stap uitleggen.

De combinatie van een open-source model plus RAG is voor de meeste bedrijven de gouden route: relatief eenvoudig op te zetten, geen dure training nodig, en het model blijft altijd actueel omdat je gewoon je kennisbank bijwerkt. Wil je zoiets echt goed in je bedrijfsvoering verankeren, dan raakt het al snel aan maatwerk software en slimme bedrijfsautomatisering.

Welke hardware en infrastructuur heb je nodig?

De hardwarevraag schrikt mensen soms af, maar valt in de praktijk mee. Wat je nodig hebt, hangt volledig af van welk model je draait en hoeveel gebruikers er tegelijk op zitten.

De sleutelcomponent is de GPU, de grafische processor die de zware berekeningen van een taalmodel snel kan uitvoeren. Het belangrijkste getal daarbij is het videogeheugen (VRAM), want het complete model moet daarin passen. Grofweg:

  • Kleine modellen (7 tot 8 miljard parameters): draaien op een enkele consumenten- of instap-GPU met 16 tot 24 GB VRAM. Prima voor classificatie, samenvatten en eenvoudige chatbots. Sommige van deze modellen draaien zelfs (langzamer) op een moderne CPU zonder GPU.
  • Middelgrote modellen (13 tot 34 miljard parameters): vragen een stevigere GPU of een combinatie, met 24 tot 48 GB VRAM. Dit is voor veel bedrijven de sweet spot qua prijs en kwaliteit.
  • Grote modellen (70 miljard parameters en meer): vereisen meerdere professionele GPU's of gespecialiseerde serverhardware. Hier lopen de kosten op, en is het de moeite waard om goed te wegen of je die zwaarte echt nodig hebt.

Een handige truc om hardware te besparen is kwantisatie (quantization): een techniek die de gewichten van een model comprimeert, zodat het minder geheugen inneemt tegen een klein verlies aan nauwkeurigheid. Een gekwantiseerd model van 70 miljard parameters kan zo op hardware draaien die anders veel te klein zou zijn. In de praktijk gebruikt bijna iedereen die lokale AI draait gekwantiseerde modellen.

Qua infrastructuur heb je grofweg twee opties. Koop je eigen server en zet die in je datacenter (maximale controle, hogere aanschafkosten), of huur een dedicated GPU-server bij een Europese hostingpartij (lagere drempel, snel op te schalen, data blijft in de EU). Voor de meeste bedrijven die net beginnen is die tweede route het verstandigst: je test je use-case zonder een grote investering vooraf, en schaalt pas op als het werkt.

Het draait uiteindelijk om afstemming: kies het kleinste model dat je taak goed genoeg uitvoert, en stem je hardware daarop af. Een veelgemaakte fout is meteen naar het grootste model grijpen "voor de zekerheid", terwijl een kleiner model de klus prima klaart tegen een fractie van de kosten.

Hoe begin je met lokale AI?

Beginnen met lokale AI hoeft geen groot IT-project te zijn. De verstandigste aanpak is klein starten, bewijzen dat het werkt, en dan pas opschalen. In vier stappen.

Stap 1: Kies één concrete use-case

Begin niet met "we willen AI", maar met een specifiek probleem. Bijvoorbeeld: inkomende e-mails automatisch categoriseren, offerteaanvragen samenvatten, of een interne kennisbank doorzoekbaar maken met natuurlijke taal. Eén helder afgebakende taak met meetbaar resultaat. Zo weet je precies wat succes betekent.

Stap 2: Breng je data op orde

Lokale AI is vooral waardevol wanneer het op jouw eigen data werkt. Kijk dus welke documenten, dossiers of databronnen bij de gekozen use-case horen, en zorg dat die toegankelijk en een beetje geordend zijn. Voor een RAG-opzet betekent dit: verzamel de relevante kennisbron. Dit is vaak het echte werk, want de kwaliteit van je AI valt of staat met de kwaliteit van je data.

Stap 3: Bouw een proof of concept

Zet een klein model op gehuurde Europese GPU-infrastructuur en bouw een werkende demo van je use-case. Het doel is niet perfectie, maar bewijs: werkt dit voor ons, met onze data, goed genoeg om in productie te nemen? Een PoC kun je vaak binnen enkele weken staand hebben, en hij levert de harde informatie op die je nodig hebt voor een go- of no-go-beslissing.

Stap 4: Meet, verbeter en schaal op

Werkt de PoC, meet dan het effect: hoeveel tijd bespaart het, hoe accuraat zijn de antwoorden, wat is de terugverdientijd? Op basis daarvan verbeter je (een groter model, fine-tunen, betere data) en breid je uit naar meer use-cases. Zo groeit lokale AI organisch mee met je organisatie in plaats van als een megaproject dat alles-of-niets is.

[ TIJDWINST ]

Bespaar 10 uur per week op handmatig e-mails en aanvragen sorteren en doorsturen, met een lokaal AI-model dat dit automatisch en veilig afhandelt

Voor bedrijven die deze route niet alleen willen bewandelen, verzorgen wij het hele traject van use-case tot draaiend systeem: lokale AI opzetten, afstemmen op jouw data en beheren, zodat jij je met de business kunt bezighouden in plaats van met servers.

Conclusie

Lokale AI is geen niche meer, maar een serieus alternatief voor bedrijven die controle willen houden over hun data, hun kosten en hun afhankelijkheden. De technologie is volwassen: open-source modellen presteren uitstekend, de infrastructuur is beschikbaar bij Europese aanbieders, en technieken als RAG maken het mogelijk om een model op jouw eigen kennis te laten werken zonder dat die kennis ooit je netwerk verlaat.

De keuze tussen lokaal en cloud is uiteindelijk een afweging. Bij lage, wisselende volumes is de cloud vaak slimmer. Maar zodra je met gevoelige data werkt, hoge gebruiksvolumes hebt, of harde eisen rond soevereiniteit en compliance, kantelt de balans richting een eigen model. En bij dat kantelpunt krijg je privacy, voorspelbaarheid en onafhankelijkheid er gratis bij bovenop de mogelijke kostenbesparing.

Begin klein, kies één concrete use-case, bouw een proof of concept en meet het resultaat. Zo ontdek je zonder groot risico of private AI voor jouw organisatie de juiste keuze is. En je hoeft het niet alleen te doen: met de juiste partner is lokale AI dichterbij dan je denkt.

[ DIENST ]

Meer weten over lokale AI?

Bekijk dienst

Benieuwd hoeveel tijd jij kunt besparen?

Vraag een gratis efficiëntie-audit aan. Wij analyseren je processen en laten zien waar de winst zit, vrijblijvend.