ai-agentsmonitoringproductiebeheer

AI-agents in productie: beheer, meten en bijsturen

3 augustus 20268 min lezenPIXEL MANAGEMENT

Dit artikel is ook beschikbaar in het Engels

De demo werkte. De pilot werkte. Drie maanden later doet dezelfde agent iets anders dan in week één, en niemand kan precies zeggen wanneer dat is begonnen. Dit is het meest voorkomende patroon bij AI in bedrijven, en het heeft zelden met het model te maken.

AI-agents in productie beheren is het inrichten van vaste meetpunten, versiebeheer en eigenaarschap rond een systeem waarvan de uitkomst per definitie varieert. Bij gewone software is een release een gebeurtenis die jij plant; bij AI verandert de onderliggende component ook zonder dat jij iets doet. Zonder meting merk je die verandering pas als een klant klaagt.

Deze gids beschrijft wat je meet, hoe je kwaliteit stabiel houdt bij modelwijzigingen, wat het draaien maandelijks kost en wie het beheer doet.

Waarom stranden AI-projecten tussen pilot en productie?

Een pilot bewijst dat iets kán werken onder gunstige omstandigheden: geselecteerde gevallen, betrokken medewerkers, korte doorlooptijd. Productie is het tegenovergestelde: alle gevallen, ook de rare, bij mensen die het systeem niet hebben gekozen, over jaren heen.

Drie oorzaken verklaren de meeste mislukkingen. De randgevallen zijn niet meegenomen, omdat de pilot juist met representatieve voorbeelden werkte. Er is geen eigenaar aangewezen, dus als de kwaliteit zakt is er niemand wiens taak het is om dat te merken. En er is geen nulmeting, waardoor "het werkt minder goed dan vroeger" een gevoel blijft in plaats van een cijfer.

Dat laatste is het makkelijkst te repareren en levert het meeste op. Wie voor livegang een testset vastlegt, heeft een jaar later nog steeds een meetlat. Hoe je die eerste fase inricht, staat in onze gids over een AI-pilotproject starten.

Wat meet je aan een agent in productie?

Vier categorieën volstaan. Meer meetpunten leiden zelden tot betere beslissingen, minder wel tot blinde vlekken.

Wat je meetConcreet meetpuntWaarom het telt
Kwaliteitscore op een vaste testset van 100 tot 300 gevallendetecteert stille achteruitgang
Bereikpercentage gevallen dat de agent zelfstandig afhandeltlaat zien of de tijdwinst echt is
Escalatiepercentage dat naar een mens gaat, en waaromwijst de volgende verbetering aan
Kostenkosten per afgehandeld gevalmaakt opschalen voorspelbaar

De belangrijkste van de vier is kosten per geval, omdat dat getal je businesscase draagt. Een agent die 80 procent van de aanvragen afhandelt voor twintig cent per stuk is een ander bedrijfsmiddel dan dezelfde agent voor twee euro per stuk, ook al is het resultaat identiek.

Meet daarnaast altijd de reden van escalatie, niet alleen het aantal. Escalaties zijn de goedkoopste bron van verbeterinformatie die je hebt: ze wijzen precies aan waar het systeem zijn grens raakt. Voor de bredere set stuurgetallen rond AI verwijzen we naar onze gids over AI-resultaten meten met KPI's.

[ TIJDWINST ]

Bespaar 6 uur per week op het handmatig steekproeven en corrigeren van AI-uitkomsten zonder vaste meting

Hoe houd je kwaliteit stabiel bij modelwijzigingen?

Dit is het verschil tussen AI-beheer en gewoon applicatiebeheer. Werk je met een cloudmodel, dan kan de aanbieder een versie vervangen of uitfaseren op een moment dat jou niet uitkomt. Je systeem verandert dan zonder release.

Drie maatregelen dekken dat af.

Pin je modelversie vast waar de aanbieder dat toestaat, en behandel een versiewissel als een gewone wijziging: aankondigen, testen, uitrollen. Automatisch meebewegen met "de nieuwste versie" is comfortabel tot de dag dat het dat niet is.

Draai je testset bij elke wijziging. Niet alleen bij een modelwissel, ook bij aanpassingen aan prompts, tools of de kennisbank. Een prompt-aanpassing die één probleem oplost, veroorzaakt regelmatig twee nieuwe elders.

Houd een terugvalpad open. Weten welke versie werkte en daar binnen een uur naar terug kunnen, is meer waard dan elke poging om de fout ter plekke te repareren.

Bij zelf gehoste modellen ligt de verantwoordelijkheid andersom: er verandert niets zonder jouw toedoen, maar beveiligingsupdates en modelupgrades zijn nu jouw taak. Dat is precies de afweging die we behandelen in onze vergelijking van lokale AI en cloud-AI.

[ DIENST ]

Meer weten over AI agents?

Bekijk dienst

Wat kost het draaien van een agent per maand?

De bouw is eenmalig, het draaien is maandelijks, en dat tweede getal wordt bij de start meestal onderschat. Reken op vier posten.

Verbruik of infrastructuur. Bij een cloudmodel betaal je per verwerkte eenheid, en die rekening groeit met het gebruik. Bij een eigen omgeving betaal je hardware of huur, ongeacht het volume.

Beheer en toezicht. Iemand kijkt periodiek naar de meetpunten, beoordeelt escalaties en past aan. Voor één productieve agent is dat in de praktijk enkele uren per maand, niet nul.

Onderhoud van de kennisbron. Documenten verouderen. Een agent die op verouderde procedures antwoordt, is nauwkeurig én fout tegelijk. Reken op periodiek opschonen.

Doorontwikkeling. Elke maand levert escalaties op die om een aanpassing vragen. Zonder budget daarvoor bevriest de agent op het niveau van de opleverdag.

Wie deze vier niet begroot, ziet de businesscase in jaar twee verdampen. De verhouding verschilt per situatie, maar de vuistregel is dat het jaarlijkse draaien en doorontwikkelen een substantieel deel van de bouwkosten bedraagt.

Wie beheert de agent en hoe ziet dat eruit?

Eigenaarschap is de maatregel met het hoogste rendement en de laagste kosten. Wijs één persoon aan die verantwoordelijk is voor de prestaties van de agent, bij voorkeur uit het team dat het proces uitvoert en niet uit IT alleen.

Een werkbaar ritme voor een agent in productie ziet er zo uit:

  • Wekelijks: meetpunten bekijken, escalaties van die week doornemen, opvallende gevallen markeren.
  • Maandelijks: testset draaien, kosten per geval vergelijken met vorige maand, één verbetering doorvoeren.
  • Bij elke wijziging: testset draaien voor en na, resultaat vastleggen.
  • Per kwartaal: rechtenreview en controle of de agent nog binnen zijn oorspronkelijke opdracht opereert.

Die laatste hoort samen met de beveiligingsmaatregelen uit onze gids over AI-agents beveiligen tegen prompt injection, want rechten die in de loop van de tijd worden opgerekt, zijn een van de meest voorkomende oorzaken van incidenten.

Pas als dit ritme staat voor één agent, is uitbreiden naar meerdere processen verstandig. Onze gids over AI bedrijfsbreed opschalen beschrijft die stap.

Wat leg je vast voordat een agent live gaat?

Een go-livebesluit verloopt soepeler als de criteria vooraf op papier staan. Zes punten volstaan voor de meeste implementaties.

De testset en de drempelwaarde. Welke gevallen zitten erin, welke score is minimaal nodig en wie beoordeelt de uitkomst.

Het bereik. Welke gevallen mag de agent zelfstandig afhandelen en welke gaan per definitie naar een mens, ongeacht hoe zeker het systeem is.

De terugvalregel. Wat gebeurt er bij twijfel, bij een storing en bij een patroon dat de agent niet kent.

De eigenaar en het ritme. Wie kijkt op welk moment naar welke cijfers, en aan wie wordt gerapporteerd.

Het budget voor het draaien. Verbruik, toezicht, onderhoud van de kennisbron en doorontwikkeling, uitgedrukt per maand in plaats van als eenmalige post.

Het stopcriterium. Bij welk resultaat zetten we de agent uit of terug naar de vorige versie.

Dat laatste punt wordt bijna altijd overgeslagen en is het waardevolst van de zes. Een vooraf afgesproken stopcriterium haalt de emotie uit een uitrol die tegenvalt: je hoeft dan niet te discussiëren over de vraag of het goed genoeg is, want die vraag is beantwoord toen er nog niets op het spel stond.

Even nuttig is het vastleggen van wat de agent uitdrukkelijk niet doet. Een expliciet afgebakende opdracht is eenvoudiger te beoordelen, en die grens wordt later het aangrijpingspunt voor uitbreiding in plaats van een discussie over wat ooit bedoeld was.

Conclusie: meten maakt het verschil, niet het model

Een AI-agent in productie is geen opgeleverd project maar een draaiend systeem met variabele uitkomsten. Wie een vaste testset, vier meetpunten, versiebeheer en één eigenaar regelt, houdt grip. Wie dat niet doet, ontdekt problemen via klanten.

De investering is bescheiden: een dag om de testset te maken en enkele uren per maand om te sturen. Wij bouwen AI-agents met meetpunten en logging vanaf dag één, omdat een agent die je kunt meten een agent is die je kunt verbeteren.

Benieuwd hoeveel tijd jij kunt besparen?

Vraag een gratis efficiëntie-audit aan. Wij analyseren je processen en laten zien waar de winst zit, vrijblijvend.