AI-pilot opzetten die niet strandt: scope, succescriteria en stopcriteria

Drie collega's werken op laptops aan een vergadertafel
Datum
23 september 2026
Auteur
Isatis Group
Categorie
AI & Innovation
Leestijd
9 min lezen

Een AI pilot slaagt als hij eindigt in een besluit. Lees hoe je scope, nulmeting, succescriteria, stopcriteria en een testset vooraf vastlegt.

Een AI pilot is geslaagd als je na afloop een echte beslissing kunt nemen. Daarvoor leg je vooraf vast: één proces, een gemeten nulmeting, succescriteria en stopcriteria, echte data met een vaste testset en één eigenaar die over opschalen beslist. Bouw de pilot bovendien op een fundament dat in productie kan blijven staan, zodat een geslaagde proef geen herbouw nodig heeft.

Veel organisaties komen niet zo ver. IDC onderzocht in opdracht van Lenovo hoeveel proofs of concept met AI de productie halen: van elke 33 waren dat er vier, en 88% bleef steken. Gartner voorspelde in juli 2024 dat minstens 30% van de projecten met generatieve AI na de proof of concept zou worden stopgezet, onder meer door slechte datakwaliteit, oplopende kosten en onduidelijke zakelijke waarde.

Die oorzaken kun je grotendeels voorkomen met keuzes die je maakt voordat de pilot begint. Hieronder lees je welke.

Waarom een AI pilot blijft hangen

AI is inmiddels gewoon op de werkvloer. Volgens het CBS gebruikte in 2025 één op de zes Nederlandse bedrijven AI, twee keer zoveel als twee jaar eerder. Bij bedrijven met 250 of meer werkzame personen was dat 66%.

Gebruik zegt nog weinig over resultaat. In de wereldwijde enquête van McKinsey onder 1.993 respondenten zegt 88% dat hun organisatie AI regelmatig in minstens één bedrijfsfunctie inzet. Ongeveer een derde is begonnen met opschalen, en 39% ziet enig effect van AI op het bedrijfsresultaat (EBIT) van de hele organisatie.

Het patroon achter die cijfers is herkenbaar. Een pilot start met een demo die indruk maakt. Na een paar maanden staat er een werkend prototype, en dan blijkt dat niemand heeft afgesproken wanneer het goed genoeg is. Drie oorzaken komen steeds terug:

  • Geen meetlat. Zonder nulmeting en vooraf vastgelegde criteria wordt de evaluatie een kwestie van smaak.
  • Demodata. Een model dat op opgeschoonde voorbeelden goed scoort, gedraagt zich anders op de gegevens uit je eigen systemen.
  • Geen eigenaar. Als niemand bevoegd is om over opschalen te beslissen, schuift het besluit door naar het volgende kwartaal.

"After last year's hype, executives are impatient to see returns on GenAI investments, yet organizations are struggling to prove and realize value." Rita Sallam, Distinguished VP Analyst bij Gartner

Kies één proces en houd de scope klein

Een goede AI pilot test één toepassing in één proces bij één team. Kies een proces met veel herhaling, een duidelijk begin en eind, en een uitkomst die je kunt controleren. Denk aan het classificeren van binnenkomende documenten, het voorstellen van een antwoord op een terugkerende klantvraag of het controleren van een aanvraag op volledigheid. Processen die je al eens in kaart hebt gebracht voor bedrijfsprocessen automatiseren zijn vaak een goed vertrekpunt.

Schrijf de scope op in een half A4 dat iedereen in het project kan lezen:

  1. Het proces. Welke stap, van welk team, met welke invoer en welke uitkomst.
  2. De rol van AI. Of het systeem een voorstel doet dat een medewerker beoordeelt, of zelf een stap uitvoert. Voor een eerste pilot kies je bijna altijd het voorstel.
  3. De grenzen. Wat buiten de pilot valt: andere afdelingen, zeldzame uitzonderingen, extra koppelingen.
  4. Het beslismoment. De datum waarop de uitkomst op tafel ligt.

Die tweede keuze past bij hoe wij naar AI kijken: AI werkt het best wanneer mensen er dichtbij blijven. Een medewerker die elk voorstel ziet, levert je bovendien meetgegevens op. Elke correctie laat zien waar het systeem de fout in gaat. Het principe lijkt op dat van een minimum viable product: zo klein als mogelijk, zo echt als nodig.

Begin met een nulmeting

Zonder nulmeting kun je niet zeggen of de pilot iets verbetert. Meet daarom vóór de start hoe het proces nu presteert, met dezelfde definities die je later voor de pilot gebruikt. Drie of vier getallen zijn genoeg:

  • de doorlooptijd per dossier of verzoek
  • het percentage fouten of herstelwerk
  • het aantal minuten handwerk per geval
  • het volume per week, zodat je weet hoeveel gevallen de pilot raakt

Meet over een periode die representatief is, inclusief drukke weken en uitzonderingen. Komen de cijfers uit een bestaand systeem, dan is die bron meteen de plek waar je later ook de pilot meet. Staat er niets in een systeem, dan is een paar weken handmatig turven beter dan een schatting.

De nulmeting vertelt je ook of het proces de moeite waard is. Een taak die het team een half uur per week kost, levert met het beste model nog steeds weinig op.

Leg succescriteria en stopcriteria vooraf vast

Succescriteria beschrijven wanneer de pilot geslaagd is. Stopcriteria beschrijven wanneer je tussentijds ophoudt of na afloop niet doorgaat. Beide leg je vast voordat het team de eerste regel code schrijft, elk met een getal, een meetmethode en een bron. De x staat hieronder voor de waarde die jullie zelf kiezen op basis van de nulmeting.

Soort criterium Wat je vastlegt Voorbeeld van een formulering
Kwaliteit Hoe vaak de uitkomst klopt, gemeten op de testset Minstens x% van de voorstellen is correct volgens de beoordeling van het team
Tijd Winst ten opzichte van de nulmeting De doorlooptijd per dossier daalt met minstens x%
Gebruik Of medewerkers het voorstel echt gebruiken Medewerkers nemen minstens x van de 10 voorstellen over zonder grote aanpassing
Stop op kwaliteit Wanneer verbeteren geen zin meer heeft Na twee verbeterrondes scoort de pilot nog steeds onder de nulmeting
Stop op data Wanneer de basis ontbreekt De benodigde gegevens zijn binnen de looptijd niet in bruikbare vorm beschikbaar

Stopcriteria maken stoppen tot een uitkomst. Een pilot die eindigt op een vooraf afgesproken criterium heeft zijn werk gedaan: je weet iets wat je daarvoor niet wist, tegen een beperkte inzet. Spreek ook af dat criteria tijdens de pilot alleen veranderen via de eigenaar, met een korte notitie over het waarom.

Werk met echte data en een vaste testset

Demodata is schoon, compleet en voorspelbaar. Echte data is dat zelden: velden ontbreken, tekst staat in het verkeerde veld, scans zijn scheef en afkortingen verschillen per afdeling. Gartner noemt slechte datakwaliteit als eerste reden waarom projecten na de proof of concept stoppen, en IDC wijst op data die niet klaar is voor AI. Werk daarom vanaf de eerste week met een representatieve uitsnede uit de systemen die het proces nu gebruikt, binnen de afspraken die je organisatie al heeft over toegang tot die gegevens.

Stel daarnaast een vaste testset samen: historische gevallen waarvan de juiste uitkomst bekend is, beoordeeld door mensen uit het proces zelf. Vier regels houden die set bruikbaar:

  • Houd de testset apart van alle gegevens waarmee je het systeem instelt of traint.
  • Zorg dat lastige gevallen en uitzonderingen er in dezelfde verhouding in zitten als in de praktijk.
  • Laat twijfelgevallen door twee medewerkers los van elkaar beoordelen, zodat je ziet waar ook mensen het oneens zijn.
  • Verander de testset niet tijdens de pilot en voeg nieuwe gevallen toe als aparte set.

Ook na de pilot draai je elke wijziging aan model, instructies of koppeling tegen dezelfde set. Daarmee is de testset een van de belangrijkste opleveringen.

Bepaal vooraf wie beslist over opschalen

Wijs bij de start één eigenaar aan met mandaat en budget voor de fase na de pilot. Meestal is dat de manager die verantwoordelijk is voor het proces. De afdeling IT en het innovatieteam adviseren; de eigenaar beslist. Zet de datum van het beslismoment in de agenda op de dag dat de pilot begint.

Op dat moment liggen er drie uitkomsten op tafel:

  1. Opschalen. De succescriteria zijn gehaald. Team, planning en budget voor de productiefase zijn al besproken, zodat er geen gat van maanden ontstaat.
  2. Bijsturen. De resultaten liggen dichtbij de lat en er is een aanwijsbare oorzaak. Je plant één extra ronde met een nieuwe datum en dezelfde criteria.
  3. Stoppen. Een stopcriterium is geraakt. Je legt vast wat je hebt geleerd, over het proces, de data en de toepassing, en je sluit de pilot af.

Bouw de AI pilot zo dat hij kan doorgroeien

Veel pilots worden gebouwd als eiland: een script, een testomgeving en een export uit het bronsysteem. Is het resultaat goed, dan begint het team voor productie opnieuw. Een aantal onderdelen bouw je daarom direct zoals je ze in productie wilt hebben:

  • Een koppeling met de bronsystemen via een API, in plaats van handmatige exports.
  • Logging van elke invoer, uitkomst en correctie, zodat je kunt terugzien waarom het systeem iets voorstelde.
  • Een scherm waarin medewerkers het voorstel beoordelen, overnemen of aanpassen.
  • Versiebeheer van model, instructies en instellingen, gekoppeld aan de resultaten op de testset.
  • Een geautomatiseerde test die de testset bij elke wijziging opnieuw draait.
  • Een uitknop, zodat het proces zonder AI gewoon doorloopt als dat nodig is.

Dit is het deel van een AI pilot waar softwarevakmanschap het verschil maakt. Wij kijken naar AI vanuit data en AI die zakelijke waarde oplevert, en bouwen de pilot als eerste versie van maatwerk software die daarna kan doorgroeien. Isatis bouwt al ruim dertig jaar software die jarenlang in productie draait, van onderhoudssoftware voor de luchtvaart tot een platform voor subsidieadministratie en RFID in de supply chain. Met 30+ engineers in Nijmegen en Sarajevo, meer dan 100 projecten en certificering voor ISO 9001 en ISO 27001 weten we wat een systeem nodig heeft om na de proef overeind te blijven. Plan een vrijblijvend gesprek en we kijken samen welk proces zich leent voor een eerste pilot.

Veelgestelde vragen

Wat is het verschil tussen een proof of concept en een AI pilot?

Een proof of concept toont aan dat iets technisch kan, meestal met een beperkte of opgeschoonde dataset. Een AI pilot test of de toepassing in een echt proces, met echte data en echte gebruikers, genoeg oplevert om door te gaan. De pilot eindigt daarom met een besluit: opschalen, bijsturen of stoppen.

Welke succescriteria passen bij een AI pilot?

Criteria die je kunt meten tegen de nulmeting: de kwaliteit van de uitkomst op een vaste testset, tijdwinst per geval, minder herstelwerk en het aandeel voorstellen dat medewerkers overnemen. Leg per criterium een getal, een meetmethode en een bron vast voordat de pilot begint.

Wanneer stop je een AI pilot?

Zodra een vooraf vastgelegd stopcriterium wordt geraakt. Bijvoorbeeld als de kwaliteit op de testset na een afgesproken aantal verbeterrondes onder de nulmeting blijft, of als de benodigde data niet beschikbaar komt. Stoppen op zo'n criterium is een geldige uitkomst, omdat je tegen beperkte inzet hebt geleerd dat deze toepassing nu niet rendeert.

Hoeveel AI pilots halen de productie?

Een minderheid. IDC zag dat van elke 33 proofs of concept met AI er vier in productie gingen; 88% bleef steken. Volgens McKinsey is ongeveer een derde van de organisaties begonnen met het opschalen van AI.

Deel dit artikel

Jack van Poll

Jack van Poll

Co-Founder, Isatis

Schrijft over nearshore engineering,
softwarepartnerschappen en teams die blijven.

Neem contact op

Lees verder.

Alle artikelen