AI en QA

Van IF/THEN naar waarschijnlijkheid: Hoe test je AI-Agents?

AI-agents worden volop ontwikkeld en ingezet. Waar we voorheen gewend waren aan passieve chatbots die enkel reageerden op input, zien we nu agents die actief doelen nastreven, tools gebruiken en zelfstandig stappen ondernemen. Voor software testers betekent dit een fundamentele verschuiving in hun vakgebied. In dit artikel delen we enkele inzichten uit een van onze klanttrainingen over het testen van deze nieuwe generatie software.

De grote verandering:
van deterministisch naar probabilistisch

Traditionele software is deterministisch. Een tester weet: “Als ik X invoer, moet de uitkomst exact Y zijn.” Dit volgt een strakke IF-THEN logica. AI-software is echter probabilistisch: de output is gebaseerd op waarschijnlijkheid en geleerd gedrag in plaats van harde code.

Deze verandering heeft grote gevolgen voor je teststrategie:

  • Output: In plaats van een exact antwoord, beoordeel je de output op basis van kwaliteitscriteria.
  • Test oracle: Je kunt niet altijd één ‘juist’ antwoord definiëren; je kijkt naar de mate van plausibiliteit.
  • Focus: De nadruk verschuift van code-dekking naar gedrag en statistiek.

Het testen van traditionele software is als het controleren van een rekenmachine: 1+1 moet altijd exact 2 zijn. Het testen van een AI-agent is meer als het beoordelen van een nieuwe stagiair: je geeft een doel, en hoewel de manier waarop het doel wordt bereikt kan variëren, beoordeel je of het resultaat binnen de professionele kaders en kwaliteitsnormen valt.

Hoe werkt een
AI-agent?

Om AI goed te kunnen testen, moet je begrijpen hoe het werkt. Een Large Language Model (LLM) ‘weet’ in feite niets; het voorspelt slechts welk stukje tekst (token) het meest waarschijnlijk volgt op de invoer. Een AI-agent gaat een stap verder: het is een LLM die in een loop tools aanstuurt om een specifiek doel te bereiken.

Een agent bestaat uit verschillende componenten die je afzonderlijk én samen moet testen:

  1. Input: De (systeem)prompts en de gespreksgeschiedenis.
  2. Model: De instellingen zoals ’temperature’ (creativiteit) en het ‘reasoning budget’.
  3. Tools: De externe functies die de agent kan aanroepen, zoals API’s, rekenmachines of database-zoekopdrachten.

In 5 stappen naar een
teststrategie voor AI

Tijdens onze training hanteren we het volgende stappenplan om AI-agents effectief te testen:

 

Stap 1: Scope & kwaliteitscriteria bepalen

Identificeer wat de agent wel en absoluut niet mag doen (bijvoorbeeld geen medisch advies geven). Definieer attributen zoals juistheid, veiligheid, tonaliteit en robuustheid. Stel vast wanneer een resultaat acceptabel is, bijvoorbeeld een score van ≥90% op een ‘Golden Set’.

 

Stap 2: Het testfundament leggen

Test eerst de deterministische lagen: werken de onderliggende API’s en UI-elementen correct? Zorg ook voor observability: je moet logs en metrics (zoals tokengebruik) kunnen inzien om te begrijpen waarom een agent een bepaalde beslissing nam.

 

Stap 3: Datasets & testcases bouwen

Bouw systematisch testcases voor het ‘happy path’, maar ook juist voor edge cases en kwaadwillende input (jailbreaking). Bepaal per case hoe concreet het verwachte gedrag is.

 

Stap 4: Kies de evaluatiemethode

Omdat de output kan variëren, heb je verschillende manieren nodig om te testen:

  1. Exact match: voor technische data, zoals JSON-schema’s.
  2. Semantic similarity: “betekent dit antwoord hetzelfde als mijn referentie?”
  3. LLM-as-judge: een tweede AI-model gebruiken om de subjectieve kwaliteit (bijvoorbeeld beleefdheid) te beoordelen.
  4. Human evaluation: voor de risicovolle gevallen waar automatisering tekortschiet.

 

Stap 5: Uitvoering & regressie

AI-modellen veranderen continu. Wat vandaag werkt, kan morgen na een model-update anders reageren. Regressietesten zijn daarom cruciaal om te meten of de kwaliteit, veiligheid of latency niet verslechtert over tijd.

Conclusie 

Het testen van AI-agents vraagt om nieuwe vaardigheden en gereedschappen. We gaan van het testen van regels naar het testen van gedrag. Door de anatomie van de agent te begrijpen en slimme evaluatiemethodes (zoals LLM-as-judge) in te zetten, behoud je als tester de controle in een probabilistische wereld.

 

 

Thomas kennismanager testing
Op zoek naar hulp?

Wil je meer weten over hoe je jouw organisatie voorbereidt op het testen van AI? Neem contact op met onze experts Jan Willem Altink of Thomas Wattel.

Gerelateerde berichten

Ook interessant:

Bedankt, we gaan voor je aan de slag!