De resultaten van prompts kunnen afwijken om redenen die niets te maken hebben met de kwaliteit van je prompt: sessiegeschiedenis, updates van tools, het opvraaggedrag, regionale instellingen en kleine wijzigingen in de bewoordingen. Als je prompttests wilt uitvoeren die je volgende week kunt herhalen en waarop je nog steeds kunt vertrouwen, heb je een protocol nodig dat de beïnvloedbare factoren onder controle houdt en de rest registreert, zodat verschillen verklaarbaar zijn.
Wat “regelmatige en snelle tests” werkelijk inhouden
Consistentie betekent niet dat je identieke antwoorden krijgt bij ChatGPT, Gemini en Perplexity. Het betekent dat je dezelfde test opnieuw kunt uitvoeren en kunt begrijpen waarom de resultaten zijn veranderd, terwijl de onderdelen die voor jou van belang zijn vergelijkbaar blijven.
Denk als een QA-medewerker. Je doel is om drie lagen van elkaar te scheiden: wat je hebt gevraagd (input), wat het systeem heeft gedaan (genereren en ophalen), en wat je hebt gekregen (kwaliteit van de output en zakelijke bruikbaarheid).
Bepaal eerst je doel voordat je je meetcriteria kiest
Een prompt die voor de ene tool “het beste” is, kan voor een andere juist minder geschikt zijn, afhankelijk van of je belang hecht aan bronvermeldingen, gestructureerde stappen, toon of feitelijke nauwkeurigheid. Leg je doel per testcyclus vast, zodat je de beoordelingscriteria niet halverwege aanpast.
- Nauwkeurigheidstests: Is het antwoord correct en volledig voor deze opdracht?
- Testen van merkzichtbaarheid: Wordt uw merk door het model in de juiste context genoemd of aangehaald?
- Opmaaktest: Houdt het rekening met beperkingen zoals tabellen, opsommingstekens of JSON-uitvoer?
- Betrouwbaarheidstests: Blijft het resultaat stabiel bij herhaalde uitvoeringen onder dezelfde omstandigheden?
Houd rekening met gereedschapsspecifiek gedrag en stuur vervolgens aan wat je kunt
Perplexity heeft de neiging om bronnen duidelijk in beeld te brengen, waardoor retrieval-effecten gemakkelijker te herkennen zijn. Het gedrag van Gemini sluit vaak aan bij de signalen en veiligheidsbeperkingen van het Google-ecosysteem. Het gedrag van ChatGPT kan variëren, afhankelijk van of de sessie gebruikmaakt van browse- of retrieval-functies, en van de onderliggende indexeringspaden.
Als je bredere doel de merkzichtbaarheid binnen assistenten is, moet je testprotocol nauw aansluiten bij je meetsysteem. Het raamwerk in hoe de zichtbaarheid van een merk in AI-chatbots kan worden gemeten geeft je de KPI’s die je moet bijhouden zodra je tests reproduceerbaar zijn.
Een reproduceerbaar protocol voor het testen van prompts in verschillende tools
Deze workflow is zo ontworpen dat hij door één persoon in minder dan twee uur kan worden uitgevoerd voor een reeks van 10 tot 30 prompts, en vervolgens wekelijks of maandelijks kan worden herhaald.
Stap 1: Leg een “promptsuite” vast en wijs ID’s toe
Stel een vaste lijst op met prompts die de werkelijke intentie van de gebruiker weergeven, en geen slimme randgevallen. Geef elke prompt een unieke ID, zodat je logbestanden overzichtelijk blijven, zelfs als je de formulering later in een nieuwe versie aanpast.
- Gebruik 3–5 soorten vraagformuleringen: definitie, vergelijking, aanbeveling, uitvoering, probleemoplossing.
- Zorg ervoor dat de taal (Engels versus Nederlands) in alle tools van dezelfde suite consistent is.
- Afzonderlijk basisopdrachten (nooit wijzigen) van experimentele opdrachten (kan veilig herhaald worden).
Stap 2: Standaardiseer je testomgeving
De sessiegeschiedenis is een van de belangrijkste verborgen variabelen. Voer basistests uit in schone sessies en leg de omgeving vast, zodat je eventuele afwijkingen later kunt verklaren.
- Sessiestatus: bij elke run een nieuwe chat; geen eerdere berichten.
- Accountstatus: Als je de test uitvoert terwijl je bent ingelogd, blijf dan bij elke uitvoering in die cyclus ingelogd.
- Regio en taal: zorg ervoor dat ze vast blijven staan; noteer ze expliciet in het logboek.
- Modusvlaggen: registreer of het surfen op het web / bronnen / de “zoekmodus” is ingeschakeld.
- Tijdsperiode: Voer de volledige testreeks uit binnen een kort tijdsbestek (indien mogelijk binnen hetzelfde uur).
Als je zoekopdrachten afhankelijk zijn van het ophalen van gegevens via het web, houd er dan rekening mee dat de indexlaag per tool verschilt. Als je vermoedt dat ontbrekende bronvermeldingen in feite te wijten zijn aan een indexeringsprobleem, voer deze tests dan uit in combinatie met de controles in Problemen met de weergave van JavaScript bij de indexering door Bing: wat gaat er mis? aangezien de zichtbaarheid in Bing van invloed kan zijn op op zoekresultaten gebaseerde assistenten.
Stap 3: Voer bewust herhalingen uit (en noteer de spreiding)
Eén uitvoering per prompt is slechts een anekdotisch resultaat. Voer voor het bijhouden van de basislijn gecontroleerde herhalingen uit en meet de variantie.
- Voer elke opdracht uit 3 keer per stuk gereedschap in afzonderlijke nieuwe chats.
- Gebruik precies dezelfde prompttekst, gekopieerd uit je promptsuite-document.
- Noteer de beste, slechtste, en typisch het resultaat in aantekeningen, niet alleen een gemiddelde score.
Herhalingstests laten zien of je een prompt test of de willekeurigheid. Als de variantie groot is, voeg dan beperkingen toe (formaat, reikwijdte, aannames) in plaats van de hele prompt te herschrijven.
Stap 4: Gebruik een beoordelingsschema dat ook bij overdrachten zijn waarde behoudt
Als twee mensen dezelfde prestatie verschillend beoordelen, wordt je “trend” ruis. Een eenvoudige beoordelingsschema is beter dan een vage “goed/slecht”-beoordeling.
Deze tabel is bedoeld om de puntentelling consistent te houden tussen testers en weken.
| Afmeting | Score 1 (Onvoldoende) | Score 3 (OK) | Score 5 (Sterk) |
|---|---|---|---|
| Nauwkeurigheid van de taak | Onjuist of onveilig; belangrijke fouten | Grotendeels juist; er ontbreken details | Correct, duidelijk, geen inhoudelijke hiaten |
| Volledigheid | Slaat belangrijke stappen/criteria over | Behandelt de basisbeginselen | Behandelt uitzonderingsgevallen en beperkingen |
| Naleving van het formaat | Negeert de vereiste structuur | Volgt de structuur gedeeltelijk | Volgt de structuur precies |
| Bronvermeldingen / bronnen (indien van toepassing) | Er werden geen bronnen verwacht | Sommige bronnen, van wisselende bruikbaarheid | De bronnen zijn duidelijk en relevant |
| Juistheid van merk- en entiteitsnamen | Leidt tot verwarring tussen merken of kenmerken | Grotendeels correct | Juiste positionering en beperkingen |
Stap 5: Registreer velden die uitleggen “waarom” het antwoord is veranderd
Sla voor elke run het ruwe transcript en een gestructureerde rij met metagegevens op. Een spreadsheet is hiervoor geschikt, mits je deze als een database gebruikt.
- Datum en tester
- Tool (ChatGPT / Gemini / Perplexity)
- Prompt-ID en exacte prompttekst
- Loopnummer (1–3)
- Modusvlaggen (browsen aan/uit, bronnen aan/uit)
- Regio-/taalinstelling
- Antwoordtekst (of link naar opgeslagen transcript)
- Aanwezigheid van verwijzingen (ja/nee); lijst met domeinen waarnaar wordt verwezen
- Uw domein is vermeld (ja/nee); vermelde URL('s)
- Scores per rubriekonderdeel
- Opmerkingen: tag voor reden van afwijzing (hallucinatie, niet-nageleefde beperking, niet ter zake, zwakke structuur)
Als je een consistente aanpak wilt voor het labelen van je interne links en inhoudselementen, helpt een ankersysteem om onduidelijkheden op je website en in je logbestanden te verminderen. Het beslissingskader uit de beste strategie voor ankertekst bij interne links is nuttig wanneer je begint met het koppelen van snelle tests aan specifieke pagina’s.
Veelvoorkomende storingen en hoe je deze kunt oplossen
De meeste “promptproblemen” zijn in feite omgevingsproblemen, opvraagproblemen of scoreproblemen. Door de storingsmodi te labelen, kunnen problemen sneller worden opgelost.
Foutmodus: de resultaten lopen bij herhalingen sterk uiteen
Een hoge variantie betekent meestal dat de prompt te veel ruimte laat voor interpretatie. Beperk de vrijheidsgraden.
- Geef de doelgroep en de context aan (functie, branche, beperkingen).
- Een bepaalde weergavevorm opleggen (opsommingstekens, tabel, genummerde stappen).
- Voeg “aannames” en “niet-doelstellingen” toe, zodat het model de reikwijdte niet zomaar bepaalt.
Fout: het ene hulpmiddel vermeldt bronnen, het andere niet
Beschouw “geen bronvermelding” niet als “geen onderbouwing”. Sommige tools verbergen de stappen voor het opzoeken van informatie, terwijl andere deze juist weergeven. Zorg ervoor dat je metingen consistent blijven door bronvermeldingen alleen mee te tellen wanneer je testdoel dit vereist.
Om een neutrale basisdefinitie te hebben waarmee alle belanghebbenden het eens kunnen worden over wat generatieve AI precies is (wat handig is als er meningsverschillen ontstaan), kan Wikipedia als gemeenschappelijke referentie dienen: Generatieve kunstmatige intelligentie.
Fouttype: het merk wordt genoemd, maar onjuist beschreven
Dit is vaak een tekort aan “extractable truth”. Je website bevat mogelijk geen heldere, eenduidige uitspraken die modellen kunnen hergebruiken.
- Voeg op belangrijke pagina’s een beknopte tekst toe: wat je doet, voor wie het bedoeld is, wat je niet doet.
- Gebruik op alle pagina’s één naam per productkenmerk.
- Maak vergelijkingspagina’s waarop de voor- en nadelen duidelijk worden weergegeven.
Zorg ervoor dat het proces duurzaam verloopt met een rustig tempo
Consistentie ontstaat door herhaling, niet door een perfect dashboard. Kies een ritme dat je team kan volhouden.
- Wekelijks: Voer de top 10 prompts uit in alle drie de tools, telkens twee keer.
- Maandelijks: Voer de volledige testsuite uit met drie herhalingen, werk de trendgrafieken bij en markeer belangrijke wijzigingen in de tools.
- Per kwartaal: Pas de groepen met zoekopdrachten bij op basis van Search Console, verkoopgesprekken en veranderingen bij concurrenten.
Als je wilt dat deze testcyclus rechtstreeks wordt ingezet in een gestructureerd contentplan dat ervoor zorgt dat je pagina’s vaker worden opgehaald en geciteerd door verschillende assistenten, kan Authora je helpen om prompt-sets en logbestanden om te zetten in een consistent publicatie- en intern linksysteem.