De meeste teams slagen er niet in om prompts te testen, niet omdat ze geen ideeën hebben. Ze slagen er niet in omdat ze eerst de verkeerde promptgroepen testen en vervolgens concluderen dat “het model inconsistent is” wanneer de resultaten niet aansluiten bij hun bedrijfsdoelstelling.
Wat “prompt families” in de praktijk inhoudt
Een promptfamilie is een herhaalbaar patroon dat de werkelijke bedoeling van de gebruiker weerspiegelt en een vergelijkbaar type uitvoer oplevert. Met promptfamilies kun je een kleine reeks representatieve prompts testen in plaats van discussies te voeren over eenmalige aanpassingen in de bewoordingen.
Bij het praktische werk is de promptfamilie belangrijker dan de afzonderlijke prompt. Deze bepaalt welk soort antwoord je van het model verwacht: een definitie, een aanbeveling, een stapsgewijs plan of een diagnose.
De snelste manier om snel een testsuite op te zetten, is door deze af te stemmen op wat je wilt meten. Als je niet zeker weet hoe je ervoor kunt zorgen dat tests bij verschillende tools en bij herhalingen reproduceerbaar blijven, begin dan met het afstemmen op een consistent protocol, zoals dat in hoe je prompts kunt testen in ChatGPT, Gemini en Perplexity.
De vijf families die de meeste zakelijke toepassingen bestrijken
- Definitievragen (Wat is X?)
- Vergelijkingsvragen (X versus Y)
- Aanbevelingen (Welke moet ik kiezen?)
- Aanwijzingen voor de implementatie (Hoe doe ik X?)
- Aanwijzingen voor het oplossen van problemen (Waarom werkt X niet?)
Welke families van prompts moet je het eerst testen?
Je eerste families moeten twee dingen tegelijk doen: je meest waardevolle gebruikersintenties weergeven en resultaten opleveren die je zonder giswerk kunt beoordelen.
Een praktische volgorde voor het stellen van prioriteiten ziet er voor een contentwebsite anders uit dan voor een productteam. Het onderstaande raamwerk is geschikt voor de meeste B2B- en e-commerce-merken die zowel waarde hechten aan klassieke zoekprestaties als aan de zichtbaarheid van AI-antwoorden.
Stap 1: Kies je belangrijkste meetdoel (niet je favoriete vraag)
Kies één doel voor de eerste testcyclus. Het combineren van doelen leidt tot ruis in de scores, aangezien een prompt die uitblinkt in structuur, zwak kan zijn op het gebied van feitelijke nauwkeurigheid, en omgekeerd.
- Kwaliteit van het antwoord: juistheid, volledigheid, veiligheid.
- Merkzichtbaarheid: correcte vermeldingen en bronvermeldingen in assistenten.
- Beslissingsondersteuning: afwegingen, beperkingen en “wanneer wat te kiezen”.”
- Gebruiksvriendelijkheid in de praktijk: kan een teamgenoot de uitvoer als instructies opvolgen?
Als je uiteindelijk onder meer merkzichtbaarheid binnen assistenten wilt bereiken, is het nuttig om je prompttests te koppelen aan een cyclus voor het meten van de zichtbaarheid. De benadering op basis van statistieken wordt uiteengezet in Welke statistieken vervangen de CTR wanneer AI-overzichten het aantal klikken verminderen?.
Stap 2: Gebruik een eenvoudige tabel waarin impact en variantie tegenover elkaar worden gezet om gezinnen te rangschikken
Deze tabel is bedoeld om de prioritering concreet te houden. Onder “Impact” wordt verstaan in hoeverre de familie rechtstreeks verband houdt met de omzet of de intentie in de pijplijn. Onder “Afwijking” wordt verstaan in hoeverre de resultaten bij herhalingen en tussen verschillende tools uiteenlopen, wat van invloed is op de moeilijkheidsgraad van de beoordeling.
| Prompt-familie | Het meest geschikt voor het meten van | Typische bedrijfswaarde | Verwachte variantie | Test eerst wanneer… |
|---|---|---|---|---|
| Aanbeveling | Besluitvormingsondersteuning, merkintegratie | Hoog | Hoog | Je wilt “de standaardkeuze” zijn op het gebied van AI-antwoorden |
| Vergelijking | Afwegingen, positionering, nauwkeurigheid | Hoog | Medium | Kopers vergelijken alternatieven of concurrenten |
| Uitvoering | Gebruiksvriendelijkheid, volledigheid | Gemiddeld–Hoog | Medium | Uw product moet stap voor stap worden ingevoerd |
| Problemen oplossen | Kwaliteit, precisie en veiligheid waarborgen | Medium | Gemiddeld–Hoog | Je wint door wrijving en storingen te verminderen |
| Definitie | Duidelijkheid, consistentie, citeerbaarheid | Medium | Laag | Je hebt stabiele uitgangspunten en een gemeenschappelijke taal nodig |
Standaard startvolgorde voor de meeste teams
- 1) Definitie om de terminologie vast te leggen en misverstanden te voorkomen.
- 2) Vergelijking om te toetsen of de resultaten afwegingen weergeven en valse gelijkwaardigheid vermijden.
- 3) Aanbeveling om te zien hoe modellen winnaars selecteren en welk bewijs ze verwachten.
- 4) Uitvoering om de kwaliteit van de stappen, de aannames en de naleving van het formaat te beoordelen.
- 5) Problemen oplossen zodra je een stabiel uitgangspunt hebt van “wat het is” en “hoe je het moet doen”.”
Wat elk gezin onthult (en waar je op moet letten)
1) Definitie-aanwijzingen: je uitgangspunt voor herhaalbaarheid
Definitievragen zorgen voor een stabiele basis, omdat ze om afgebakende uitleg vragen. Daardoor zijn ze geschikt voor vroege testfasen en voor het opbouwen van herbruikbare “antwoordblokken” op je eigen site.
- Controleer of het model de door jou gewenste terminologie consequent hanteert.
- Controleer of er een toepassingsgebied wordt gecreëerd dat u niet hebt geclaimd (wat vaak voorkomt bij brede categorieën).
- Beoordeel of het antwoord in 2 tot 4 zinnen kan worden geciteerd zonder dat er context nodig is.
Als je pagina’s maakt die bedoeld zijn om geciteerd te worden, kun je aan de hand van definitievragen nagaan of je site een heldere passage bevat die het citeren waard is. Het schrijfpatroon is daarbij van belang; zie hoe schrijf je een ‘answer-first’-blok voor AI-offertes.
2) Vergelijkingsopdrachten: waarbij positioneringsfouten snel aan het licht komen
Vergelijkingen dwingen het model ertoe begrippen van elkaar te scheiden. Hier komt de gebrekkige duidelijkheid van entiteiten duidelijk naar voren: ontbrekende criteria, onduidelijke definities of onjuiste beweringen over kenmerken.
- Zoek naar een duidelijk vergelijkingskader (eerst de criteria, daarna de beoordeling).
- Let op antwoorden als “beide zijn prima” zonder dat er een beslissingsregel is.
- Controleer of het model uw productcategorie verwart met aanverwante categorieën.
3) Aanbevelingsprompts: de echte test voor het terugvinden van informatie, vertrouwen en vooringenomenheid
Aanbevelingssuggesties zijn zeer waardevol omdat ze de koopintentie weerspiegelen. Ze brengen echter ook risico’s met zich mee, omdat de modellen verschillen per tool, opvragingsmethode en veiligheidsregels, waardoor de shortlist kan veranderen.
- Geef aan of de aanbeveling het volgende bevat: voorwaarden (“kies X wanneer…”), niet alleen een ranglijst.
- Houd bij of je merk correct wordt genoemd en of er een link wordt weergegeven.
- Redenen voor het mislukken van tags: ontbrekende voorwaarden, verzonnen feiten, zwak bewijs, verkeerde doelgroep.
Als je correcte vermeldingen ziet maar geen bronvermeldingen, beschouw dit dan als een diagnostisch signaal. De werkwijze en oplossingen worden beschreven in waarom noemt AI mijn merk, maar is er geen link naar mijn website?.
4) Aanwijzingen voor de uitvoering: wanneer opmaak en volledigheid het belangrijkst zijn
Implementatie-aanwijzingen simuleren wat gebruikers doen nadat ze een beslissing hebben genomen. Deze groep is ideaal voor het testen van gestructureerde uitvoer: stappen, checklists, tabellen, JSON of instructies in SOP-stijl.
- Geef aan welke vorm de output moet hebben (genummerde stappen, checklist, tijdlijn).
- Let op verborgen aannames (tools die je niet gebruikt, budgetten die je niet hebt).
- Controleer of er onveilige snelkoppelingen zijn of vereiste onderdelen ontbreken.
5) Aanwijzingen voor probleemoplossing: de realiteitscheck van de “helpdesk”
Bij foutopsporingsvragen komen de nadelen van hallucinaties vaak het sterkst tot uiting. Ze dwingen het model om oorzaken vast te stellen op basis van beperkt bewijs, wat dichter bij de praktijk van ondersteuningsscenario’s ligt.
- Zorg ervoor dat het model eerst verduidelijkende vragen stelt voordat het oplossingen voorstelt.
- Beoordeel of het een beslissingsboom biedt in plaats van een willekeurige lijst met tips.
- Controleer of er verificatiestappen en terugzetopties worden voorgesteld.
Een eenvoudig implementatieplan dat je deze week nog kunt uitvoeren
Stel een startpakket samen (10 opdrachten) dat jouw werkelijkheid weergeeft
Kies twee vragen per gezin. Zorg ervoor dat deze vragen zo dicht mogelijk aansluiten bij echte vragen uit verkoopgesprekken, supporttickets of Search Console, en geen “slimme” randgevallen zijn.
- 2 suggesties voor definities van de termen in je hoofdcategorie
- 2 vergelijkingsvragen ten opzichte van het meest voorkomende alternatief
- 2 aanbevelingsvragen voor je belangrijkste buyer persona’s
- 2 implementatietips voor je primaire onboarding-workflow
- 2 tips voor het oplossen van veelvoorkomende storingen
Beoordeel met één rubriek voor alle tools
Gebruik een consistent beoordelingsschema (nauwkeurigheid, volledigheid, naleving van de opmaakvoorschriften, bronvermelding indien van toepassing). Een consistente beoordeling is belangrijker dan een “perfecte” beoordeling.
Als er onder belanghebbenden onenigheid bestaat over bepaalde termen, kan het overzicht op Wikipedia dienen als neutrale uitgangspunt om de terminologie op elkaar af te stemmen: Generatieve kunstmatige intelligentie.
Bepaal op basis van de eerste mislukkingen wat er verbeterd moet worden
In de beginfase van de cycli moeten er eenvoudige acties worden uitgevoerd. Als de aanbevelingen onstabiel zijn, verscherp dan de beperkingen en vraag om expliciete beslissingsregels. Als de vergelijkingen onjuist zijn, corrigeer dan de “extractable truths” op je website en zorg voor consistentie in de terminologie.
Als u van deze reeksen vragen een herhaalbare testcyclus wilt maken die aansluit op een gestructureerd inhoudsplan (zodat uw pagina’s gemakkelijker te vinden en te citeren zijn), kan Authora u helpen dat systeem op te zetten en in de loop van de tijd te onderhouden.