Wanneer je prompts in verschillende tools test, ontstaat er binnen teams vaak discussie over de vraag of een resultaat “goed” is, zonder dat er overeenstemming bestaat over wat “goed” precies inhoudt. Een beoordelingsschema voor prompts zet subjectieve reacties om in een herhaalbaar kwaliteitscontroleproces: hetzelfde resultaat, op dezelfde manier beoordeeld, met duidelijke motiveringen die je in de loop van de tijd kunt bijhouden.
Wat is een beoordelingsschema voor promptscores?
A beoordelingsschema voor prompt-opdrachten is een gestandaardiseerde reeks criteria voor het beoordelen van AI-uitkomsten die op basis van een prompt zijn gegenereerd. Hierin wordt vastgelegd wat er wordt beoordeeld, hoe dit wordt beoordeeld en hoe het resultaat moet worden geïnterpreteerd, zodat verschillende beoordelaars op een consistente manier te werk gaan.
Het doel is niet om een perfecte score te behalen. Het doel is om ruis te verminderen, zodat je prompts, modellen en instellingen kunt vergelijken zonder de regels halverwege te wijzigen.
Wanneer gebruik je een sjabloon voor een rubriek voor directe beoordeling?
Rubrieken zijn het nuttigst wanneer snelle toetsen worden herhaald over verschillende weken, personen en hulpmiddelen heen. Als je maar één keer toetst, geven je scores vooral een beeld van toeval en persoonlijke voorkeuren.
Veelvoorkomende toepassingen zijn onder meer:
- Vergelijkende tests (ChatGPT vs Gemini vs Perplexity) voor dezelfde reeks prompts
- Kwaliteitscontrole uitvoeren voor een interne assistent voordat de teams het in gebruik nemen
- Leveranciersbeoordeling wanneer u een gedocumenteerd vergelijkingsproces nodig hebt
- Voortdurende controle op afwijkingen na modelupdates
Sjabloon voor beoordelingsschema voor prompts (kopiëren en hergebruiken)
Deze tabel is bedoeld om ervoor te zorgen dat twee beoordelaars dezelfde output kunnen beoordelen en tot vergelijkbare scores komen. Gebruik een schaal van 1 tot 5, waarbij 1 ‘onvoldoende’, 3 ‘voldoende’ en 5 ‘uitstekend’ betekent.
| Afmeting | Score 1 (Onvoldoende) | Score 3 (OK) | Score 5 (Sterk) |
|---|---|---|---|
| Nauwkeurigheid van de taak | Onjuist, onveilig of in strijd met de vereisten | Over het algemeen correct, met enkele kleine fouten | Correct, zonder inhoudelijke fouten |
| Volledigheid | Belangrijke stappen, criteria of beperkingen worden over het hoofd gezien | Behandelt de basisprincipes, gaat niet diep in op uitzonderingsgevallen | Behandelt de belangrijkste stappen, evenals beperkingen en uitzonderingsgevallen |
| Naleving van het formaat | Negeert de vereiste structuur (tabel, JSON, opsommingstekens) | Voldoet gedeeltelijk aan het gevraagde formaat | Volgt de opmaak precies, gemakkelijk te gebruiken in verdere verwerking |
| Duidelijkheid en gebruiksvriendelijkheid | Moeilijk te volgen, vaag of onsamenhangend | Begrijpelijk, maar moet nog worden bewerkt | Overzichtelijk, gemakkelijk te doorlopen, klaar voor gebruik |
| Motivering / bronvermeldingen (indien nodig) | Er worden geen bronnen vermeld terwijl dat voor de opdracht wel nodig is | Enkele bronnen, van wisselende relevantie | De bronnen zijn relevant voor het onderwerp en onderbouwen de belangrijkste beweringen |
| Omgaan met beperkingen | Overtredt strikte beperkingen (toon, uitsluitingen, reikwijdte) | Geringe afwijking in de beperking | Blijft binnen de grenzen zonder de reikwijdte te overschrijden |
Optionele afmetingen (alleen gebruiken als ze van belang zijn)
Als je te veel dimensies toevoegt, raken beoordelaars vermoeid en zullen de scores afwijken. Voeg alleen een optioneel blok toe als het project dat nodig heeft.
- Juistheid van merk/entiteit: juiste namen, kenmerken, plaatsbepaling
- Naleving van het beleid: veilige voltooiing, weigering wanneer dat nodig is
- Transparantie van de redenering: geeft aannames en afwegingen weer (indien toegestaan)
- Pasvorm: voldoet aan uw schrijfnormen en richtlijnen voor schrijfstijl
Hoe zorg je ervoor dat beoordelaars de resultaten consistent beoordelen?
De meeste meningsverschillen over de beoordeling komen voort uit verborgen aannames. Maak het proces strakker, niet het debat.
Bepaal eerst wat er telt voordat je tests uitvoert
Schrijf het doel van de testcyclus in één zin op en houd je daar vervolgens aan.
- Als het doel is betrouwbaarheid van het formaat, het gewichtsformaat en de afhandeling van beperkingen op een hoger niveau.
- Als het doel is kwaliteit van het antwoord, een hogere nauwkeurigheid en volledigheid van de gewichtsgegevens.
- Als het doel is gereedheid voor citatie, zoals aarding en helderheid.
Pas voor elke score een bewijsregel toe
Vraag beoordelaars om per dimensie één korte opmerking te schrijven: welke regel heeft tot de score geleid. Dit voorkomt dat er op basis van een “onderbuikgevoel” wordt beoordeeld.
- Opmerking: “Er ontbreekt een stap over herhalingen; er wordt niets gezegd over het vastleggen van varianties.”
- Minpuntje: “Voelt onvolledig aan.”
Kalibreer met een kleine “goudset”
Kies 3 tot 5 resultaten en spreek één keer gezamenlijk de scores af. Bewaar deze voorbeelden als interne referentie.
Als je al tooloverschrijdende tests uitvoert, combineer deze rubriek dan met de herhaalbare werkwijze die wordt beschreven in Hoe kun je prompts testen in ChatGPT, Gemini en Perplexity?.
Wiskundige berekeningen die in rapporten bruikbaar blijven
Cijfers moeten in de loop van de tijd gemakkelijk te vergelijken zijn. Houd de berekeningen zo eenvoudig dat iedereen ze in een spreadsheet kan controleren.
Twee praktische beoordelingsmodellen
- Gemiddelde score: gemiddelde van alle dimensies (geschikt voor dashboards)
- Toegangspoort + kwaliteitsscore: als er op een “harde” dimensie niet wordt voldaan → dan is het eindresultaat onvoldoende; bereken vervolgens het gemiddelde van de rest
Voorbeeld: poorten doorlopen voor QA-achtige tests
Dit zijn veelvoorkomende “hard fail”-controlepunten voor zakelijk gebruik:
- Nauwkeurigheid van de taak ≤ 2
- Naleving van het formaat ≤ 2 wanneer de uitvoer machinaal leesbaar moet zijn
- Naleving van het beleid ≤ 2 voor gereguleerde of gevoelige werkprocessen
Interpretatiegids voor elke dimensie
Een rubriek werkt alleen als iedereen de scores op dezelfde manier interpreteert. Gebruik de korte richtlijnen hieronder als een handig overzicht voor beoordelaars.
Nauwkeurigheid van de taak
- 1: verkeerde instructies, onjuiste feiten, onveilige aanwijzingen of in tegenspraak met de opdracht
- 3: het antwoord is in grote lijnen juist, maar bevat kleine fouten of onbevestigde beweringen
- 5: correct, consistent en duidelijk afgestemd op de vereisten
Volledigheid
- 1: het ontbreken van belangrijke stappen of criteria die een gebruiker nodig heeft om actie te ondernemen
- 3: behandelt de verwachte stappen, maar laat uitzonderingsgevallen of beperkingen buiten beschouwing
- 5: omvat beperkingen, randgevallen en beslissingsmomenten
Naleving van het formaat
- 1: de uitvoervorm is onjuist (geen tabel, verkeerde JSON-sleutels, geen opsommingstekens)
- 3: bijna goed, maar moet handmatig worden aangepast om bruikbaar te zijn
- 5: precieze structuur, overzichtelijke en consistente opmaak
Aardingsmaatregelen / bekeuringen
Geef dit alleen als score als de taak bronvermeldingen vereist. Verschillende assistenten gedragen zich op verschillende manieren, dus stem je verwachtingen af op je testdoel.
Voor basisdefinities van belangrijke AI-termen die in uw beoordelingsdocumenten worden gebruikt, kan Wikipedia een neutraal referentiepunt zijn: Generatieve kunstmatige intelligentie.
Veelvoorkomende fouten die het toetsen op basis van rubrieken in de weg staan
- De beoordelingsregels halverwege de toets wijzigen: de scores zijn niet langer vergelijkbaar.
- Te veel dimensies: recensenten gaan gissen om sneller klaar te zijn.
- Geen logboekregistratie: Je kunt niet uitleggen waarom een score is veranderd na een modelupdate.
- Bronvermeldingen toevoegen terwijl dat niet nodig is: Je bekritiseert Tools vanwege keuzes in de gebruikersinterface, niet vanwege de kwaliteit.
Als je team de zichtbaarheid binnen de assistenten al bijhoudt, koppel dan de rubriekresultaten aan de meetmentaliteit in Welke statistieken vervangen de CTR wanneer AI-overzichten het aantal klikken verminderen?. Het helpt belanghebbenden om te voorkomen dat ze één cijfer als het volledige verhaal beschouwen.
Maak de rubriek bruikbaar
Een rubriek wordt pas echt waardevol als het een gewoonte wordt. Begin klein: 10 vragen, 3 herhalingen per instrument, twee beoordelaars in de eerste cyclus, en daarna één beoordelaar zodra de scores stabiel zijn.
Wanneer je merkt dat output “moeilijk te beoordelen” is omdat deze vaag is of gemakkelijk verkeerd kan worden geciteerd, kan het verbeteren van de kwaliteit van de extractie zowel de bruikbaarheid voor mensen als het potentieel om geciteerd te worden vergroten. Het patroon in Hoe schrijf je een ‘answer-first’-blok voor AI-offertes? is een goede aanvullende tactiek.
Als u hulp nodig hebt om prompttests en rubriekbeoordelingen om te zetten in een herhaalbaar systeem voor inhoud en autoriteit op uw hele website, kan Authora u ondersteunen met een gestructureerde workflow die publiceren, interne links en het meten van zichtbaarheid via AI op elkaar afstemt.