Sjabloon voor een beoordelingsschema voor AI-outputbeoordelingen

Wanneer je prompts in verschillende tools test, ontstaat er binnen teams vaak discussie over de vraag of een resultaat “goed” is, zonder dat er overeenstemming bestaat over wat “goed” precies inhoudt”

Delen:

Wanneer je prompts in verschillende tools test, ontstaat er binnen teams vaak discussie over de vraag of een resultaat “goed” is, zonder dat er overeenstemming bestaat over wat “goed” precies inhoudt. Een beoordelingsschema voor prompts zet subjectieve reacties om in een herhaalbaar kwaliteitscontroleproces: hetzelfde resultaat, op dezelfde manier beoordeeld, met duidelijke motiveringen die je in de loop van de tijd kunt bijhouden.

Wat is een beoordelingsschema voor promptscores?

A beoordelingsschema voor prompt-opdrachten is een gestandaardiseerde reeks criteria voor het beoordelen van AI-uitkomsten die op basis van een prompt zijn gegenereerd. Hierin wordt vastgelegd wat er wordt beoordeeld, hoe dit wordt beoordeeld en hoe het resultaat moet worden geïnterpreteerd, zodat verschillende beoordelaars op een consistente manier te werk gaan.

Het doel is niet om een perfecte score te behalen. Het doel is om ruis te verminderen, zodat je prompts, modellen en instellingen kunt vergelijken zonder de regels halverwege te wijzigen.

Wanneer gebruik je een sjabloon voor een rubriek voor directe beoordeling?

Rubrieken zijn het nuttigst wanneer snelle toetsen worden herhaald over verschillende weken, personen en hulpmiddelen heen. Als je maar één keer toetst, geven je scores vooral een beeld van toeval en persoonlijke voorkeuren.

Veelvoorkomende toepassingen zijn onder meer:

  • Vergelijkende tests (ChatGPT vs Gemini vs Perplexity) voor dezelfde reeks prompts
  • Kwaliteitscontrole uitvoeren voor een interne assistent voordat de teams het in gebruik nemen
  • Leveranciersbeoordeling wanneer u een gedocumenteerd vergelijkingsproces nodig hebt
  • Voortdurende controle op afwijkingen na modelupdates
12.000+ DOWNLOADS
Hoe zorg je dat AI jouw merk aanbeveelt?

De toekomst van zoeken is aan merken die autoriteit opbouwen, niet alleen content.

Authora helpt bedrijven gestructureerde autoriteitssystemen te bouwen die de zichtbaarheid vergroten in Google AI, ChatGPT, Gemini en Perplexity.

Sjabloon voor beoordelingsschema voor prompts (kopiëren en hergebruiken)

Deze tabel is bedoeld om ervoor te zorgen dat twee beoordelaars dezelfde output kunnen beoordelen en tot vergelijkbare scores komen. Gebruik een schaal van 1 tot 5, waarbij 1 ‘onvoldoende’, 3 ‘voldoende’ en 5 ‘uitstekend’ betekent.

Afmeting Score 1 (Onvoldoende) Score 3 (OK) Score 5 (Sterk)
Nauwkeurigheid van de taak Onjuist, onveilig of in strijd met de vereisten Over het algemeen correct, met enkele kleine fouten Correct, zonder inhoudelijke fouten
Volledigheid Belangrijke stappen, criteria of beperkingen worden over het hoofd gezien Behandelt de basisprincipes, gaat niet diep in op uitzonderingsgevallen Behandelt de belangrijkste stappen, evenals beperkingen en uitzonderingsgevallen
Naleving van het formaat Negeert de vereiste structuur (tabel, JSON, opsommingstekens) Voldoet gedeeltelijk aan het gevraagde formaat Volgt de opmaak precies, gemakkelijk te gebruiken in verdere verwerking
Duidelijkheid en gebruiksvriendelijkheid Moeilijk te volgen, vaag of onsamenhangend Begrijpelijk, maar moet nog worden bewerkt Overzichtelijk, gemakkelijk te doorlopen, klaar voor gebruik
Motivering / bronvermeldingen (indien nodig) Er worden geen bronnen vermeld terwijl dat voor de opdracht wel nodig is Enkele bronnen, van wisselende relevantie De bronnen zijn relevant voor het onderwerp en onderbouwen de belangrijkste beweringen
Omgaan met beperkingen Overtredt strikte beperkingen (toon, uitsluitingen, reikwijdte) Geringe afwijking in de beperking Blijft binnen de grenzen zonder de reikwijdte te overschrijden

Optionele afmetingen (alleen gebruiken als ze van belang zijn)

Als je te veel dimensies toevoegt, raken beoordelaars vermoeid en zullen de scores afwijken. Voeg alleen een optioneel blok toe als het project dat nodig heeft.

  • Juistheid van merk/entiteit: juiste namen, kenmerken, plaatsbepaling
  • Naleving van het beleid: veilige voltooiing, weigering wanneer dat nodig is
  • Transparantie van de redenering: geeft aannames en afwegingen weer (indien toegestaan)
  • Pasvorm: voldoet aan uw schrijfnormen en richtlijnen voor schrijfstijl

Hoe zorg je ervoor dat beoordelaars de resultaten consistent beoordelen?

De meeste meningsverschillen over de beoordeling komen voort uit verborgen aannames. Maak het proces strakker, niet het debat.

Bepaal eerst wat er telt voordat je tests uitvoert

Schrijf het doel van de testcyclus in één zin op en houd je daar vervolgens aan.

  • Als het doel is betrouwbaarheid van het formaat, het gewichtsformaat en de afhandeling van beperkingen op een hoger niveau.
  • Als het doel is kwaliteit van het antwoord, een hogere nauwkeurigheid en volledigheid van de gewichtsgegevens.
  • Als het doel is gereedheid voor citatie, zoals aarding en helderheid.

Pas voor elke score een bewijsregel toe

Vraag beoordelaars om per dimensie één korte opmerking te schrijven: welke regel heeft tot de score geleid. Dit voorkomt dat er op basis van een “onderbuikgevoel” wordt beoordeeld.

  • Opmerking: “Er ontbreekt een stap over herhalingen; er wordt niets gezegd over het vastleggen van varianties.”
  • Minpuntje: “Voelt onvolledig aan.”

Kalibreer met een kleine “goudset”

Kies 3 tot 5 resultaten en spreek één keer gezamenlijk de scores af. Bewaar deze voorbeelden als interne referentie.

Als je al tooloverschrijdende tests uitvoert, combineer deze rubriek dan met de herhaalbare werkwijze die wordt beschreven in Hoe kun je prompts testen in ChatGPT, Gemini en Perplexity?.

Wiskundige berekeningen die in rapporten bruikbaar blijven

Cijfers moeten in de loop van de tijd gemakkelijk te vergelijken zijn. Houd de berekeningen zo eenvoudig dat iedereen ze in een spreadsheet kan controleren.

Twee praktische beoordelingsmodellen

  • Gemiddelde score: gemiddelde van alle dimensies (geschikt voor dashboards)
  • Toegangspoort + kwaliteitsscore: als er op een “harde” dimensie niet wordt voldaan → dan is het eindresultaat onvoldoende; bereken vervolgens het gemiddelde van de rest

Voorbeeld: poorten doorlopen voor QA-achtige tests

Dit zijn veelvoorkomende “hard fail”-controlepunten voor zakelijk gebruik:

  • Nauwkeurigheid van de taak ≤ 2
  • Naleving van het formaat ≤ 2 wanneer de uitvoer machinaal leesbaar moet zijn
  • Naleving van het beleid ≤ 2 voor gereguleerde of gevoelige werkprocessen

Interpretatiegids voor elke dimensie

Een rubriek werkt alleen als iedereen de scores op dezelfde manier interpreteert. Gebruik de korte richtlijnen hieronder als een handig overzicht voor beoordelaars.

Nauwkeurigheid van de taak

  • 1: verkeerde instructies, onjuiste feiten, onveilige aanwijzingen of in tegenspraak met de opdracht
  • 3: het antwoord is in grote lijnen juist, maar bevat kleine fouten of onbevestigde beweringen
  • 5: correct, consistent en duidelijk afgestemd op de vereisten

Volledigheid

  • 1: het ontbreken van belangrijke stappen of criteria die een gebruiker nodig heeft om actie te ondernemen
  • 3: behandelt de verwachte stappen, maar laat uitzonderingsgevallen of beperkingen buiten beschouwing
  • 5: omvat beperkingen, randgevallen en beslissingsmomenten

Naleving van het formaat

  • 1: de uitvoervorm is onjuist (geen tabel, verkeerde JSON-sleutels, geen opsommingstekens)
  • 3: bijna goed, maar moet handmatig worden aangepast om bruikbaar te zijn
  • 5: precieze structuur, overzichtelijke en consistente opmaak

Aardingsmaatregelen / bekeuringen

Geef dit alleen als score als de taak bronvermeldingen vereist. Verschillende assistenten gedragen zich op verschillende manieren, dus stem je verwachtingen af op je testdoel.

Voor basisdefinities van belangrijke AI-termen die in uw beoordelingsdocumenten worden gebruikt, kan Wikipedia een neutraal referentiepunt zijn: Generatieve kunstmatige intelligentie.

Veelvoorkomende fouten die het toetsen op basis van rubrieken in de weg staan

  • De beoordelingsregels halverwege de toets wijzigen: de scores zijn niet langer vergelijkbaar.
  • Te veel dimensies: recensenten gaan gissen om sneller klaar te zijn.
  • Geen logboekregistratie: Je kunt niet uitleggen waarom een score is veranderd na een modelupdate.
  • Bronvermeldingen toevoegen terwijl dat niet nodig is: Je bekritiseert Tools vanwege keuzes in de gebruikersinterface, niet vanwege de kwaliteit.

Als je team de zichtbaarheid binnen de assistenten al bijhoudt, koppel dan de rubriekresultaten aan de meetmentaliteit in Welke statistieken vervangen de CTR wanneer AI-overzichten het aantal klikken verminderen?. Het helpt belanghebbenden om te voorkomen dat ze één cijfer als het volledige verhaal beschouwen.

Maak de rubriek bruikbaar

Een rubriek wordt pas echt waardevol als het een gewoonte wordt. Begin klein: 10 vragen, 3 herhalingen per instrument, twee beoordelaars in de eerste cyclus, en daarna één beoordelaar zodra de scores stabiel zijn.

Wanneer je merkt dat output “moeilijk te beoordelen” is omdat deze vaag is of gemakkelijk verkeerd kan worden geciteerd, kan het verbeteren van de kwaliteit van de extractie zowel de bruikbaarheid voor mensen als het potentieel om geciteerd te worden vergroten. Het patroon in Hoe schrijf je een ‘answer-first’-blok voor AI-offertes? is een goede aanvullende tactiek.

Als u hulp nodig hebt om prompttests en rubriekbeoordelingen om te zetten in een herhaalbaar systeem voor inhoud en autoriteit op uw hele website, kan Authora u ondersteunen met een gestructureerde workflow die publiceren, interne links en het meten van zichtbaarheid via AI op elkaar afstemt.

Ontvang de nieuwste inzichten van Authora

De Authora-blog biedt deskundige inzichten over AI-content, organische groei en de toekomst van zoekmachines

Hoe word je het merk dat AI aanbeveelt

Een praktische gids om je zichtbaarheid te vergroten in ChatGPT, Google AI, Gemini en Perplexity

Hoe lang moet een ‘Answer-First’-blok zijn?

Een goed ‘antwoord-eerst’-blok is meestal kort genoeg om in zijn geheel over te nemen, maar lang genoeg om verkeerde citaten te voorkomen. De meeste pagina’s

Welke fouten in antwoordblokken verhinderen dat AI offertes opstelt?

Je kunt een pagina publiceren die hoog scoort in de zoekresultaten en toch verwijzingen mislopen, omdat de passage die een medewerker wil overnemen

12.000+ DOWNLOADS

Download de gratis blueprint

Bedrijven die vandaag autoriteit opbouwen, worden morgen de vertrouwde bron binnen Google en AI-chatbots. Claim jij die positie niet, dan doet je concurrent het wel.

Deze website maakt gebruik van cookies

We gebruiken cookies om inhoud en advertenties te personaliseren, om functies voor sociale media aan te bieden en om het verkeer op onze website te analyseren. Daarnaast delen we informatie over uw gebruik van onze website met onze partners op het gebied van sociale media, advertenties en analyse. Deze partners kunnen deze gegevens combineren met andere informatie die u aan hen hebt verstrekt of die zij hebben verzameld op basis van uw gebruik van hun diensten.