Je voert dezelfde prompt twee keer in en krijgt twee duidelijk verschillende antwoorden. Het eerste antwoord is gestructureerd en concreet, terwijl het tweede een andere invalshoek, andere voorbeelden of een ander niveau van zekerheid laat zien. Dat komt vaak voor, en het wordt zelden alleen veroorzaakt door “een slechte prompt”.”
Waarom er in echte workflows afwijkingen in de uitvoer optreden
Wanneer teams vragen waarom de resultaten van AI-prompts veranderen, vermoeden ze meestal dat er sprake is van willekeur of een zogenaamde “modelstemming”. In de praktijk zijn er echter aanwijsbare oorzaken voor deze afwijking: wat het model zich van de sessie herinnert, wat het ophaalt van het internet of uit interne tools, en wat er sinds de laatste uitvoering in de omgeving is veranderd.
Zie een promptrun als een pijplijn met invoergegevens die je zelf kunt beïnvloeden en lagen waar je vaak geen invloed op hebt. Door diagnostisch te denken voorkom je dat je prompts eindeloos moet herschrijven terwijl de echte oorzaak ligt in de sessiestatus, variaties in het ophalen van gegevens of platformupdates.
Een nuttig mentaal model: drie lagen die kunnen veranderen
Wanneer de uitvoerkwaliteit verandert, verdeel het systeem dan in drie lagen. Zo blijft het opsporen van fouten gericht.
- Invoerlaag: de opdrachttekst, de voorwaarden, de voorbeelden en eventuele bijgevoegde bestanden.
- Systeemlaag: modelversie, veiligheidsbeleidsregels, standaardtemperatuurinstellingen, routeplanning van gereedschappen en geheugen-/sessiecontext.
- Contextlaag: bronnen voor het ophalen van gegevens, wijzigingen in de zoekindex en tijdgebonden feiten.
De meest voorkomende redenen waarom de resultaten van AI-prompts veranderen
De meeste afwijkingen zijn het gevolg van een klein aantal mechanismen. Het doel is om vast te stellen welk mechanisme je waarneemt, en vervolgens de kleinste aanpassing te kiezen die ervoor zorgt dat de resultaten verklaarbaar worden.
1) De sessiegeschiedenis geeft de interpretatie stilletjes een nieuwe vorm
Veel chatprogramma’s houden verborgen gegevens bij. Zelfs als je dezelfde prompt plakt, kan de assistent “vastzitten” aan eerdere berichten, jouw verduidelijkingen of zelfs eerdere fouten die hij probeert te vermijden.
Dit is van belang wanneer een prompt uitgaat van impliciete context, zoals “gebruik dezelfde opmaak als eerder” of “houd dezelfde aannames aan”. Als de sessie anders is, is de uitvoer ook anders.
- Begin met de basistests in een gloednieuw chatvenster.
- Registreer of de geheugenfuncties zijn ingeschakeld.
- Vermijd uitdrukkingen als “zoals we hebben besproken” in de opdrachten van toetsen.
2) De ophaalvariantie bepaalt wat het model op dat moment kan aanhalen of “weten”
Wanneer het ophalen van webpagina’s (of een bronnenmodus) is ingeschakeld, kan het model bij elke uitvoering een andere reeks documenten ophalen. Dat kan zelfs binnen enkele minuten gebeuren, omdat rangschikkingssystemen, actualiteitssignalen en de interpretatie van zoekopdrachten niet stabiel zijn.
Een door opvragingen aangestuurde verschuiving ziet er vaak als volgt uit:
- Verschillende bronvermeldingen of helemaal geen
- Nieuw toegevoegde details die voorheen ontbraken
- Plotselinge veranderingen in de mate van betrouwbaarheid doordat een bron eerdere bronnen tegenspreekt
Als je team assistenten met elkaar vergelijkt, is het handig om een herhaalbaar testprotocol te gebruiken. De werkwijze die wordt beschreven in hoe je prompts kunt testen in ChatGPT, Gemini en Perplexity is ontworpen om problemen met de invoer te onderscheiden van effecten die te maken hebben met het ophalen van gegevens en de omgeving.
3) Updates van tools en modellen veranderen het gedrag zonder waarschuwing
Leveranciers werken modellen, systeemmeldingen en veiligheidsrichtlijnen regelmatig bij. Zelfs als een modelnaam hetzelfde lijkt, kunnen de onderliggende gewichten, de routeringslogica en de veiligheidsmaatregelen veranderen.
Zo’n afwijking wordt vaak ten onrechte aangemerkt als “snelle achteruitgang”. Een eenvoudige maatregel om dit te voorkomen is het bijhouden van:
- Datum/tijdstip van de run
- Gereedschapsmodus (bladeren/bronnen aan of uit)
- Regio- en taalinstellingen
- Eventueel zichtbaar model-/versielabel
4) De instellingen voor steekproeven en verborgen standaardinstellingen zorgen voor variatie
Zelfs bij dezelfde prompt maakt het genereren gebruik van probabilistische steekproeven. Als de temperatuur van het systeem of andere decodeerinstellingen niet nul zijn, kunnen de resultaten verschillen wat betreft formulering, volgorde en de keuze van de voorbeelden.
In veel chat-gebruikersinterfaces kun je die parameters niet rechtstreeks aanpassen. Je kunt de variantie echter wel verminderen door de mogelijkheden van het model te beperken.
- Geef een weergavevorm op (opsommingstekens, stappen, tabelkolommen).
- Geef aan wat er niet moet worden opgenomen (“Neem geen trends, historische gegevens of analogieën op”).
- Een beslissingsregel opleggen (“Rangschik de opties op basis van X, bij gelijke stand op basis van Y”).
5) Kleine wijzigingen in de formulering kunnen het type opdracht veranderen
Prompts die voor mensen “gelijkwaardig” lijken, zijn dat voor het model misschien niet. Kleine aanpassingen kunnen ervoor zorgen dat de prompt verandert van een uitleg in een aanbeveling, of van “samenvatten” in “argumenteren”. Daardoor verandert ook wat een “goed” antwoord precies inhoudt.
Veelvoorkomende triggerwoorden die een verborgen pivot veroorzaken, zijn onder meer “beste”, “zou moeten”, “aanbevolen”, “veilig” en “bewezen”. Als je stabiele resultaten nodig hebt, vermijd dan dubbelzinnige bedoelingen en geef de beoordelingscriteria expliciet aan.
6) Veiligheidsregels van het systeem en nalevingsfilters kunnen het antwoord omleiden
Bij bepaalde onderwerpen kan de assistent beweringen afzwakken, delen van het verzoek afwijzen of voorbehouden toevoegen. Als de drempels van het veiligheidsbeleid veranderen (of als er voor een andere toolroute wordt gekozen), zul je zelfs bij identieke invoer andere resultaten zien.
Dit kan zich uiten doordat het model weigert een bepaald deel te beantwoorden, overschakelt op algemene aanwijzingen of concrete details vermijdt. Beschouw dit in eerste instantie als een verandering op systeemniveau, niet als een storing op promptniveau.
Een diagnostisch raamwerk dat je in 15 minuten kunt gebruiken
Als er een afwijking in de uitvoer optreedt, gebruik dan een korte checklist voordat je de prompt aanraakt. Dit is de eenvoudigste manier om de oorzaak te achterhalen waarom de resultaten van AI-prompts veranderen in uw omgeving.
Stap 1: Bepaal het type afwijking
- Stijlverschuiving: dezelfde inhoud, maar met een andere toon of opbouw.
- Afwijking van het waarnemingsgebied: het antwoord belicht een ander aspect of voegt delen toe of laat delen weg.
- Feitelijke afwijking: claims of cijfers veranderen.
- Afwijking van het beleid: er verschijnen of verdwijnen weigeringen, waarschuwingen of veiligheidsinformatie.
Stap 2: Voer een gecontroleerde herhaling uit
Voer drie runs uit in afzonderlijke sessies met exact dezelfde ingevoegde prompt. Als de spreiding groot is, heb je te maken met steekproefvariantie of ophaalvariantie, en niet met een eenmalig incident.
Stap 3: Schakel het ophalen in of uit (indien mogelijk)
Als het uitschakelen van bronnen/bladeren de resultaten aanzienlijk stabieler maakt, is je “promptprobleem” waarschijnlijk een ophaalprobleem. De oplossing ligt dan in het beheersen van de context, niet in het herschrijven van de instructie.
Stap 4: Zo min mogelijk metagegevens vastleggen
Je hebt geen zwaar systeem nodig om drift verklaarbaar te maken. Eén rij in een spreadsheet per run is voldoende:
- Datum/tijd
- Tool (ChatGPT / Gemini / Perplexity)
- Prompt-ID en exacte tekst
- Modusvlaggen (bronnen aan/uit)
- Regio/taal
- Opmerkingen over de wijzigingen
Een eenvoudige tabel om afwijkingen te koppelen aan mogelijke oorzaken
Deze tabel is bedoeld om je te helpen de overstap te maken van “het is veranderd” naar “dit moet je nu controleren”.”
| Wat je waarneemt | Meest waarschijnlijke bestuurder | Het eerste wat je moet testen |
|---|---|---|
| Elke run heeft een andere structuur | Steekproefvariantie, zwakke beperkingen | Een uitvoerformaat en volgorde van de secties opleggen |
| Verschillende bronnen/verwijzingen | Variaantie in het ophalen | Voer het opnieuw uit met de bronnen uitgeschakeld, en vergelijk vervolgens |
| Het antwoord verandert na eerdere chatberichten | Sessiegeschiedenis | Nieuwe chat-baseline-runs |
| Nieuwe weigeringen of extra waarschuwingen | Beleids- of systeemmelding: update | Probeer een ander hulpmiddel uit; noteer de data en de modi |
| De feiten veranderen van week tot week | Actualiteit, bijgewerkte bronnen, wijzigingen in de tools | Controleer of het ophalen tijdgevoelig is |
Hoe je drift kunt verminderen zonder dat de prompts te omvangrijk worden
Stabiliteit ontstaat door het aantal vrijheidsgraden te verminderen, niet door langere prompts te schrijven. Meestal volstaan een paar gerichte aanpassingen.
Gebruik een ‘antwoord-eerst’-blok binnen de prompt
Geef het model precies aan wat het als eerste moet vermelden. Dit verkleint de kans dat het “een andere inleiding kiest” en daardoor uiteindelijk tot een heel ander eindantwoord komt.
- “Begin met een definitie van twee zinnen.”
- “Noem vervolgens vijf punten met oorzaken.”
- “Geef dan een checklist.”
Dit komt overeen met hetzelfde principe van extraheerbaarheid dat voor webpagina’s wordt gehanteerd. Als je inhoud aanpast voor assistenten, hoe schrijf je een ‘answer-first’-blok voor AI-offertes is een goed voorbeeld om te volgen.
Maak de evaluatie expliciet
Als je waarde hecht aan juistheid, geef dan aan wat je onder “juist” verstaat. Als je waarde hecht aan bronvermeldingen, geef dan aan: “vermeld bronnen voor beweringen die op externe feiten zijn gebaseerd.”
Maak onderscheid tussen basisprompts en experimentele prompts
Houd een ‘bevroren’ set prompts bij om afwijkingen in de loop van de tijd bij te houden. Breng wijzigingen alleen aan in een experimentele set met versiebeheer, zodat je wijzigingen in de prompts niet verwart met wijzigingen in de omgeving.
Een gezaghebbende bron om definities op elkaar af te stemmen
Teams krijgen soms ruzie omdat ze verschillende definities hanteren van termen als “generatieve AI”, “retrieval” of “grounding”. Als je een neutraal, gemeenschappelijk uitgangspunt nodig hebt, is het overzicht van Wikipedia over generatieve kunstmatige intelligentie een handig naslagwerk: Generatieve kunstmatige intelligentie.
Wat te doen als afdwalen het vertrouwen ondermijnt
Als je belanghebbenden hun vertrouwen in AI-uitkomsten verliezen, begin dan niet met het herschrijven van elke prompt. Begin in plaats daarvan met het monitoren van de uitvoeringen, het beheren van de sessiestatus en het labelen van afwijkingen op basis van de oorzaak.
Als u ondersteuning wilt om hier een herhaalbaar systeem van te maken – met reeksen zoekopdrachten, logboekregistratie en een inhoudsstructuur die ervoor zorgt dat uw pagina’s vaker worden opgehaald en geciteerd – kan Authora u helpen bij het opzetten van een beheerde workflow die zowel klassiek zoeken als AI-gestuurde zoekresultaten ondersteunt.