Marketing & AI11 min leestijdRuben van Twillert

Prompt-optimalisatie voor B2B-marketing: van losse prompts naar een vaste werkwijze

Kort antwoord: Beschrijf eerst waaraan een goede uitvoer voldoet, met een norm die iemand anders dan de schrijver kan beoordelen. Bouw de prompt daarna op uit vaste onderdelen: rol, context, taak en vorm, met één voorbeeld. Test per ronde één variabele tegen de vorige versie. Leg versie, eigenaar en voorbeeld vast, anders levert elke medewerker andere kwaliteit.

Marketingteams gebruiken inmiddels prompts voor teksten, analyses en rapportages. Wat meestal ontbreekt, is een beschrijving van waar die uitvoer aan moet voldoen. Zonder die beschrijving is elke variant even bruikbaar en verschilt de kwaliteit per medewerker, per onderwerp en per dag.

In onze eigen CRM-notities komt dat terug. Tussen 25 juni en 25 september 2026 staan er 334 notities met tekst in het systeem. Daarvan gaan er volgens een eigen trefwoordindeling 79 over contentproductie en werkwijze, en in 7 notities valt het woord prompt. Dat zijn geen prestatiecijfers en ze zeggen niets over resultaat. Ze laten wel zien waar het gesprek in de praktijk over gaat: wie bepaalt wat een goed resultaat is, en hoe houd je dat vast als er meerdere mensen met hetzelfde model werken.

Begin bij de uitkomst, niet bij de opdracht

De handleiding van Anthropic over prompt engineering begint met een voorwaarde die weinig met taal te maken heeft. Je hebt een duidelijke definitie van het succes nodig, een manier om daar empirisch tegen te testen, en een eerste versie van de prompt. Ontbreekt een van die drie, dan heeft elke verbetering geen richting.

Die handleiding geeft zelf een voorbeeld van twee criteria naast elkaar. “The model should classify sentiments well” is geen bruikbaar criterium, omdat er niets in staat dat je kunt meten of tegenspreken. Een criterium met een meetbare score op een vaste testset en een benoemde verbetering ten opzichte van de huidige situatie is dat wel.

Vertaal dat naar marketingwerk. “Een goede LinkedIn-post” kun je niet beoordelen. Werkbaar is bijvoorbeeld: de post opent met een situatie die de doelgroep herkent, bevat één concreet praktijkvoorbeeld met bron, blijft onder de 150 woorden en sluit af met één vervolgstap. Zo'n norm maakt het mogelijk dat iemand anders dan de schrijver de uitvoer afkeurt, en dat is precies wat je nodig hebt wanneer meer mensen met hetzelfde systeem werken.

Bouw de opdracht op uit vaste onderdelen

Een prompt die steeds andere resultaten geeft, mist meestal vaste onderdelen. Wij werken met vier blokken en één voorbeeld.

Het eerste blok beschrijft de rol en het publiek: wie leest dit, in welke functie, en welke voorkennis mag je verwachten. Het tweede blok bevat de context: het onderwerp, de bron, de aanleiding en wat er in eerdere publicaties al over is gezegd. Het derde blok beschrijft de taak in één zin, met de grens erbij wat het antwoord niet mag doen, bijvoorbeeld geen cijfers toevoegen die niet in de bron staan. Het vierde blok beschrijft de vorm: lengte, opbouw, toon en het afsluitende element.

Daarna volgt één goedgekeurd voorbeeld van dezelfde soort tekst. Dat voorbeeld doet meer dan een lange lijst met regels, omdat het laat zien welk detailniveau je verwacht. Wissel je later van model of van seizoen, dan blijft het voorbeeld de maatstaf.

De volgorde is niet toevallig. Wie begint met de vorm en de toon, krijgt een tekst die soepel leest en inhoudelijk niets toevoegt. Wie begint met de context en de grens, houdt het model bij de bron.

Test één variabele per ronde

Een promptset is pas een werkwijze wanneer je kunt zien welke wijziging welk effect heeft. Verander daarom per testronde één onderdeel. Pas je in dezelfde ronde de rol, de lengte en het voorbeeld aan, dan weet je daarna niet welke aanpassing het verschil maakte.

De meetmethoden uit dezelfde documentatie zijn bruikbaar op kleine schaal. Vergelijk een nieuwe versie met de vorige op dezelfde set van bijvoorbeeld tien onderwerpen. Beoordeel de uitvoer met een vaste rubric, met per criterium een score en een korte toelichting. Neem ook twee of drie uitzonderingen mee: een onderwerp waar weinig bronmateriaal voor is, een onderwerp met een gevoelige klantrelatie, en een vraag waarop je zelf het antwoord nog niet scherp hebt.

Leg de scores vast met een test-ID en het versienummer van de prompt. Zonder die vastlegging herhaal je over drie maanden hetzelfde experiment en noem je het een verbetering. Onze eigen meetregel is streng op dit punt: één test verandert exact één variabele, en de uitkomst wordt op dezelfde manier beoordeeld als de vorige ronde.

Waar een prompt niet helpt

De handleiding van Anthropic noemt zelf de grens van het vakgebied. Niet elk criterium of elke tegenvallende test wordt het beste opgelost met prompt engineering. Soms verbeteren snelheid en kosten makkelijker door een andere route of een ander model te kiezen. Voor een marketingteam betekent dat het volgende: blijft de uitvoer structureel fout op feiten, dan is de bron het probleem. Blijft de toon structureel naast de merkstem zitten, dan is de merkstem niet beschreven.

Google voegt daar een tweede grens aan toe. In de richtlijnen over het maken van nuttige content noemt Google verregaande automatisering om over veel onderwerpen content te produceren als waarschuwingssignaal, net als content die vooral samenvat wat anderen al schreven en content die over veel makers of sites wordt verspreid. Een prompt die in een middag twintig pagina's oplevert, is dus geen resultaat. Zonder eigen onderzoek, eigen ervaring of een eigen bron voegt de twintigste pagina niets toe aan de eerste.

Leg de aanpak vast, inclusief eigenaar

Een promptset die alleen in iemands chatgeschiedenis staat, verdwijnt bij het eerste vertrek. Leg daarom drie dingen vast op één plek die het hele team kan vinden: de promptteksten met versienummer, de beoordelingsrubric met de voorbeelden, en de naam van de persoon die wijzigingen goedkeurt.

Koppel daar een vast moment aan. Eén keer per maand de scores nalopen, de rubric bijstellen waar die te vaag blijkt, en de promptversie archiveren die niet meer gebruikt wordt. Zo blijft de set bruikbaar voor nieuwe medewerkers en kun je later uitleggen waarom een bepaalde versie is gekozen.

Werk je met meerdere soorten content, houd dan per soort een eigen set bij. Een prompt voor een kennisbankdefinitie vraagt een andere context en grens dan een prompt voor een commerciële pagina of een rapportage. Eén universele prompt levert gemiddelde teksten op alle drie de plekken.

Meet of het werk klopt, niet alleen of het snel gaat

De verleiding is om promptwerk te beoordelen op tijdwinst. Dat is een tussenstand, geen uitkomst. Meet daarom drie niveaus naast elkaar: de tijd per stuk, de kwaliteit volgens de rubric, en de vervolgstap die uit de content komt.

Voor het derde niveau heb je vaste events nodig. Ons meetmodel gebruikt onder meer content_view, content_scroll_75, content_cta_click en form_submit, met content_id, topic_cluster en test_id als parameters. Daarmee zie je of een tekst die de rubric haalt ook bezoekers naar een vervolgstap brengt, en of dat per promptversie verschilt.

Op dit moment zijn Search Console en GA4 bij ons niet meetbaar omdat de Google-koppeling opnieuw geautoriseerd moet worden. Dat benoemen we liever dan het wegpoetsen: zonder die koppeling kun je de route na de klik niet volgen. De rubric en de tijdmeting blijven dan wel bruikbaar, en dat is precies waarom je een werkwijze vastlegt voordat je op cijfers stuurt.

Werk je aan prompt-optimalisatie binnen bredere online marketing en procesverbetering, dan hoort de rubric bij de afspraken en niet in een los document. Lees eerst wat prompt-optimalisatie is en hoe je een workflow vastlegt wanneer de prompt onderdeel wordt van een vaste keten. Bepaal met de marketingstrategie als download welke onderwerpen prioriteit krijgen, en kijk hoe dat past binnen marketing en AI. Vergelijk daarna met welke AI-tools je echt nodig hebt, want de toolkeuze volgt de werkwijze en niet andersom. Wil je dit samen opzetten, dan kun je de promptaanpak met TTG bespreken.

Veelgestelde vragen

Wat is prompt-optimalisatie precies?

Het is het beschrijven van de gewenste uitvoer, het opbouwen van een opdracht uit vaste onderdelen, en het testen van aanpassingen tegen een vaste norm. Het gaat dus verder dan een goed geschreven opdracht. De norm, de rubric en de vastgelegde versie horen er net zo goed bij.

Hoe lang moet een goede prompt zijn?

Lengte is geen maatstaf. Een werkbare prompt bevat rol en publiek, context met bron, één taak met een grens, de gewenste vorm en één goedgekeurd voorbeeld. Ontbreekt een van die delen, dan vult het model het zelf in, en dan verschilt de uitvoer per keer.

Hoe weet je of een prompt beter is geworden?

Door dezelfde set onderwerpen twee keer te beoordelen met dezelfde rubric en per ronde één variabele te wijzigen. Vergelijk met de vorige versie, niet met een gevoel. Een verschil van één onderwerp is geen verbetering, en zonder vastgelegde scores kun je het later niet meer natrekken.

Werkt dit ook voor rapportages en analyses?

Ja, met een andere norm. Bij een rapportage beoordeel je of de juiste periode en bron zijn gebruikt, of cijfers herleidbaar zijn en of conclusies niet verder gaan dan de data. Leg die normen net zo expliciet vast als bij een tekst, anders verandert een analyse in een samenvatting.

Moet je alles met prompts doen?

Nee. Wat je zelf kunt controleren en wat een vaste bron heeft, leent zich ervoor. Onderwerpen waarin je de bron nog moet vinden, waarin een klantrelatie speelt of waarin een uitspraak juridisch gevoelig is, houd je handmatig. Het model helpt bij het ordenen en herschrijven, niet bij het verzinnen van ervaring.

Terug naar alle blogs

Laat TTG één promptaanpak voor je contentwerk opzetten, testen en vastleggen

We kijken waar je nu zichtbaar bent, waar kansen liggen en welke pagina’s, cases of AI-signalen prioriteit hebben.

Bekijk onze marketing & ai dienst

Boek een video-call met Ruben

Ruben van Twillert

Ruben van Twillert · Mede-eigenaar

Eerst een keer bellen?

Vul je gegevens in en we nemen zo snel mogelijk contact met je op.