Achtergrond
Waarom synthetisch onderzoek via een LLM?
Een AI is geen mens en geen steekproef. Toch levert het bruikbaar onderzoek op, maar alleen voor bepaalde vragen, en aantoonbaar niet voor andere. Deze pagina legt uit waarom dat zo is, wat de literatuur erover zegt, en hoe wij dat vertaald hebben naar het oordeel dat je in elk rapport ziet.
De korte versie
- Een taalmodel is getraind op enorme hoeveelheden menselijke taal. Daarin zitten patronen over hoe mensen met een bepaalde achtergrond ergens over praten. Dát is wat het nabootst. Geen persoon, maar een taalpatroon.
- Daarom zijn vergelijkingen betrouwbaarder dan niveaus. Welk concept wint, klopt vaak. Dat 38% zegt zeker te kopen, klopt vrijwel nooit.
- De bekendste faalmodus is niet dat het model er ver naast zit, maar dat het te zeker is: te weinig spreiding, een verdeling die smaller is dan de werkelijkheid.
Het mechanisme
Wat een taalmodel eigenlijk simuleert
Het is verleidelijk om te denken dat een taalmodel een mens nabootst. Dat doet het niet. Het voorspelt welke tekst waarschijnlijk volgt op de tekst die het krijgt. Geef je het de beschrijving van een 52-jarige uitvoerder in de bouw en daarna een stelling over planningssoftware, dan produceert het het antwoord dat in zijn trainingsdata het meest waarschijnlijk volgt op die combinatie.
Dat klinkt als een zwaktebod, maar het is precies waarom het werkt. Mensen met een vergelijkbare achtergrond schrijven op internet, in fora, in interviews en in artikelen over dezelfde onderwerpen op herkenbaar vergelijkbare manieren. Die correlatie tussen achtergrond en taalgebruik is fijn genoeg om er iets mee te doen: Argyle 2023 noemde dat algorithmic fidelity en liet zien dat een op demografie geconditioneerd model antwoordverdelingen van menselijke subgroepen benadert.
Wat je krijgt is dus een gemiddelde van hoe er over een groep geschreven wordt, niet een trekking uit die groep. Dat onderscheid verklaart bijna alles wat hierna komt: waar het gemiddelde volstaat werkt de methode, en waar je de spreiding of het absolute niveau nodig hebt niet.
Wat werkt
Waar de literatuur positief over is
Richting en rangorde. Horton 2023 behandelde taalmodellen als economische agenten en reproduceerde klassieke gedragsexperimenten kwalitatief: de richting van het effect klopt, ook al klopt de omvang niet. Voor een concepttest is dat vaak genoeg. Je wilt weten wélk concept wint, niet met hoeveel procentpunt.
Herhaalbaarheid, mits je goed meet. Over 57 echte consumentenonderzoeken met 9.300 deelnemers halen synthetische respondenten ongeveer 90% van de test-hertestbetrouwbaarheid van mensen Maier 2025. Dat is een hoge lat: mensen die je twee keer dezelfde vraag stelt, antwoorden zelf ook niet identiek. De adder zit in de methode, zie hieronder.
Individuele nabootsing, mits je genoeg weet. De sterkste resultaten komen uit werk waarin het model niet op demografie draait maar op een echt interview. Park 2024 nam bij 1.052 mensen een gesprek van twee uur af, gebruikte dat transcript als geheugen van een agent, en zag twee weken later ongeveer 85% overeenkomst met de antwoorden van het origineel. Dat is een belangrijke nuance: hoe rijker de input over een persoon, hoe beter de simulatie. Een profielbeschrijving is armer dan een interview van twee uur, en de kwaliteit zakt navenant.
Er is inmiddels iets om tegen te meten. Toubia 2025 publiceerde een dataset van 2.058 mensen die elk 500 vragen beantwoordden, met een ingebouwde test-hertestbasis. Daarmee verschuift het debat van meningen naar metingen.
Wat niet werkt
Waar het aantoonbaar misgaat
Te weinig spreiding. Dit is de belangrijkste bevinding en tegelijk de makkelijkste om over het hoofd te zien. Boelaert 2025 toetste modellen tegen de World Values Survey in vijf landen en vond een sterke bias én een lage variantie per onderwerp, en die afwijking verspringt willekeurig van onderwerp naar onderwerp. Het model geeft dus een te smal, te zelfverzekerd antwoord, en je kunt niet voorspellen welke kant het op leunt.
Het gemiddelde klopt terwijl de verdeling niet klopt. Bisbee 2024 vond dat de gemiddelden die een model produceert dicht bij de ANES-survey liggen, maar de spreiding eromheen niet, en dat de uitkomsten slecht reproduceerbaar zijn tussen runs. Dat is verraderlijker dan een grove fout: een tabel die er plausibel uitziet nodigt uit om erop te bouwen.
Groepen worden afgevlakt. Santurkar 2023 vergeleek modelantwoorden met peilingen onder 60 Amerikaanse demografische groepen en vond een afwijking die niet verdwijnt als je het model expliciet naar een groep stuurt. Sommige groepen worden structureel slecht weergegeven. Wang 2025 liet met 3.200 deelnemers over 16 identiteitsgroepen zien dat modellen groepen terugbrengen tot een stereotiep gemiddelde en de variatie bínnen die groep missen.
En een beperking die op ons eigen ontwerp slaat. Datzelfde onderzoek laat zien dat de manier van vragen uitmaakt. Vraag je een model rechtstreeks om een cijfer op een schaal (precies wat wij doen, met een verplichte waarde van 1 tot 5), dan komt er een onrealistische verdeling uit. Meet je in plaats daarvan hoe sterk een vrij geformuleerd antwoord lijkt op elk schaalpunt, dan blijft de verdeling wél realistisch Maier 2025. Wij hebben die methode nog niet geïmplementeerd. Dat is de directe reden dat er een variantiecheck op je eigen antwoorden draait: die markeert wanneer een vraag te smal is uitgevallen, in plaats van de uitkomst te presenteren alsof er niets aan de hand is. Het staat op onze lijst.
Prijs is het zwakste punt. Specifiek voor marktonderzoek: Brand 2023 vond dat schattingen van betalingsbereidheid soms in de buurt komen van menselijke studies, maar vaak onnauwkeurig zijn en in sommige gevallen zelfs de verkeerde kant op: het model zegt duurder waar mensen goedkoper zeggen. Bij prijs stapelen twee problemen: de synthetische bias, en het feit dat ook echte respondenten hun eigen koopgedrag slecht voorspellen.
Van literatuur naar oordeel
Hoe dit je betrouwbaarheidsscore bepaalt
De benchmark-tabel in dit platform is een directe vertaling van het bovenstaande. Per vraagtype ligt vast wat je ervan mag verwachten, met de bron erbij. De tabel is bewust configuratie en geen logica, zodat hij per branche bijgesteld kan worden zonder de advies-engine aan te raken.
Voorkeur of ranking tussen concepten/boodschappen
HoogRelatieve voorkeuren tussen alternatieven komen in vergelijkende studies het dichtst bij echte respondenten: de rangorde klopt vaak, ook als de absolute scores afwijken.
Een rangorde is een vergelijking binnen dezelfde run. De bias die het model op een onderwerp heeft, drukt op beide alternatieven ongeveer even hard, en valt dus grotendeels weg in het verschil.
Onderbouwing: Maier 2025, Argyle 2023
Kwalitatieve thema's, behoeften en bezwaren
Midden-hoogSynthetische respondenten benoemen de meeste thema's die echte respondenten ook noemen, maar wegen ze anders en missen soms context-specifieke bezwaren.
Wélke bezwaren en motieven er spelen, weet het model goed. Hoe zwaar ze onderling wegen niet. Daarvoor moet je het echt hebben meegemaakt, en dat haal je niet uit een profielbeschrijving.
Onderbouwing: Park 2024, Horton 2023
Absolute percentages (bijv. "% dat zeker koopt")
LaagSynthetische respondenten zijn systematisch positiever en minder gespreid dan echte steekproeven; absolute niveaus wijken structureel af.
Het niveau is precies wat de bias verschuift, en de te smalle spreiding maakt dat niveau ook nog eens vals overtuigend. Twee fouten die dezelfde kant op wijzen.
Onderbouwing: Bisbee 2024, Boelaert 2025, Santurkar 2023
Koopintentie, prijsperceptie en betalingsbereidheid
LaagKoopintentie en prijs zijn zelfs bij echte respondenten zwakke voorspellers van gedrag; synthetisch komt daar een extra bias bovenop.
Bij prijs komt er bovenop de synthetische bias nog een tweede probleem: ook echte mensen voorspellen hun eigen koopgedrag slecht. Twee zwakke schakels achter elkaar.
Onderbouwing: Brand 2023
Waarom een nichedoelgroep een niveau kost
Hoe smaller de groep, hoe minder representatief materiaal het model erover heeft gezien, en hoe sterker het terugvalt op een stereotiep gemiddelde. Bij een gevoelig onderwerp komt daar bovenop dat ook echte mensen sociaal wenselijk antwoorden, twee foutbronnen tegelijk. Wang 2025, Santurkar 2023
Waarom we de spreiding in jouw eigen data controleren
Omdat de afwijking per onderwerp verspringt, kun je hem niet vooraf wegrekenen. Je kunt alleen achteraf zien of hij in jouw run heeft toegeslagen. Daarom draaien er drie checks op je eigen antwoorden: variantie per vraag, split-half stabiliteit over twee helften van de pool, en onderscheidend vermogen bij vergelijkingen. Ze staan los van de benchmark en worden deterministisch in code berekend. Boelaert 2025
Grenzen
Wat wij hiermee niet beweren
- Dat dit echt marktonderzoek vervangt. Het is geen statistisch representatieve steekproef en het pretendeert dat nergens te zijn.
- Dat ons betrouwbaarheidsoordeel een meting is van jouw onderzoek. Het is een verwachting, gebaseerd op hoe deze methode het gemiddeld doet naast echt onderzoek, plus een paar controles op je eigen resultaten. Een vergelijking met jouw echte cijfers bestaat niet, want die heb je nog niet.
- Dat de literatuur af is. Het veld is een paar jaar oud, een deel van het werk hierboven is nog preprint, en de uitkomsten verschillen per model en per methode. We werken aan een calibratielus waarin klanten echte onderzoeksresultaten naast hun synthetische leggen, zodat de benchmarks op eigen metingen komen te rusten in plaats van op literatuur alleen.
- Dat een duurder model automatisch betrouwbaarder onderzoek geeft. Een groter model geeft rijkere antwoorden, maar de systematische bias van de methode verdwijnt er niet mee.
Bronnen
De literatuur waarop dit rust
Auteurs, jaar en vindplaats zijn nagelopen. Waar iets nog niet peer-reviewed is, staat dat erbij. Een preprint weegt minder zwaar dan een gepubliceerd artikel.
- 01
Out of One, Many: Using Language Models to Simulate Human Samples
Argyle, Busby, Fulda, Gubler, Rytting & Wingate · 2023 · Political Analysis 31(3), 337–351peer-reviewed
Introduceert het begrip algorithmic fidelity: conditioneer je een taalmodel op een demografische achtergrond, dan benadert de antwoordverdeling die van de bijbehorende menselijke subgroep. De basis onder het idee van silicon samples.
- 02
Large Language Models as Simulated Economic Agents: What Can We Learn from Homo Silicus?
Horton, Filippas & Manning · 2023 · NBER Working Paper 31122working paper
Laat zien dat je een taalmodel als economische agent kunt behandelen: geef het voorkeuren en informatie, en klassieke gedragsexperimenten reproduceren kwalitatief. Sterk in de richting van effecten, niet in de omvang ervan.
- 03
Generative Agent Simulations of 1,000 People
Park, Zou, Shaw, Hill, Cai, Morris, Willer, Liang & Bernstein · 2024 · arXiv:2411.10109preprint
1.052 mensen kregen een interview van twee uur; die transcripten werden het geheugen van een agent. Twee weken later reproduceerden de agents de antwoorden van hun origineel met ongeveer 85% nauwkeurigheid. Rijke individuele input maakt het verschil, niet demografie alleen.
- 04
Toubia, Gui, Peng, Merlau, Li & Chen · 2025 · Marketing Sciencepeer-reviewed
Een publieke benchmark van 2.058 respondenten met 500 vragen, inclusief een test-hertestbasis. Maakt het voor het eerst mogelijk om te meten hoe goed een synthetische respondent is in plaats van erover te speculeren.
Achter een betaalmuur? Ook preprint op arXiv.
- 05
LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings
Maier, Aslak, Fiaschi, Rismal, Fletcher, Luhmann, Dow, Pappas & Wiecki · 2025 · arXiv:2510.08338preprint
Twee bevindingen die bij elkaar horen. Vraag je een model rechtstreeks om een cijfer, dan komt er een onrealistische verdeling uit. Meet je in plaats daarvan hoe sterk een vrij antwoord lijkt op elk schaalpunt (Semantic Similarity Rating), dan haal je over 57 consumentenonderzoeken met 9.300 deelnemers ongeveer 90% van de menselijke test-hertestbetrouwbaarheid, mét realistische verdelingen.
- 06
Synthetic Replacements for Human Survey Data? The Perils of Large Language Models
Bisbee, Clinton, Dorff, Kenkel & Larson · 2024 · Political Analysis 32(4), 401–416peer-reviewed
De gemiddelden die het model produceert liggen dicht bij die van de ANES-survey, maar de spreiding eromheen niet, en de uitkomsten zijn slecht reproduceerbaar tussen runs. Precies het gemiddelde goed hebben en de verdeling fout is gevaarlijker dan er helemaal naast zitten.
- 07
Machine Bias. How Do Generative Language Models Answer Opinion Polls?
Boelaert, Coavoux, Ollion, Petev & Präg · 2025 · Sociological Methods & Research 54(3), 1156–1196peer-reviewed
Getoetst tegen de World Values Survey in vijf landen: modellen vertonen een sterke bias en een lage variantie per onderwerp, en die bias verspringt willekeurig van onderwerp naar onderwerp. De directe aanleiding voor onze variantiecheck.
- 08
Whose Opinions Do Language Models Reflect?
Santurkar, Durmus, Ladhak, Lee, Liang & Hashimoto · 2023 · ICML 2023 (PMLR 202)peer-reviewed
Vergelijkt modelantwoorden met peilingen onder 60 Amerikaanse demografische groepen. De afwijking is groot en verdwijnt niet als je het model expliciet naar een groep stuurt. Sommige groepen, 65-plussers, weduwen, worden structureel slecht weergegeven.
- 09
Using LLMs for Market Research
Brand, Israeli & Ngwe · 2023 · Harvard Business School Working Paper 23-062working paper
Marktonderzoek specifiek. Schattingen van betalingsbereidheid uit modelantwoorden komen soms in de buurt van menselijke studies, maar zijn vaak onnauwkeurig en in sommige gevallen zelfs verkeerd van teken, het model zegt duurder waar mensen goedkoper zeggen.
Achter een betaalmuur? Ook op SSRN.
- 10
Wang, Morgenstern & Dickerson · 2025 · Nature Machine Intelligence 7, 400–411peer-reviewed
Met 3.200 deelnemers over 16 identiteitsgroepen: modellen vlakken groepen af tot een stereotiep gemiddelde en missen de variatie binnen die groep. De reden dat een nichedoelgroep bij ons een niveau van de betrouwbaarheid afhaalt.
Zie het zelf terug in een rapport
Het voorbeeldrapport laat per onderzoeksvraag zien welk oordeel eruit komt en waarom: inclusief de bureaubriefing als het antwoord niet hard genoeg is.