IWD und Prof. Dr. Marko Sarstedt im Interview: Wie KI neue Zugänge schafft und gute Forschung, Relevanz und Stringenz sichert

Ein Prompt, drei Sekunden, eine überzeugende Antwort. Für viele fühlt sich das heute an wie Marktforschung. Ist es aber nicht. Wo endet das Prompten, wo beginnt Forschung, und wer betreibt diese künftig? Darüber sprechen Sandra Baethge und Prof. Dr. Dr. h.c. Marko Sarstedt, Professor für Marketing an der Ludwig-Maximilians-Universität München. 

 

Jemand außerhalb der Marktforschung fragt ein LLM nach einer Zielgruppe, bekommt eine glatte Antwort und ist überzeugt, geforscht zu haben. Was ist daran das Problem?

Sandra Baethge: Nicht, dass die KI mal danebenliegt, das passiert jeder Methode. Das Problem ist, dass überzeugend klingende Antworten heute Menschen erreichen, die nicht beurteilen können, ob dahinter Forschung steckt. Früher wusste man bei einer Studie, dass ein Handwerk dahinter-steht, eine Stichprobe, eine Methode, eine Qualitätskontrolle der Daten. Heute liefert ein Chatfenster in Sekunden etwas, das nach Ergebnis aussieht, flüssig formuliert und selbstbewusst vorgetragen. Genau diese Sicherheit im Ton ist das Verführerische. Der Unterschied zwischen einer plausiblen Formulierung und einer belastbaren Erkenntnis wird zunehmend unsichtbar.

 

Das klingt nach einer Bedrohung für die Branche.

Sandra Baethge: Es ist eine Herausforderung, der wir uns als Branche stellen müssen. Nicht die KI ersetzt Marktforschende, sondern Marktforschende, die KI beherschen, ersetzen die, die sie ignorieren. Wer jetzt nicht am Ball bleibt, verliert den Anschluss und am Ende seine Rolle. Genau deshalb sehe ich vor allem eine Chance, und dafür lohnt der Blick nach außen statt nach innen. Wir können dieses Feld als die sich klassische Studien nie leisten konnten, sei es aus Kosten- oder Zeitgründen. Der Gründer, der schnell wissen muss, ob seine Idee trägt. Der Mittelständler, der eine Entscheidung nicht monatelang aufschieben kann. Der Bedarf war immer da, er wird jetzt nur sichtbar.

 

Was entscheidet, ob aus diesem neuen Zugang gute Forschung wird?

Sandra Baethge: Relevanz und Stringenz. Relevanz heißt, dass die richtige Frage gestellt wird, eine, die für die Entscheidung tatsächlich zählt, und nicht nur die, die sich am leichtesten beantworten lässt. Stringenz bedeutet, dass der Weg zur Antwort trägt, also Datenbasis, Methode und Auswertung nachvollziehbar zusammenpassen. Das eine ohne das andere hilft nicht: Eine stringente Antwort auf die falsche Frage ist genauso wertlos wie eine relevante Frage, die nachlässig beantwortet wird. Es braucht Systeme, die diese Maßstäbe halten, auch wenn niemand mehr hinsieht.

Marko Sarstedt: Stringenz ist kein Selbstzweck, sondern die Voraussetzung dafür, dass Ergebnisse als belastbare Entscheidungsgrundlage dienen können. Wir fragen in unserer Forschung deshalb nicht, ob eine Antwort plausibel klingt, sondern ob sie tatsächlich das misst, was sie zu messen vorgibt, und ob sie unter denselben Bedingungen reproduzierbar ist. Genau diese Prüfung fehlt häufig, wenn LLMs [Sprachmodelle] eingesetzt werden. Ihre Antworten wirken überzeugend, doch ohne eine systematische Validierung bleibt unklar, ob sie auch reliabel und valide sind. Deshalb braucht es auch im Zeitalter der KI Menschen, die Forschungsdesigns entwickeln und KI-generierte Ergebnisse kritisch hinterfragen und deren Qualität beurteilen können.

Sandra Baethge: Wir brauchen dafür ein Zusammenspiel aus drei Dingen. Erstens: eine belastbare Datenbasis statt beliebiger Social-Media-Daten. Denn ein Modell ist nur so gut wie das, worauf es beruht. Zweitens: Marktforschungsexpertise, die methodisch an die Hand nimmt, die richtige Frage findet und die Fallstricke kennt. Drittens: Technologie, die das zugänglich macht, einfach und intuitiv. Diese Verbindung sollten wir als Marktforschende prägen, nicht branchenfremde Technikerinnen und Techniker.

 

Damit sind wir bei der Kernfrage. Können LLMs menschliche Befragte mittlerweile ersetzen?

Marko Sarstedt: In der Breite nicht. In der Forschung sprechen wir von Silicon Samples, synthetischen Stichproben, die ein LLM erzeugt, um menschliche Befragte nachzubilden. In unserer Literaturauswertung von über 285 Vergleichen zwischen synthetischen und menschlichen Stichproben stimmten nur 24,9 Prozent gut überein. 65,3 Prozent wichen deutlich voneinander ab, 9,8 Prozent waren ansatzweise ähnlich. Stabile Merkmale wie Persönlichkeitszüge oder politische Präferenzen lassen sich oft reproduzieren. Bei etablierten Effekten des Konsumentenverhaltens ver-sagen die Modelle dagegen häufig. Unser Fazit: Aktuelle Standardmodelle sind schlicht nicht darauf ausgelegt, individuelle Lebenserfahrungen abzubilden, die echte mensch-liche Entscheidungen prägen. Als genereller Ersatz taugen sie nach heutigem Stand nicht.

 

Hat sich dieses Bild durch die rasante Weiterentwicklung der Modelle inzwischen verändert?

Marko Sarstedt: Weniger, als viele erwarten würden. Die jüngsten Modellgenerationen haben zwar Fortschritte gebracht, der ganz große Leistungssprung ist jedoch ausgeblieben. Spannender ist deshalb ein anderer Trend: Statt immer größere Modelle zu entwickeln, werden Modelle zunehmend für spezifische Aufgaben und Anwendungsbereiche angepasst. Solche spezialisierten Modelle, die mit kontextspezifischen Daten arbeiten oder gezielt erweitert werden, bilden menschliches Verhalten häufig deutlich besser ab als universelle Standardmodelle. Darin sehe ich die eigentliche Zukunft, nicht im Wettlauf um immer neue Versionsnummern.

 

Unter welchen Voraussetzungen können LLMs dennoch verlässliche synthetische Daten liefern?

Marko Sarstedt: Zunächst muss man realistisch einschätzen, wofür sie geeignet sind. Besonders hilfreich sind LLMs in frühen Forschungsphasen, beispielsweise für Pretests oder die Entwicklung von Hypothesen. Sollten sie darüber hinaus als Ersatz oder Ergänzung menschlicher Stichpro-ben dienen, sind mehrere Voraussetzungen entscheidend. Erstens müssen die Modelle mit möglichst kontextspezifi-schen Informationen arbeiten, denn ihre Antworten spiegeln die Trainingsdaten wider, die häufig von englischsprachigen Quellen geprägt sind. Zweitens kommt es auf das Prompt-Design an. Schon kleine Änderungen bei Reihenfolge, Formulierung oder Benennung von Antwortoptionen können die Ergebnisse systematisch verändern. Und drittens gilt: Ohne Validierung geht es nicht. KI-generierte Daten müssen immer mit realen menschlichen Daten verglichen werden, bevor daraus wissenschaftliche oder prak-tische Schlussfolgerungen gezogen werden.

 

Was heißt Validierung an dieser Stelle konkret?

Marko Sarstedt: Man stellt die synthetischen Ergebnisse einer menschlichen Benchmark gegenüber, und zwar nicht nur den Mittelwert. Entscheidend ist die gesamte Verteilung, also auch, wie stark die Antworten streuen. Ein Modell kann im Durchschnitt richtig liegen und trotzdem die Vielfalt der Meinungen verfehlen. Genau das passiert häu-fig, denn dem Output von LLMs fehlt es an Varianz. Für die Marktforschung ist das heikel, weil wir Varianz brauchen, um Zusammenhänge zu erkennen und Segmente zu bilden. Wer nur die Mitte trifft, verliert die Ränder, und die sind oft die eigentlich interessanten. Hinzu kommt: Man sollte mehrere Modelle einsetzen und prüfen, ob sie zu vergleich-baren Ergebnissen kommen, und die Prompts systematisch variieren, um zu sehen, wie stabil die Ausgabe ist. Je näher die synthetische Verteilung an der menschlichen liegt, desto belastbarer die Stichprobe. Erst durch diese Prüfung wissen wir, unter welchen Bedingungen wir den Ergebnissen vertrauen können – und unter welchen nicht.

 

Woran erkennt ein Auftraggeber, ob er einem KI-gestützten Ansatz trauen kann?

Marko Sarstedt: Er sollte drei Dinge fragen. Worauf beruht das Modell, also welche Trainingsdaten stecken dahinter? Wird die synthetische Stichprobe an realen Daten validiert, und wenn ja, wie? Und wird offen benannt, wo der Ansatz an Grenzen stößt? Wer auf diese Fragen keine klaren Ant-worten bekommt, sollte vorsichtig sein.

 

Wie kann man diese Anforderung in ein Werkzeug übersetzen?

Sandra Baethge: Natürlich forschen auch wir beim IWD an genau dieser Frage. Mit AVAtwins haben wir ein System entwickelt, das auf real erhobenen Daten beruht und auf fast 30 Jahren Marktforschungsexpertise aufsetzt. Als ISO-zertifiziertes Institut bringen wir die Standards ein, die es hier braucht, von der Konstruktion belastbarer Fragebögen über die Validierung der Daten bis hin zur Einordnung der Ergebnisse. Es ist unser Angebot an den neuen Markt: ein System, das einfach zu bedienen ist und dem man vertrauen kann. 

Der Nutzen zuerst: Ein Unternehmen hat eine Frage an sei-ne Zielgruppe. Genau dort setzen wir an. Es bekommt eine methodisch geführte Antwort, in Stunden statt Wochen, auch auf Fragen, die vorher gar nicht erforscht wurden. Dahinter steht eine belastbare, real erhobene Datenbasis, auf der eine psychologische Profilierung aufliegt. Der Nutzer wird intuitiv durch einen Forschungsprozess geführt, statt vor einem leeren Prompt Fenster allein zu bleiben. Am Ende steht keine Antwortwolke, sondern eine verdichtete Auswertung, mit der sich entscheiden lässt. Der Gewinn ist nicht die Geschwindigkeit allein, sondern dass Entscheidungen möglich werden, die vorher an Kosten und Zeit gescheitert sind.

 

Prof. Dr. Sarstedt, validieren Sie solche Systeme auch in der Praxis?

Marko Sarstedt: Ja, und wir legen dabei wissenschaftlich fundierte Maßstäbe an. Beruht das System auf kontextspezifischen Daten? Wird der Weg von der Frage zur Antwort methodisch geführt? Und halten die Ergebnisse einem Abgleich mit realen Daten stand, und zwar in ihrer Verteilung, nicht nur im Mittelwert? Grundsätzlich gilt: Validierung ist kein einmaliger Nachweis, sondern ein kontinuierlicher Prozess. Nur so können wir sicherstellen, dass ein KI-System auch dann noch verlässliche Ergebnisse liefert, wenn sich Daten oder Anwendungsfälle verändern.

Sandra Baethge: Genau hier setzen wir auch bei AVAtwins an. Bei uns sind Reliabilität und Validität fest im Prozess verankert. Beispielsweise lassen wir die Berechnungen an den kritischen Stellen, etwa bei der Hintergrundrecherche und der Parametrisierung der digitalen Zwillinge, mehrfach laufen und legen sie übereinander, um die für die Modelle typischen Ausreißer herauszufiltern und ein stabiles Ergebnis zu liefern. 

 

Was sollten Marktforschende aus all dem mitnehmen?

Sandra Baethge: Dass KI unsere Arbeit nicht ersetzt, sondern das Feld erweitert. Es kommen Fragen und Auftraggeber dazu, die es vorher nicht gab. Unsere Rolle verschiebt sich dabei, und zwar zu unseren Gunsten, wenn wir sie annehmen: Wir werden mehr denn je zur Qualitätsinstanz. Ob die neuen Zugänge beliebig bleiben oder belastbar werden, liegt an uns. Wer jetzt gestaltet, sichert nicht nur seine Rolle, er erschließt sich einen Markt, den es vorher nicht gab.

Marko Sarstedt: Und wir sollten ehrlich bleiben. Wer die Grenzen offen benennt, schafft Vertrauen. Genau darin liegt der Unterschied zwischen guter und schlechter KI-gestützter Forschung. Das ist keine Bedrohung für die Marktforschung, sondern ihre eigentliche Stärke.

 

Sandra Baethge ist Geschäftsführerin der IWD market research GmbH und der MTI Market Twin Intelligence GmbH. Seit über elf Jahren lehrt sie zudem als Dozentin an der Dualen Hochschule Baden-Württemberg am Standort Heilbronn.

Prof. Dr. Dr. h. c. Marko Sarstedt ist Professor für Marketing am Institut für Marketing der Ludwig-Maximilians-Universität München. Er forscht unter anderem zu Methoden der Marktforschung und zum Einsatz großer Sprachmodelle für synthetische Daten.

 

Literatur:

  1. Sarstedt, M., Adler, S. J., Rau, L. & Schmitt, B. (2024): Using large language models to generate silicon samples in con-sumer and marketing research: Challenges, opportunities, and guidelines. Psychology & Marketing, 41(6), 1254-1270. doi 10.1002/mar.21982
  2. Sarstedt, M., Adler, S. J., Rau, L. & Schmitt, B. (2026): Your next respondent might be an LLM: Guidelines for using silicon samples in marketing research. NIM Marketing Intelligence Review, 18(1), 24-29. doi 10.2478/nimmir-2026-0004

 

+49 (0)391 7347 053

Mo-Fr 08:00-18:00 Uhr

Kontaktformular

Produktanfrage stellen

info@iwd-marketresearch.de

Senden Sie uns eine E-Mail

Bewerbung als Interviewer

Werde Teil des Teams