Studien kritisch zu lesen fällt schwer, sobald Ihnen der Newsletter am Montagmorgen eine neue Studie meldet: 70 Prozent der Führungskräfte stellen ihr Urteil infrage, wenn eine KI widerspricht. Der Auftraggeber verkauft die passende Lösung gleich mit. Bestellt hatte die Umfrage unter 200 britischen Managern der Datenstreaming-Anbieter Confluent, das RWI kürte den Bericht im März 2026 zur Unstatistik des Monats.
drweb.de als bevorzugte Quelle auf Google hinzufügenQualitätsgeprüfte Inhalte direkt in Google News & DiscoverJetzt hinzufügenLaut einer Studie schlafen die Deutschen schlechter, arbeiten Teams mit KI schlampiger und wachsen Unternehmen mit der richtigen Software schneller. Hinter vielen dieser Sätze steht ein Auftraggeber, der am Ergebnis verdient. Hier lesen Sie, wie Studien Meinung machen, wer sie bezahlt, durch welche Stellschrauben ein Wunschergebnis entsteht und wie Sie in zehn Fragen erkennen, ob eine Untersuchung etwas taugt.
Das Wichtigste in Kürze
- Von der Industrie bezahlte Studien zu Medikamenten und Medizinprodukten kommen laut einer Cochrane-Übersicht über 75 Untersuchungen um 34 Prozent häufiger zu einem günstigen Fazit als unabhängig finanzierte.
- Zuckerindustrie, Tabakkonzerne und Autohersteller haben Forschung gezielt gekauft, um Zweifel zu säen oder ihre Produkte zu entlasten. Die Dokumente dazu liegen heute offen.
- Viele Marketing-Umfragen sind Werbung im Gewand der Wissenschaft: Der Auftraggeber bestimmt Frage, Stichprobe und Veröffentlichung. Bei vielen Testsiegeln bezahlt der Sieger für das Recht, damit zu werben.
- Auch ohne Geldgeber im Hintergrund hält Forschung oft nicht: Bei der Wiederholung von 100 psychologischen Studien kam nur gut ein Drittel erneut zu einem signifikanten Ergebnis.
1 Um wie viel häufiger ziehen von Herstellern bezahlte Medizinstudien laut einer Cochrane-Übersicht ein günstiges Fazit? Aufklappen ↓
Auflösung aufdecken ↓
2 Wer bezahlte 1965 die Harvard-Übersicht, die Fett statt Zucker als Ursache von Herzkrankheiten herausstellte? Aufklappen ↓
Auflösung aufdecken ↓
3 Bei wie viel Prozent der 100 wiederholten Psychologie-Studien ergab sich 2015 erneut ein signifikantes Ergebnis? Aufklappen ↓
Auflösung aufdecken ↓
4 Was muss Werbung mit einem Testsiegel nach einem Urteil des Bundesgerichtshofs von 2021 angeben? Aufklappen ↓
Auflösung aufdecken ↓
5 Wie viele Teilnehmer gingen in die Auswertung von John Bohannons Schokoladen-Diät ein? Aufklappen ↓
Auflösung aufdecken ↓
Warum machen Studien Meinung?

Studien machen Meinung, weil sie wie ein Beweis klingen. Die Wendung „laut einer Studie“ verleiht jeder Behauptung Autorität, auch wenn der Auftraggeber das Ergebnis bestellt, die Stichprobe winzig und die Methode geheim ist.
Menschen orientieren sich an Autoritäten und am Verhalten anderer, wenn ihnen das eigene Wissen fehlt. Der Psychologe Robert Cialdini hat beides als Grundprinzipien der Überzeugung beschrieben, und Marketingabteilungen nutzen das zweite Prinzip als Social Proof bis heute.
Eine Studie vereint beide Prinzipien unter einem einzigen Etikett: Wissenschaftler haben gemessen, und die Mehrheit sieht das genauso.
Der Datenstreaming-Anbieter Confluent ließ 200 britische Führungskräfte befragen und veröffentlichte die Antworten als Quick Thinking 2.0 Report. Darin stand unter anderem, 70 Prozent der Befragten stellten ihr eigenes Urteil infrage, sobald eine KI widerspreche. Die Bertelsmann Stiftung griff den Bericht in ihrem KI-Newsletter als „neue Studie“ auf, ein verlinkter Beitrag spitzte ihn zur Warnung zu, das Auslagern von Denkarbeit lasse „das Gehirn verkümmern“.
Gemessen hatte niemand ein Gehirn. Der Report erhob Selbstauskünfte zu Einstellungen und maß kein kritisches Denken.
Das RWI in Essen erklärte den Vorgang zur Unstatistik des Monats. Die Ökonomen und Statistiker hinter der Rubrik zählten die klassischen Merkmale auf: eine kleine, eng begrenzte Stichprobe, als Ursache gedeutete Selbstauskünfte, Prozentwerte ohne offengelegte Methode und ein Auftraggeber im Hintergrund.
Als Lösung für die beklagte Entscheidungsnot empfahl der Report bessere Dateninfrastrukturen und „Data Streaming“, also genau das Geschäft von Confluent.
Nach demselben Muster ging im November 2025 eine Unfallanalyse von Allianz Direct durch die Medien. „DAS sind die gefährlichsten Straßen Deutschlands!“, titelte Bild. Der Direktversicherer hatte vor allem gezählt, wo viele Unfälle passieren, und das sind die Straßen mit viel Verkehr. Das RWI verglich die Logik mit der Erkenntnis, dass große Supermärkte mehr Joghurt verkaufen als kleine. Gemessen am Anteil schwerer Unfälle lag Nordrhein-Westfalen, laut Ranking das gefährlichste Bundesland, nur auf Platz sechs.
Der Weg einer PR-Studie in die Schlagzeile folgt einem festen Ablauf: Ein Unternehmen gibt eine Erhebung in Auftrag, die Pressestelle stellt eine zugespitzte Zahl heraus, Redaktionen übernehmen sie unter Zeitdruck. Am Ende zitiert niemand mehr den Auftraggeber, übrig bleibt „eine Studie zeigt“.
Das Marketing leiht sich die Seriosität der Wissenschaft kostenlos, und der Leser hält die Werbebotschaft für einen Befund.
Eine Studie wirkt als Autoritätsbeweis, unabhängig davon, wie sie entstanden ist. Unternehmen nutzen das, indem sie Umfragen bestellen, deren Fazit zu ihrem Produkt passt.
Wer bestimmt bei einer Studie die Musik?

Meist derjenige, der zahlt und vom Ergebnis profitiert. Eine Cochrane-Übersicht über 75 Untersuchungen kommt zu dem Schluss: Von Herstellern bezahlte Studien zu Medikamenten und Medizinprodukten ziehen um 34 Prozent häufiger ein günstiges Fazit als unabhängig finanzierte.
Der Befund stammt von dem dänischen Mediziner Andreas Lundh und Kollegen, veröffentlicht 2017 in der Cochrane Library, der Referenzsammlung für systematische Übersichten in der Medizin. Bei den Wirksamkeitsergebnissen lag der Vorsprung industriefinanzierter Studien gegenüber unabhängig finanzierten bei 27 Prozent. Die Autoren fanden einen Industrie-Bias, den die üblichen Prüfkriterien für Studienqualität nicht erklären. An schlechterer Methodik lag der Unterschied also nicht, das Fazit fiel trotzdem freundlicher aus.
Schon 2003 bündelte eine Metaanalyse im Fachblatt JAMA acht Arbeiten mit 1.140 Originalstudien: Bei Industriesponsoring war die Chance auf ein industriefreundliches Fazit 3,6-mal so hoch wie ohne Sponsoring.
Forscher um Lenard Lesser und David Ludwig vom Boston Children’s Hospital werteten 2007 in PLoS Medicine 206 Fachartikel zu Softdrinks, Säften und Milch aus. Arbeiten, die allein von Herstellern bezahlt waren, kamen vier- bis achtmal so häufig zu einem für den Geldgeber günstigen Schluss wie Arbeiten ohne Industriegeld.
Unter den Interventionsstudien mit reiner Industriefinanzierung fand sich keine einzige mit einem ungünstigen Ergebnis, ohne Industriegeld lag der Anteil bei 37 Prozent.
Wie die Zuckerindustrie das Fett zum Schuldigen machte
Am 13. Juli 1965 genehmigte die Sugar Research Foundation in den USA ihr Project 226. Zwei Ernährungsforscher der Harvard University sollten eine Literaturübersicht schreiben, ein dritter beaufsichtigte das Vorhaben. Den Auftrag formulierte der Verband selbst: eine Übersicht über die Arbeiten, die „eine besondere Stoffwechselgefahr“ im Zucker sahen. Gezahlt wurden am Ende umgerechnet rund 5.800 Euro, nach Kaufkraft von 2016 knapp 44.000 Euro.
Die Übersicht erschien 1967 im New England Journal of Medicine, stellte Fett und Cholesterin als Ursachen von Herzkrankheiten heraus und spielte die Rolle des Zuckers herunter. Den Geldgeber nannten die Autoren nicht, eine Offenlegungspflicht führte das Fachblatt erst 1984 ein. Aufgedeckt haben den Vorgang Cristin Kearns, Laura Schmidt und Stanton Glantz von der University of California San Francisco, die 2016 interne Dokumente des Verbands in JAMA Internal Medicine auswerteten.
Zwei Kennzahlen stammen aus systematischen Übersichten über viele Einzelstudien, je eine aus einem Plagiatsgutachten und aus internen Dokumenten der Zuckerindustrie. Die Chronik nennt Fälle, deren Finanzierung oder Entstehung durch Dokumente, Gerichtsverfahren oder Recherchen öffentlich wurde.
Zweifel als Produkt
In einem Strategiepapier des Zigarettenherstellers Brown & Williamson von 1969 steht der Satz: „Doubt is our product since it is the best means of competing with the ‚body of fact‘ that exists in the mind of the general public.“ Auf Deutsch: Zweifel ist unser Produkt, weil er das beste Mittel ist, gegen den Faktenbestand in den Köpfen der Öffentlichkeit anzukommen.
Gekaufte Forschung muss also nichts beweisen, eine Kontroverse genügt, damit Politik und Verbraucher abwarten.
Das Strategiepapier liegt heute in der Industry Documents Library der University of California San Francisco, zusammen mit vielen weiteren internen Tabakdokumenten, die erst durch Gerichtsverfahren ans Licht kamen.
Affen im Abgaslabor
Für Forschung zu Abgasen und Gesundheit gründete die deutsche Autoindustrie einen eigenen Verein, die Europäische Forschungsvereinigung für Umwelt und Gesundheit im Transportsektor, kurz EUGT. Mitglieder waren Volkswagen, Daimler, BMW und Bosch. 2014 ließ die EUGT in einem Labor in Albuquerque im US-Bundesstaat New Mexico zehn Javaneraffen die Abgase eines VW Beetle einatmen, dessen Abgasreinigung von Volkswagen manipuliert worden war. Das Labor wusste davon nichts.
Öffentlich machte den Versuch die New York Times im Januar 2018. Kurz darauf wurde bekannt, dass die EUGT auch eine Studie an der Uniklinik der RWTH Aachen finanziert hatte: 2013 und 2014 atmeten dort 25 gesunde Probanden jeweils drei Stunden lang Stickstoffdioxid ein.
Die Uniklinik bestreitet einen Zusammenhang mit dem Dieselskandal. Aufgelöst hatten die Hersteller die EUGT bereits 2017, Volkswagen nannte budgetäre Gründe.
Abgeschrieben vom Antragsteller
Den Bewertungsbericht für die Wiederzulassung des Unkrautvernichters Glyphosat in der EU schrieb das Bundesinstitut für Risikobewertung (BfR), eine deutsche Behörde. Ein Gutachten der Plagiatsforscher Stefan Weber und Helmut Burtscher-Schaden im Auftrag mehrerer EU-Abgeordneter stufte 2019 in den Kapiteln zur Bewertung veröffentlichter Gesundheitsstudien 50,1 Prozent des Inhalts als Plagiat aus dem Zulassungsantrag der Hersteller ein. Das BfR widersprach: Industrieberichte gehörten routinemäßig in solche Bewertungen, Vorwürfe einer absichtlichen Täuschung wies das Institut zurück.
Eine Übersichtsarbeit aus dem Jahr 2000, die Glyphosat für unbedenklich erklärte, hat keinen Bestand mehr. Das Fachblatt Regulatory Toxicology and Pharmacology zog den Artikel im Dezember 2025 zurück und begründete den Schritt mit ernsten ethischen Bedenken hinsichtlich der Unabhängigkeit der Autoren. Dokumente aus US-Gerichtsverfahren, die sogenannten Monsanto Papers, hatten zuvor nahegelegt, dass Mitarbeiter des Herstellers an der Arbeit mitgeschrieben hatten.
Schauen Sie bei jeder Studie zuerst auf den Geldgeber: Industriegeld verschiebt das Fazit messbar, auch wenn die Methode sauber ist.
Welche Arten von Studien unterscheiden Forscher?

Forscher ordnen Studientypen nach ihrer Beweiskraft. Ganz oben stehen systematische Übersichten über viele Studien und randomisierte kontrollierte Versuche, ganz unten Fallberichte, Expertenmeinungen und Umfragen, die ein Unternehmen für seine Pressearbeit bestellt.
Die Rangfolge der Studientypen heißt in der Medizin Evidenzhierarchie, und den Ausschlag gibt eine einzige Frage: Wie gut schließt das Design aus, dass ein anderer Faktor das Ergebnis erklärt?
Bei einem randomisierten Versuch entscheidet der Zufall, wer ein Medikament bekommt und wer ein Placebo. Unterschiede zwischen den Gruppen lassen sich deshalb dem Medikament zuschreiben.
Eine Beobachtungsstudie dagegen vergleicht Menschen, die sich selbst für einen Lebensstil entschieden haben, alle übrigen Unterschiede zwischen den Gruppen fließen ins Ergebnis ein. Kaffeetrinker rauchen womöglich häufiger, arbeiten mehr oder schlafen weniger. Findet eine Beobachtungsstudie unter Kaffeetrinkern mehr Herzinfarkte, bleibt offen, welcher dieser Faktoren den Befund erklärt.
| Studientyp | Vorgehen | Typische Schwäche | Beweiskraft |
|---|---|---|---|
| Systematische Übersicht und Metaanalyse | Fasst alle Studien zu einer Frage zusammen | Nur so gut wie die eingeschlossenen Studien, verzerrt, sobald negative Ergebnisse unveröffentlicht bleiben | sehr hoch |
| Randomisierte kontrollierte Studie | Wirkung einer Maßnahme im Vergleich zu einer Kontrollgruppe | Teuer, oft kleine oder ausgewählte Gruppen | hoch |
| Kohortenstudie | Verfolgt eine Gruppe über Jahre, etwa die britische Ärztestudie zum Rauchen | Störfaktoren lassen sich nur teilweise herausrechnen | mittel bis hoch |
| Fall-Kontroll-Studie | Vergleicht Erkrankte rückblickend mit Gesunden | Erinnerungsfehler, Auswahl der Vergleichsgruppe | mittel |
| Querschnittsstudie und Umfrage | Momentaufnahme von Meinungen oder Zuständen | Zeigt keine Ursachen, Ergebnis hängt von Frage und Stichprobe ab | gering bis mittel |
| Fallbericht und Fallserie | Beschreibt einzelne Patienten, etwa Wakefields zwölf Kinder | Keine Vergleichsgruppe | gering |
| Expertenmeinung und Whitepaper | Einschätzung ohne eigene Datenerhebung | Interessen des Autors bleiben oft verborgen | sehr gering |
Die meisten „Studien“, die in Newslettern, Pressemitteilungen und auf LinkedIn kursieren, sind keine Forschung, sondern Kommunikation: Online-Umfragen mit einigen Hundert Teilnehmern, durchgeführt von einem Panelanbieter und bezahlt von einem Unternehmen.
Peer Review, also die Prüfung durch unabhängige Fachkollegen vor der Veröffentlichung, haben diese Umfragen nie durchlaufen.
Zwischen begutachteter Forschung und PR steht der Preprint, eine wissenschaftliche Arbeit, die vor der Begutachtung online geht. Die vielzitierte Untersuchung des MIT Media Lab zum Schreiben mit ChatGPT erschien im Juni 2025 als Preprint mit 54 Teilnehmern, von denen 18 die vierte Sitzung absolvierten.
Für Schlagzeilen über das Gehirn der Menschheit taugt eine solche Stichprobe nicht.
Eine Umfrage misst Meinungen und taugt deshalb nie als Beweis für eine Ursache, auch wenn die Pressemitteilung das nahelegt.
Wie lassen sich Auftraggeber und Studieninstitute einordnen?

Am besten nach Geldquelle und Interesse am Ergebnis. Amtliche Statistik, begutachtete Forschung und unabhängige Verbraucher-Tests verdienen den größten Vertrauensvorschuss, Unternehmensumfragen und Siegel gegen Lizenzgebühr den kleinsten. Dazwischen liegen Studien von Verbänden.
Eine solche Einordnung urteilt nicht über einzelne Ergebnisse: Eine Verbandsstudie kann sauber gerechnet sein, ein Universitätsinstitut kann sich irren.
Die Einordnung zeigt, wie genau Sie hinschauen sollten, bevor Sie eine Zahl in Ihre Entscheidungsvorlage übernehmen. Je größer das wirtschaftliche Interesse des Geldgebers am Ergebnis, desto mehr Prüfarbeit fällt Ihnen zu.
| Klasse | Typische Absender | Geldquelle | Interesse am Ergebnis | Vertrauensvorschuss |
|---|---|---|---|---|
| Amtliche Statistik | Statistisches Bundesamt, Bundesagentur für Arbeit | Steuergeld, gesetzlicher Auftrag | gering | hoch |
| Begutachtete Forschung | Universitäten, öffentliche Forschungsinstitute | Steuergeld, Drittmittel | gering bis mittel, Publikationsdruck | hoch |
| Unabhängige Verbraucher-Tests | Stiftung Warentest | Verkauf von Heften und Online-Angeboten, Logo-Lizenzen nach dem Test | gering | hoch |
| Interessengebundene Institute | Verbände, arbeitgeber- und gewerkschaftsnahe Institute, Lobby-Initiativen | Mitgliedsbeiträge und Verbandsgelder | mittel bis hoch | mittel |
| Unternehmensstudien und PR-Umfragen | Unternehmen mit Panelanbietern und PR-Agenturen | Marketingbudget | hoch | gering |
| Siegel gegen Lizenzgebühr | Siegelinstitute mit Medienpartnern, bezahlte Ärzte- und Anbieterlisten | Gebühren der Ausgezeichneten | hoch | sehr gering |
Zur mittleren Klasse gehört die Initiative Neue Soziale Marktwirtschaft (INSM). Laut Lobbyregister des Bundestags ist der Arbeitgeberverband Gesamtmetall der einzige Auftraggeber der INSM, 2025 flossen von dort zwischen 5,65 und 5,7 Millionen Euro.
Jedes Jahr veröffentlicht die INSM den Bildungsmonitor, eine Vergleichsstudie des arbeitgebernahen Instituts der deutschen Wirtschaft (IW) mit 98 Indikatoren. Die Methode liegt offen, die Finanzierung nennt die INSM selbst.
Welche Indikatoren in ein Bundesländer-Ranking eingehen, entscheidet trotzdem, wer am Ende vorn liegt.
Auf der anderen Seite des Spektrums finanzieren Gewerkschaften eigene Forschung, etwa am Wirtschafts- und Sozialwissenschaftlichen Institut der gewerkschaftsnahen Hans-Böckler-Stiftung. Für beide Lager gilt dieselbe Regel: Interessengebundene Institute liefern oft solide Daten, die Fragestellung aber folgt der Agenda des Geldgebers.
Auch begutachtete Forschung verdient keinen Blankoscheck: Hochschulforscher stehen unter Publikationsdruck, und Fachzeitschriften drucken lieber spektakuläre als langweilige Befunde.
Prüfen Sie bei Verbandsstudien vor allem, welche Fragen gestellt und welche Indikatoren ausgewählt wurden. Lizenzsiegel und Unternehmensumfragen verdienen von vornherein den geringsten Vertrauensvorschuss.
Wie entstehen Testsieger auf Bestellung?

Durch Lizenzgebühren. Bei vielen Siegeln ist die Prüfung für Unternehmen kostenlos, bezahlt wird erst das Recht, mit dem Ergebnis zu werben. Das Siegelinstitut verdient deshalb nur an den Gewinnern.
Das Deutsche Institut für Service-Qualität (DISQ) aus Hamburg arbeitet im Auftrag von Medienpartnern, seit 2008 vor allem des Nachrichtensenders ntv. Das DISQ gibt an, ohne öffentliche Mittel auszukommen, und stützt sich neben den Medienkooperationen auf die Lizenzierung seines Testsiegels. Nominierung und Prüfung kosten nichts. Für die werbliche Nutzung des Siegels zahlen Unternehmen je nach Größe zwischen 900 und 4.400 Euro netto für zwölf Monate, für das Siegel „Business Champion x ntv“ zwischen 1.200 und 5.800 Euro im Jahr.
Vor Gericht hielt die Werbung mit einem DISQ-Siegel schon einmal nicht stand. Das Oberlandesgericht Brandenburg verbot 2012 auf Klage des Verbraucherzentrale Bundesverbands (vzbv) dem Möbelhändler Höffner die Werbung mit der Auszeichnung „1. Platz, Bestes Möbelhaus“. Der Name „Deutsches Institut“ und die Farben Schwarz-Rot-Gold erweckten den Eindruck einer öffentlichen Einrichtung, und getestet worden war nur der Service.
Der Tabakkonzern Brown & Williamson nannte Zweifel 1969 sein Produkt, heute verkaufen Siegelinstitute Gewissheit gegen Lizenzgebühr.
Markus Seyfferth, Chefredakteur Dr. Web
Das Magazin Focus vergibt an Mediziner aus seiner Ärzteliste ein Siegel „Focus Empfehlung“, für dessen Nutzung Ärzte laut Landgericht München I rund 2.000 Euro zahlten. Das Landgericht hielt das Siegel 2023 für irreführend, das Oberlandesgericht München entschied 2025 anders.
Am 30. Juli 2026 hob der Bundesgerichtshof das Urteil des Oberlandesgerichts auf und verwies den Fall zurück (Az. I ZR 130/25). Für Test-Logos mit Gesundheitsbezug, die gegen Geld vergeben werden, gelten nach dem BGH strenge Anforderungen an die Richtigkeit, Eindeutigkeit und Klarheit des Testverfahrens. Die Pressefreiheit deckt den Verkauf des Siegels nicht.
Selbst die Stiftung Warentest verkauft ihr Logo. Seit dem 1. Juli 2013 kostet die Werbung mit einem Testurteil eine Lizenz, die eine gemeinnützige Tochter des Gütezeichen-Vereins RAL vergibt. Heute verlangt die RAL-Tochter zwischen 11.990 und 29.990 Euro netto für ein Jahr. Der Unterschied zum Lizenzsiegel liegt in der Reihenfolge: Die Stiftung testet zuerst, auf eigene Rechnung und mit anonym im Handel gekauften Produkten, und verkauft das Logo erst danach. Ein gutes Testurteil lässt sich nicht kaufen.
2024 erwirtschaftete die Stiftung Warentest rund 77 Prozent ihrer Erträge mit Zeitschriften, Büchern und test.de. Die Markenlizenzen brachten 5,3 Millionen Euro oder 8 Prozent. Anzeigen verkauft die Stiftung nicht, und seit 2024 erhält sie auch keine Zuwendung des Bundes mehr. ÖKO-TEST finanziert sich dagegen neben den Abonnements über Anzeigen und Label-Lizenzen, das Label kostet ab 9.000 Euro für zwei Jahre. ÖKO-TEST versichert, dass Werbe- und Labelkunden keinen Einfluss auf Auswahl und Bewertung haben.
Werbung mit einem Testsiegel muss nach einem Urteil des Bundesgerichtshofs von 2021 (Az. I ZR 134/20) die Fundstelle deutlich erkennbar angeben, selbst wenn das Siegel nur klein auf einem Produktfoto im Prospekt zu sehen ist.
Das Landgericht Berlin II urteilte im Mai 2026 gegen das Portal testsieger-online.de, noch nicht rechtskräftig: Ein einziges getestetes Produkt kann kein Testsieger sein.
Ähnlich locker gehen viele Unternehmen mit Umweltversprechen um: Nationale Verbraucherschutzbehörden hielten bei einer von der EU-Kommission koordinierten Prüfung von Websites 42 Prozent der Umweltaussagen für übertrieben, falsch oder irreführend. Wie Unternehmen solche Versprechen schönfärben, beschreibt unser Fachartikel über grüne Werbeversprechen.
Bei vielen Siegeln zahlt der Gewinner für das Recht, mit dem Ergebnis zu werben. Die Stiftung Warentest testet dagegen zuerst und verkauft ihr Logo erst danach, ein Testurteil lässt sich dort nicht kaufen.
Mit welchen Tricks lässt sich ein Wunschergebnis herbeiführen?

Mit sechs Stellschrauben: der Formulierung der Frage, der Auswahl der Befragten, der Zahl der Messgrößen, der Darstellung der Risiken, der Verwechslung von Zusammenhang und Ursache und dem Verschweigen unpassender Ergebnisse.
Eine gefälschte Studie lässt sich entlarven, eine geschickt angelegte kaum. Die meisten der folgenden Stellschrauben sind legal, und jede lässt sich in einem Methodenteil verstecken, den kaum jemand liest.
Die Frage bestellt die Antwort
In Großbritannien warb Colgate auf Plakaten damit, 80 Prozent der Zahnärzte empfählen die Marke. Die Advertising Standards Authority, die britische Werbeaufsicht, gab im Januar 2007 zwei Beschwerden statt. In der zugrunde liegenden Umfrage durften die Zahnärzte mehrere Zahnpasten und Marken nennen, eine Konkurrenzmarke wurde fast genauso oft empfohlen. Die Plakate erweckten dagegen den Eindruck, 80 Prozent zögen Colgate allen anderen vor.
Suggestivfragen und unausgewogene Antwortskalen verschieben Mehrheiten: Eine Frage wie „Sollte der Staat Unternehmen endlich von Bürokratie entlasten?“ erzeugt eine andere Mehrheit als „Halten Sie die Berichtspflichten für angemessen?“, obwohl beide dasselbe Thema betreffen.
Deshalb verlangt der Pressekodex des Deutschen Presserats in Richtlinie 2.1, dass Redaktionen bei Umfragen die Fragestellung nennen, zusammen mit Zahl der Befragten, Zeitpunkt und Auftraggeber.
Die Stichprobe wählt sich selbst
Eine zufällig gezogene Stichprobe von rund 1.000 Menschen liefert erstaunlich genaue Werte. Infratest dimap gab für einen ARD-Deutschlandtrend von 2017 mit 1.005 Befragten eine Fehlertoleranz von 1,4 bis 3,1 Prozentpunkten an, je nach Höhe des Anteilswerts. Die Voraussetzung ist der Zufall: Jeder in der Grundgesamtheit muss dieselbe Chance haben, gefragt zu werden.
Bei Online-Umfragen, an denen jeder teilnimmt, der gerade Lust hat, fehlt diese Voraussetzung.
Ein Verband für Weihnachtsbäume ermittelte mit gelenkten Fragen und Antwortoptionen den Naturbaum als Nummer eins in deutschen Wohnzimmern, eine Umfrage für eine Achtsamkeits-App für Kinder befragte die Eltern statt der Kinder, und der Siegelgeber MSC meldete, 20 Prozent bevorzugten „nachhaltigeren und heimischen Karpfen“. Bezogen auf alle Befragten blieben davon 7,4 Prozent. Alle drei Fälle sammelte die Unstatistik des Monats im Dezember 2025.
Gewichtung nach Alter, Geschlecht und Region gleicht eine Selbstselektion nur teilweise aus, denn Freiwillige interessieren sich meist stärker für das Thema als der Durchschnitt.
Viele Messgrößen, ein Treffer
Als „Johannes Bohannon“ vom erfundenen Institute of Diet and Health ließ der Wissenschaftsjournalist John Bohannon im Jahr 2015 insgesamt 15 Teilnehmer aus dem Raum Frankfurt drei Wochen lang Diät halten, eine Gruppe davon mit täglich einem Stück dunkler Schokolade. Gemessen wurden 18 Größen, von Gewicht und Cholesterin bis zur Schlafqualität. Die Schokoladengruppe nahm schneller ab, die Arbeit erschien für 600 Euro ohne echte Begutachtung in einem Fachblatt, und Bild titelte: „Wer Schokolade isst, bleibt schlank!“
Mit Schokolade hatte das Ergebnis nichts zu tun: Bei 18 Messgrößen und der üblichen Signifikanzschwelle von 5 Prozent liegt die Wahrscheinlichkeit, rein zufällig mindestens einen „signifikanten“ Befund zu finden, bei rund 60 Prozent.
Forscher nennen das Herumprobieren, bis ein Ergebnis die Schwelle unterschreitet, p-Hacking. Bei 15 Teilnehmern schwanken die Werte ohnehin so stark, dass fast alles herauskommen kann.
| Gewünschte Schlagzeile | Stellschraube | Woran Sie den Trick erkennen |
|---|---|---|
| „Kunden lieben unser Produkt“ | Nur Bestandskunden befragen, Skala mit drei positiven und einer negativen Stufe | Auswahl der Befragten und Antwortskala fehlen |
| „Die Mehrheit fordert X“ | Suggestive Frage mit eingebauter Wertung | Fragewortlaut ist nicht veröffentlicht |
| „Unser Mittel wirkt“ | Viele Messgrößen erheben und nur die signifikante melden | Keine Präregistrierung, auffällig viele Nebenbefunde |
| „Konkurrenzprodukt gefährlich“ | Relatives statt absolutes Risiko nennen | Prozentangabe ohne Ausgangswert |
| „Testsieger 2026“ | Siegel gegen Lizenzgebühr, kleines oder unklares Testfeld | Fundstelle fehlt, Zahl der getesteten Anbieter unbekannt |
| „Die Branche im Umbruch“ | 200 Manager online befragen, Ergebnis auf alle Unternehmen übertragen | Kleine Stichprobe ohne Zufallsauswahl |
Relativ klingt dramatischer
Im Oktober 2015 stufte die Internationale Agentur für Krebsforschung der WHO (IARC) verarbeitetes Fleisch als krebserregend ein. Jede tägliche Portion von 50 Gramm erhöhe das Darmkrebsrisiko um 18 Prozent, teilte die Agentur mit.
Die Zahl ist korrekt und trotzdem leicht misszuverstehen, denn sie beschreibt ein relatives Risiko. Wie viele Menschen tatsächlich zusätzlich erkranken, hängt vom Ausgangsrisiko ab.
Die britische Krebshilfe Cancer Research UK übersetzte den Befund in absolute Zahlen. Von 1.000 Menschen mit dem geringsten Verzehr verarbeiteten Fleisches erkranken im Lauf ihres Lebens etwa 56 an Darmkrebs, von 1.000 mit dem höchsten Verzehr etwa 66.
Aus einem um rund 17 Prozent höheren Risiko, wie die Krebshilfe für diesen Vergleich rechnet, werden so zehn zusätzliche Fälle unter 1.000 Menschen. Beide Zahlen stimmen, für die Schlagzeile taugt aber nur die relative.
Zusammenhang ist keine Ursache
Der Kardiologe Franz Messerli verglich 2012 im New England Journal of Medicine den Schokoladenkonsum von 23 Ländern mit ihrer Zahl an Nobelpreisträgern pro zehn Millionen Einwohner. Die Korrelation war mit 0,791 beachtlich hoch.
Die Arbeit war als augenzwinkernde Übung gedacht, und Messerli gab als möglichen Interessenkonflikt an, täglich Schokolade zu essen, vor allem dunkle Sorten von Lindt.
In reichen Ländern essen die Menschen mehr Schokolade, und der Staat finanziert mehr Forschung, die gemeinsame Ursache heißt Wohlstand. Viele ernst gemeinte Studien begehen denselben Fehler, nur ohne Ironie.
Was in der Schublade bleibt
Die wirksamste Stellschraube ist die Veröffentlichung selbst: Erick Turner und Kollegen verglichen 2008 im New England Journal of Medicine 74 bei der US-Arzneimittelbehörde FDA registrierte Studien zu zwölf Antidepressiva mit der Fachliteratur.
37 von 38 Studien mit positivem Ergebnis waren veröffentlicht. Von den Studien mit negativem oder fraglichem Ergebnis blieben 22 unveröffentlicht, elf erschienen so, dass sie positiv wirkten.
Nach der Fachliteratur waren 94 Prozent der Studien positiv, nach den Unterlagen der FDA nur 51 Prozent. Dieser Publikationsbias ließ die Wirkung der Mittel in der Literatur um durchschnittlich 32 Prozent stärker erscheinen.
Ein Wunschergebnis entsteht meist ohne Fälschung, durch Frage, Stichprobe, Messgrößen, Darstellung, die Verwechslung von Zusammenhang und Ursache sowie die Auswahl. In der Fachliteratur landen vor allem die erfolgreichen Studien.
Wie lesen Sie eine Studie kritisch?

Mit zehn Fragen, die sich in wenigen Minuten beantworten lassen: Wer hat bezahlt, wer durchgeführt, wie viele Menschen wurden wie ausgewählt, was genau wurde gemessen, wo ist die Arbeit erschienen und sagt die Schlagzeile mehr als die Daten?
Beginnen Sie beim Impressum der Studie, nicht bei der Grafik. Auftraggeber und durchführendes Institut stehen meist im Methodenteil oder im Kleingedruckten der Pressemitteilung. Fehlen beide Angaben, ist die Prüfung schon beendet: Eine Studie ohne Absender gehört nicht in Ihre Präsentation.
Wer hat bezahlt, wer hat gerechnet?
Prüfen Sie, ob der Auftraggeber am Ergebnis verdient. Ein Softwareanbieter, der einen Fachkräftemangel in der Buchhaltung beklagt und im selben Bericht seine Automatisierungslösung empfiehlt, hat ein offensichtliches Interesse.
Achten Sie außerdem auf die Rolle des Instituts: Ein Panelanbieter, der Fragen im Kundenauftrag ins Netz stellt, verantwortet nicht die Schlüsse, die der Auftraggeber daraus zieht.
Wen hat man gefragt, und wie viele?
Gute Studien nennen Zahl der Teilnehmer, Auswahlverfahren und Zeitraum. Bei Umfragen sind rund 1.000 zufällig ausgewählte Befragte ein üblicher Richtwert für Aussagen über die Bevölkerung. Eine Stichprobe von 200 Führungskräften aus einem Land erlaubt keine Aussage über „die Manager“ und schon gar nicht über „den Menschen“. Fragen Sie auch, ob die Studie eine Kontrollgruppe hatte, denn ohne Vergleich lässt sich keine Wirkung messen.
Was steht wirklich in den Daten?
Lesen Sie den Fragewortlaut, sofern er veröffentlicht ist, und vergleichen Sie die Schlagzeile mit der Tabelle. Aus „ist verbunden mit“ wird in Pressemitteilungen schnell „führt zu“, aus einem relativen Risiko eine Dramatik, die die absoluten Zahlen nicht hergeben. Seriöse Arbeiten nennen ihre Grenzen in einem eigenen Abschnitt, PR-Umfragen fast nie.
Wo ist die Arbeit erschienen?
Eine begutachtete Fachzeitschrift ist kein Gütesiegel, aber ein Filter. Ein Preprint, ein Whitepaper oder eine Pressemitteilung hat diesen Filter nicht durchlaufen.
Prüfen Sie außerdem, ob die Hypothese vorab registriert war, etwa in einem Studienregister, und ob andere Forscher das Ergebnis bestätigt haben. Ein einzelner überraschender Befund ist ein Anlass zum Nachfragen, kein Beweis.
Die folgende Studien-Ampel bündelt die zehn Fragen zum Anhaken.
Die Ampel ersetzt keine Fachprüfung, zeigt aber, wie viel Vertrauensvorschuss eine Studie verdient, bevor Sie eine Zahl daraus in Präsentation, Angebot oder Pressemitteilung übernehmen. Ihre Auswahl verlässt das Gerät nicht.
Welche berühmten Studien lagen daneben?

Einige der bekanntesten Studien und Befunde halten einer Nachprüfung nicht stand: die Impfstudie von Andrew Wakefield, das Stanford-Prison-Experiment, der Hawthorne-Effekt, Power Posing und die Acht-Sekunden-Aufmerksamkeit. Andere lagen goldrichtig, etwa die britische Ärztestudie zum Rauchen.
Bei einigen der folgenden Fälle hatte ein Geldgeber die Hand im Spiel, bei anderen genügten Ehrgeiz, kleine Stichproben und eine gute Geschichte. Gemeinsam ist allen Fällen der Weg in die Lehrbücher, Managementseminare und Talkshows, lange bevor jemand nachrechnete.
Die Impfstudie im Dienst der Kläger
1998 veröffentlichte der britische Arzt Andrew Wakefield in The Lancet eine Fallserie mit zwölf Kindern, die einen Zusammenhang zwischen der Masern-Mumps-Röteln-Impfung und Entwicklungsstörungen nahelegte.
Der Journalist Brian Deer deckte später auf, dass Wakefield umgerechnet bis zu 65.000 Euro aus der Prozesskostenhilfe erhalten hatte, beschafft von Richard Barr, dem Anwalt von Eltern, die gegen Impfstoffhersteller klagen wollten. Insgesamt flossen an Wakefield laut den von Deer ausgewerteten Zahlen der britischen Prozesskostenhilfe-Behörde Legal Services Commission umgerechnet rund 514.000 Euro Honorar. Die Zeitschrift erfuhr davon nichts.
The Lancet zog den Artikel am 2. Februar 2010 vollständig zurück. Im Mai 2010 strich der General Medical Council Wakefield aus dem britischen Ärzteregister. Die Behauptung zirkuliert in Impfgegner-Kreisen bis heute, ein Paradebeispiel für die Langlebigkeit einer widerlegten Studie.
Das Gefängnis mit Regieanweisung
Im Stanford-Prison-Experiment von 1971 teilte der Psychologe Philip Zimbardo Studenten in Wärter und Gefangene ein. Die Wärter wurden binnen Tagen grausam, so die Erzählung, die jahrzehntelang als Beweis galt, dass Situationen gewöhnliche Menschen zu Tätern machen. Der französische Forscher Thibault Le Texier wertete Archivmaterial aus, führte Interviews mit 15 Teilnehmern und zeichnete 2019 in der Fachzeitschrift American Psychologist ein anderes Bild: Die Wärter hatten genaue Anweisungen erhalten, wie sie die Gefangenen behandeln sollten.
Das Marshmallow, das kleiner wurde
Kinder, die als Vierjährige auf ein zweites Marshmallow warten konnten, sollten später erfolgreicher sein. Die Psychologen Tyler Watts, Greg Duncan und Haonan Quan wiederholten den Test 2018 mit Daten von 918 Kindern aus einer großen US-Langzeitstudie. Der Zusammenhang war nur halb so groß wie in den Originalarbeiten. Unter Berücksichtigung von Familienhintergrund und früher kognitiver Entwicklung schrumpfte der Zusammenhang um weitere zwei Drittel, mit allen Kontrollen war er im Alter von 15 Jahren nicht mehr signifikant. Rund zwei Drittel des verbliebenen Zusammenhangs gehen demnach auf die Bedingungen zurück, unter denen ein Kind aufwächst.
Die Siegerpose ohne Wirkung
Zwei Minuten breitbeinig stehen und schon steigt das Testosteron: So lautete 2010 die Botschaft einer Studie mit 42 Teilnehmern, die durch einen TED-Vortrag der Mitautorin Amy Cuddy weltberühmt wurde.
Eine Gruppe um die Ökonomin Eva Ranehill wiederholte den Versuch 2015 mit 200 Teilnehmern und fand keinen Effekt auf Hormone oder Risikoverhalten, nur das selbst empfundene Machtgefühl stieg.
Im September 2016 distanzierte sich die Erstautorin Dana Carney öffentlich von ihrer eigenen Arbeit: „I do not believe that ‚power pose‘ effects are real.“
| Studie | Jahr | Behauptung | Was daraus wurde |
|---|---|---|---|
| Hawthorne-Experimente | 1924 bis 1933 | Beobachtung allein steigert die Leistung | Originaldaten 2011 ausgewertet, die überlieferten Muster frei erfunden |
| Britische Ärztestudie | ab 1951 | Rauchen verkürzt das Leben | Nach 50 Jahren bestätigt: Raucher starben rund zehn Jahre früher |
| Harvard-Übersicht im Auftrag der Zuckerindustrie | 1967 | Fett statt Zucker als Hauptursache von Herzkrankheiten | Finanzierung durch die Sugar Research Foundation 2016 aufgedeckt |
| Stanford-Prison-Experiment | 1971 | Die Situation macht Menschen zu Tätern | Wärter hatten genaue Anweisungen, Kritik 2019 |
| Wakefield-Studie | 1998 | Impfung löst Entwicklungsstörungen aus | 2010 zurückgezogen, Wakefield verlor die Zulassung |
| Power Posing | 2010 | Siegerpose steigert das Testosteron | Wiederholung 2015 ohne Effekt auf Hormone |
| Schokolade und Nobelpreise | 2012 | Mehr Schokolade, mehr Nobelpreise | Ironisch gemeinte Korrelation, gemeinsame Ursache Wohlstand |
| Schokoladen-Diät | 2015 | Schokolade hilft beim Abnehmen | Bewusster Schwindel mit 15 Teilnehmern und 18 Messgrößen |
| Goldfisch-Vergleich | 2015 | Acht Sekunden Aufmerksamkeit | Quelle nicht auffindbar, Zahl ohne Forschung |
Das Licht in der Fabrik
Zwischen 1924 und 1933 untersuchten Forscher im Hawthorne-Werk von Western Electric bei Chicago, wie sich die Arbeitsbedingungen auf die Produktivität auswirken. Aus den Beleuchtungsversuchen entstand der Hawthorne-Effekt: Arbeiter leisten angeblich schon deshalb mehr, weil sie beobachtet werden. Die Ökonomen Steven Levitt und John List fanden die verschollen geglaubten Originaldaten und schrieben 2011, die überlieferten Muster seien „entirely fictional“, also frei erfunden. Übrig blieben allenfalls subtile Effekte.
Der Goldfisch aus dem Marketingbericht
Menschen hätten mit acht Sekunden eine kürzere Aufmerksamkeitsspanne als ein Goldfisch: Die Zahl stammt aus einem Bericht von Microsoft Kanada von 2015 und wanderte durch Zeitungen, Bücher und unzählige Präsentationen. Die BBC verfolgte die Quelle zurück. Microsoft hatte die Zahl nicht selbst gemessen, sondern von einer Website namens Statistic Brain übernommen, in deren angegebenen Quellen sich keine passende Forschung fand. Was die echte Aufmerksamkeitsforschung zeigt, lesen Sie in unserem Beitrag über den Goldfisch-Mythos.
Die Ärzte, die die Gefahr des Rauchens belegten
Den Beweis, den die Tabakindustrie mit gekauftem Zweifel bekämpfte, lieferte die britische Ärztestudie. Richard Doll und Austin Bradford Hill befragten 1951 britische Ärzte nach ihren Rauchgewohnheiten und verfolgten deren Gesundheit über Jahrzehnte.
Die Auswertung nach 50 Jahren im BMJ umfasste 34.439 Männer. Zigarettenraucher der Jahrgänge 1900 bis 1930, die nicht aufhörten, starben im Schnitt rund zehn Jahre früher als lebenslange Nichtraucher.
Ähnlich solide steht die Framingham-Herzstudie da, die 1948 mit 5.209 Männern und Frauen aus einer Kleinstadt in Massachusetts begann und bis heute Risikofaktoren für Herzkrankheiten erforscht. Beide Projekte haben gemeinsam, was den widerlegten Studien fehlte: große Stichproben, lange Beobachtung, öffentliche Finanzierung und Ergebnisse, die andere Forscher immer wieder bestätigten.
Kleine Gruppen und eingängige Geschichten machen Studien berühmt, aber nicht haltbar. Bestand haben große, lange und öffentlich finanzierte Projekte, deren Ergebnisse andere bestätigen.
Wie tief steckt die Wissenschaft in der Replikationskrise?

Tiefer, als viele annehmen: Bei Wiederholungen hielt in der Psychologie nur gut ein Drittel der Ergebnisse, in der Krebsforschung konnten Pharmafirmen nur einen Bruchteil veröffentlichter Befunde nachvollziehen. 2023 zogen Fachzeitschriften erstmals mehr als 10.000 Artikel zurück.
Den bekanntesten Test veröffentlichte 2015 die Open Science Collaboration, ein internationaler Forschungsverbund, in der Fachzeitschrift Science. Die Gruppe wiederholte 100 psychologische Studien aus drei renommierten Zeitschriften.
97 Prozent der Originalarbeiten hatten ein signifikantes Ergebnis gemeldet, bei den Wiederholungen nur noch 36 Prozent. Die gemessenen Effekte schrumpften im Schnitt auf die Hälfte.
Der Biotech-Konzern Amgen versuchte, 53 wegweisende Arbeiten der Krebsforschung nachzuvollziehen, und bestätigte laut einem Bericht in Nature von 2012 nur sechs, also 11 Prozent.
Bei Bayer passten 2011 in nur 20 bis 25 Prozent von 67 internen Projekten die eigenen Daten vollständig zu den veröffentlichten Befunden.
Der Stanford-Mediziner John Ioannidis hatte die Diagnose schon 2005 gestellt. Sein Aufsatz trug den Titel „Why Most Published Research Findings Are False“ und rechnete vor, wie kleine Stichproben, kleine Effekte, flexible Auswertungen und finanzielle Interessen die Zahl falscher Befunde in die Höhe treiben. Eine Umfrage der Zeitschrift Nature unter 1.576 Forschenden ergab 2016: Mehr als 70 Prozent waren schon einmal daran gescheitert, das Experiment eines Kollegen zu wiederholen, 52 Prozent sahen eine „erhebliche Krise“.
Sogenannte Paper Mills verkaufen fertige Fachartikel samt Autorenplatz. Allein Zeitschriften der Wiley-Tochter Hindawi zogen 2023 mehr als 8.000 Artikel zurück, Wiley gab die Marke danach auf. Die Datenbank von Retraction Watch verzeichnet inzwischen mehr als 67.000 zurückgezogene Arbeiten. An der Spitze der Rangliste einzelner Forscher steht der deutsche Anästhesist Joachim Boldt mit 240 Rückzügen, der niederländische Sozialpsychologe Diederik Stapel kommt auf 58.
Bayer und Amgen prüften intern, ob sich veröffentlichte Befunde nachvollziehen lassen, und berichteten darüber in Nature-Zeitschriften. Die Rückzugszahlen für 2023 nennt Nature, die Gesamtzahl stammt aus dem offenen Datensatz von Crossref und Retraction Watch.
Bei einer Präregistrierung legen Forscher Hypothese und Auswertung fest, bevor sie Daten erheben, Fachzeitschriften prüfen dann den Plan statt des Ergebnisses. Viele Fachblätter verlangen inzwischen offene Daten, und klinische Studien müssen vorab in Registern angemeldet werden.
Rückzüge und gescheiterte Wiederholungen zeigen auch, dass die Wissenschaft ihre Fehler selbst aufdeckt, wenn auch mit Jahren Verspätung.
Ein einzelner Befund, auch aus einer guten Zeitschrift, bleibt eine Hypothese, bis andere Forscher ihn mit neuen Daten bestätigen.
Was bedeuten Auftragsstudien für Ihr Unternehmen?

Auftragsstudien betreffen Sie zweimal: als Leser, der Kaufentscheidungen auf Studien stützt, und als Absender, der eigene Umfragen im Marketing einsetzt. In beiden Rollen schützt Transparenz vor Fehlentscheidungen, als Absender zusätzlich vor Abmahnungen.
Ihnen als Einkäufer begegnen Studien vor allem in den Verkaufsunterlagen Ihrer Lieferanten. Ein Anbieter für Cybersicherheit legt eine Umfrage vor, nach der fast jeder Mittelständler schon angegriffen wurde, ein Softwarehaus beziffert die Zeitersparnis seiner Lösung auf Stunden pro Woche.
Fragen Sie in solchen Gesprächen nach Auftraggeber, Stichprobe und Fragewortlaut. Ein seriöser Anbieter liefert die Unterlagen ohne Umschweife.
Als Absender stehen Sie vor der Versuchung, eine eigene Umfrage zur Schlagzeile zu machen. Studien sind im Content-Marketing beliebt, weil Redaktionen Zahlen lieben und Studien Backlinks bringen. Eine Umfrage im eigenen Auftrag ist legitim, solange Sie offenlegen, wer gefragt hat und wie.
Der Bundesgerichtshof verbot 2020 die Werbung, das pflanzliche Erkältungsmittel Sinupret wirke entzündungshemmend und antiviral, weil dafür nur Daten aus Tier- und Zellversuchen vorlagen. Die behaupteten Tatsachen müssten zum Zeitpunkt der Werbung bereits nachgewiesen sein, so der BGH (Az. I ZR 204/19).
Bei Lebensmitteln sind gesundheitsbezogene Angaben nach der Health-Claims-Verordnung der EU nur erlaubt, wenn die Europäische Behörde für Lebensmittelsicherheit sie geprüft und die EU sie in eine Positivliste aufgenommen hat, derzeit rund 250 Angaben.
Eine eigene Studie, die Redaktionen und Kunden ernst nehmen, erfüllt mindestens diese Bedingungen:
- Der Auftraggeber steht auf der ersten Seite, nicht im Kleingedruckten
- Ein unabhängiges Institut führt die Erhebung durch und zeichnet für die Methode verantwortlich
- Fragewortlaut, Zahl der Befragten, Zeitraum und Auswahlverfahren sind veröffentlicht
- Die Ergebnisse erscheinen vollständig, auch die unbequemen Antworten
Eine solche Studie ist für den Ruf mehr wert als eine spektakuläre Zahl, die der nächste Statistiker zerlegt. Das RWI veröffentlicht seine Unstatistik jeden Monat, und die Auftraggeber stehen dort mit Namen.
Lassen Sie sich von Lieferanten die Unterlagen zu jeder Studie zeigen, die sie Ihnen vorlegen. Eigene Umfragen veröffentlichen Sie am besten eigene Umfragen so, wie Sie sie selbst gern lesen würden: mit Auftraggeber, Methode und Fragewortlaut.
Wann verdienen Studien Vertrauen?

Sobald mehrere unabhängige Untersuchungen mit offener Methode zum selben Ergebnis kommen. Eine einzelne Studie, die ein Unternehmen bezahlt hat und deren Fazit zu seinem Produkt passt, verdient Misstrauen, und zwar so lange, bis jemand ohne Interesse am Ergebnis sie bestätigt.
Mit Studien wird häufiger Meinung gemacht, als die meisten Leser annehmen. Nicht jede Auftragsstudie lügt, aber jede verdient einen zweiten Blick auf den Absender.
Die Zuckerindustrie, die Tabakkonzerne, die Autohersteller mit ihren Abgasversuchen und die Siegelinstitute folgen derselben Logik: Wer die Musik bezahlt, bestimmt, was gespielt wird.
Eine Studie gleicht einem Arbeitszeugnis. Was drinsteht, ist selten glatt gelogen, entscheidend ist, wer das Zeugnis geschrieben hat, was er weglässt und wie die Formulierungen gemeint sind.
Personaler lesen Zeugnisse mit geschultem Blick, bei Studien fehlt diese Routine fast überall. Wir halten das kritische Lesen von Studien für eine Kernkompetenz von Entscheidern, gerade weil künstliche Intelligenz Studien künftig noch schneller zusammenfasst und zuspitzt als jede Pressestelle.
Gerichte verlangen für Testsiegel und Gesundheitswerbung harte Belege, und Fachzeitschriften fordern zunehmend Präregistrierung und offene Daten. An beidem können Sie Ihre eigenen Prüffragen ausrichten.
Bei der nächsten Schlagzeile mit „laut einer Studie“ lohnt ein kurzes Innehalten, bevor Sie sie weiterleiten.
Glossar: 18 wichtige Fachbegriffe zum kritischen Lesen von Studien

Auftragsstudie
Auftragsstudie heißt eine Untersuchung, die ein Unternehmen, ein Verband oder eine Behörde bei einem Institut bestellt und bezahlt. Der Auftraggeber legt meist Thema, Fragestellung und Veröffentlichung fest. Für die Bewertung zählt deshalb, ob der Auftraggeber offen genannt wird und ob er am Ergebnis verdient.
Evidenzhierarchie
Evidenzhierarchie nennt man die Rangfolge von Studientypen nach ihrer Beweiskraft. Oben stehen systematische Übersichten und randomisierte kontrollierte Studien, unten Fallberichte und Expertenmeinungen. Die Rangfolge hilft einzuschätzen, wie gut eine Untersuchung andere Erklärungen für ein Ergebnis ausschließt.
Fehlertoleranz
Fehlertoleranz beschreibt bei Umfragen den Bereich, in dem der wahre Wert mit hoher Wahrscheinlichkeit liegt. Bei rund 1.000 zufällig ausgewählten Befragten beträgt die Fehlertoleranz bis zu 3,1 Prozentpunkte. Für Online-Umfragen mit selbst ausgewählten Teilnehmern lässt sich eine solche Angabe nicht sinnvoll berechnen.
Interessenkonflikt
Interessenkonflikt nennt man die Lage, in der Forschende oder Auftraggeber finanziell oder beruflich von einem bestimmten Ergebnis profitieren könnten. Seriöse Fachzeitschriften verlangen eine Offenlegung, das New England Journal of Medicine etwa seit 1984. Ein offengelegter Konflikt macht eine Studie nicht falsch, aber prüfbedürftig.
Kontrollgruppe
Kontrollgruppe heißt die Vergleichsgruppe einer Studie, die keine oder eine Schein-Behandlung erhält. Erst der Vergleich zeigt, ob eine Maßnahme wirkt oder ob sich die Werte ohnehin verändert hätten. Studien ohne Kontrollgruppe können eine Wirkung allenfalls vermuten lassen.
Metaanalyse
Metaanalyse bezeichnet ein statistisches Verfahren, das die Ergebnisse mehrerer Studien zu einer Frage zusammenrechnet. Die Cochrane Library veröffentlicht solche Auswertungen für die Medizin. Eine Metaanalyse ist nur so gut wie die eingeschlossenen Studien und leidet unter unveröffentlichten Ergebnissen.
Paper Mill
Paper Mill nennt man ein Geschäft, das gefälschte oder massenhaft zusammengestückelte Fachartikel verkauft, oft samt Autorenplatz. Verlage zogen 2023 Tausende solcher Arbeiten zurück, allein Zeitschriften der Wiley-Tochter Hindawi mehr als 8.000. Das Geschäft lebt vom Publikationsdruck in der Wissenschaft.
Peer Review
Peer Review heißt die Begutachtung eines Fachartikels durch unabhängige Fachkollegen vor der Veröffentlichung. Die Gutachter prüfen Methode, Auswertung und Schlussfolgerungen und können Änderungen verlangen oder den Artikel ablehnen. Betrug und Rechenfehler entdeckt das Verfahren allerdings nicht zuverlässig.
p-Hacking
p-Hacking bezeichnet das Herumprobieren mit Daten und Auswertungen, bis ein Ergebnis die Signifikanzschwelle unterschreitet. Typisch sind viele Messgrößen, nachträglich gebildete Untergruppen oder ein Abbruch der Datensammlung im passenden Moment. Präregistrierung und offene Daten machen den Trick sichtbar.
Präregistrierung
Präregistrierung bedeutet, dass Forscher Hypothese, Stichprobe und Auswertungsplan öffentlich festlegen, bevor sie Daten erheben. Spätere Abweichungen fallen dann auf. Klinische Studien müssen vorab in Registern angemeldet werden, in der Psychologie setzt sich das Verfahren seit der Replikationskrise durch.
Preprint
Preprint heißt eine wissenschaftliche Arbeit, die vor der Begutachtung durch Fachkollegen online erscheint, etwa auf der Plattform arXiv. Preprints machen Ergebnisse schnell verfügbar, haben aber keinen Qualitätsfilter durchlaufen. Medien sollten Preprints deshalb als vorläufig kennzeichnen.
Publikationsbias
Publikationsbias beschreibt die Verzerrung, die entsteht, weil positive Ergebnisse häufiger veröffentlicht werden als negative. Die Fachliteratur zeigt dann eine stärkere Wirkung, als sie in allen durchgeführten Studien zusammen besteht. Bei Antidepressiva betrug der Unterschied laut einer Auswertung von 2008 rund 32 Prozent.
Randomisierte kontrollierte Studie
Randomisierte kontrollierte Studie (RCT) heißt ein Versuch, bei dem der Zufall die Teilnehmer auf Behandlungs- und Kontrollgruppe verteilt. Dadurch unterscheiden sich die Gruppen im Mittel nur in der Behandlung. Das Design gilt als Goldstandard, um die Wirkung einer Maßnahme nachzuweisen.
Relatives Risiko
Relatives Risiko nennt man die Angabe, um wie viel Prozent ein Risiko in einer Gruppe höher oder niedriger liegt als in einer anderen. Ohne das Ausgangsrisiko wirkt die Zahl oft dramatischer als die absolute Veränderung. Bei Darmkrebs entsprechen rund 17 Prozent mehr Risiko etwa zehn zusätzlichen Fällen unter 1.000 Menschen.
Replikation
Replikation bedeutet die Wiederholung einer Studie mit neuen Daten, um zu prüfen, ob das Ergebnis hält. Erst bestätigte Befunde gelten als belastbar. In Psychologie und Krebsforschung scheiterten solche Wiederholungen in den vergangenen Jahren auffallend oft, was als Replikationskrise bekannt wurde.
Selbstselektion
Selbstselektion liegt vor, wenn Teilnehmer selbst entscheiden, ob sie an einer Umfrage teilnehmen. Dann antworten vor allem Menschen, die sich für das Thema interessieren oder eine starke Meinung haben. Gewichtung nach Alter, Geschlecht und Region gleicht diese Verzerrung nur teilweise aus.
Signifikanz
Signifikanz bedeutet in der Statistik, dass ein Ergebnis unter der Annahme reinen Zufalls unwahrscheinlich wäre, üblich ist eine Schwelle von fünf Prozent. Signifikant heißt nicht wichtig und nicht bewiesen. Bei vielen Tests rutschen mit hoher Wahrscheinlichkeit einzelne Zufallsbefunde unter die Schwelle.
Stichprobe
Stichprobe heißt die Gruppe von Menschen oder Objekten, die eine Studie tatsächlich untersucht, stellvertretend für eine größere Grundgesamtheit. Entscheidend sind Größe und Auswahlverfahren. Nur eine zufällig gezogene Stichprobe erlaubt verlässliche Schlüsse auf die Bevölkerung.
FAQ: Studien kritisch lesen: Wer bezahlt, bestimmt die Musik

Wie erkennt man eine seriöse Studie?
Eine seriöse Studie nennt Auftraggeber, durchführendes Institut, Zahl und Auswahl der Teilnehmer, Fragewortlaut und Methode. Idealerweise ist die Arbeit in einer begutachteten Fachzeitschrift erschienen, legt Interessenkonflikte offen und benennt ihre eigenen Grenzen.
Was bedeutet repräsentativ bei einer Umfrage?
Repräsentativ heißt, dass die Befragten die Grundgesamtheit, etwa alle Wahlberechtigten, in den wichtigen Merkmalen abbilden. Verlässlich gelingt das nur mit einer Zufallsauswahl. Der Begriff ist nicht geschützt, auch Online-Umfragen mit selbst ausgewählten Teilnehmern nennen sich so.
Wie viele Teilnehmer braucht eine Studie?
Eine feste Mindestzahl existiert nicht, die nötige Größe hängt von Fragestellung und erwarteter Effektgröße ab. Für Bevölkerungsumfragen gelten rund 1.000 zufällig ausgewählte Befragte als üblich, dann liegt die Fehlertoleranz bei bis zu 3,1 Prozentpunkten. Experimente mit wenigen Dutzend Teilnehmern finden oft Zufallseffekte.
Was ist der Unterschied zwischen Korrelation und Kausalität?
Korrelation bedeutet, dass zwei Größen gemeinsam steigen oder fallen. Kausalität bedeutet, dass die eine die andere verursacht. Schokoladenkonsum und Nobelpreise korrelieren zwischen Ländern stark, beide hängen aber vom Wohlstand ab. Ursachen lassen sich am sichersten mit randomisierten Experimenten nachweisen.
Wie finanziert sich die Stiftung Warentest?
Die Stiftung Warentest finanziert sich überwiegend durch den Verkauf ihrer Zeitschriften, Bücher und Online-Angebote, 2024 rund 77 Prozent der Erträge. Hinzu kommen Logo-Lizenzen und Kapitalerträge. Anzeigen verkauft die Stiftung nicht, eine Zuwendung des Bundes erhält sie seit 2024 nicht mehr.
Darf ein Unternehmen mit einer selbst beauftragten Studie werben?
Ja, solange die Aussagen wahr und nicht irreführend sind. Das Gesetz gegen den unlauteren Wettbewerb verbietet täuschende Angaben über Testergebnisse. Für Gesundheitswerbung verlangt der Bundesgerichtshof, dass die behauptete Wirkung zum Zeitpunkt der Werbung wissenschaftlich nachgewiesen ist.
Quellen
64 Quellen anzeigenQuellen ausblendenabgerufen am 09.10.2026
- RWI Leibniz-Institut für WirtschaftsforschungUnstatistik des Monats: Wenn PR die Gehirne verkümmern lässt
- RWI Leibniz-Institut für WirtschaftsforschungUnstatistik des Monats: Die gefährlichsten Straßen Deutschlands
- RWI Leibniz-Institut für WirtschaftsforschungUnstatistik des Monats: Wenn der Weihnachtsmann evidenzbasiert entscheiden müsste
- Cochrane LibraryLundh A. u. a.: Industry sponsorship and research outcome
- JAMABekelman J. E., Li Y., Gross C. P.: Scope and Impact of Financial Conflicts of Interest in Biomedical Research
- PLoS MedicineLesser L. I. u. a.: Relationship between Funding Source and Conclusion among Nutrition-Related Scientific Articles
- JAMA Internal MedicineKearns C. E., Schmidt L. A., Glantz S. A.: Sugar Industry and Coronary Heart Disease Research
- UCSF Industry Documents LibraryBrown & Williamson: Smoking and Health Proposal
- Deutscher BundestagDrucksache 19/1150: Antwort der Bundesregierung zu Abgasversuchen an Menschen und Affen
- Niedersächsischer LandtagDrucksache 18/510: Abgasversuche mit Tieren und Menschen durch VW, Daimler und BMW
- The New York Times (Nachdruck WRAL)Ewing J.: 10 Monkeys and a Rigged Beetle, Inside VW’s Campaign for Clean Diesel
- Weber S., Burtscher-Schaden H.Detailed Expert Report on Plagiarism and superordinated Copy Paste in the Renewal Assessment Report on Glyphosate
- Bundesinstitut für RisikobewertungEuropean assessment of Glyphosate is quality-assured and independent
- PubMedRetraction Notice zu Williams, Kroes, Munro 2000, Regulatory Toxicology and Pharmacology
- International Journal of Risk & Safety in MedicineMcHenry L. B.: The Monsanto Papers, Poisoning the scientific well
- arXivKosmyna N. u. a.: Your Brain on ChatGPT (Preprint, 10.06.2025)
- Deutscher BundestagLobbyregister: Eintrag R002337, INSM GmbH (Stand 25.06.2026)
- INSMPressemitteilung Bildungsmonitor 2025
- DISQPressemitteilung: 10 Jahre DISQ
- DISQTrustFAQs zu Siegelnutzung und Gebühren
- Stiftung WarentestIrreführende Werbung mit Testsiegel: Gericht bestätigt Höffner-Werbung unzulässig
- Legal Tribune OnlineLG München I: Ärzte-Siegel Focus-Empfehlung irreführend
- Legal Tribune OnlineBGH I ZR 130/25: Ärzte-Siegel der Focus-Ärzteliste
- Stiftung WarentestPressemitteilung: Jahrespressekonferenz und neues Logo-Lizenzsystem
- RAL gGmbHLogolizenz Stiftung Warentest: Lizenzoptionen
- Stiftung WarentestWirtschaftsdaten: Zahlen und Fakten der Stiftung Warentest
- ÖKO-TESTWir über uns
- ÖKO-TEST AGLabel Lizenz
- Verbraucherzentrale BundesverbandBGH I ZR 134/20: Zur Werbung mit einem Testsieger-Siegel
- Verbraucherzentrale BundesverbandLG Berlin II 15 O 277/25: Irreführende Testsieger-Werbung
- Europäische KommissionScreening of websites for greenwashing: half of green claims lack evidence
- Cosmetics BusinessASA don’t recommend Colgate
- Deutscher PresseratPressekodex, Richtlinie 2.1
- infratest dimapARD-Deutschlandtrend November 2017
- GizmodoBohannon J.: I Fooled Millions Into Thinking Chocolate Helps Weight Loss
- International Agency for Research on CancerPress Release N° 240: Consumption of red meat and processed meat
- Cancer Research UKProcessed meat and cancer, what you need to know
- New England Journal of MedicineMesserli F. H.: Chocolate Consumption, Cognitive Function, and Nobel Laureates
- New England Journal of MedicineTurner E. H. u. a.: Selective publication of antidepressant trials and its influence on apparent efficacy
- The LancetWakefield A. J. u. a.: Ileal-lymphoid-nodular hyperplasia, non-specific colitis, and pervasive developmental disorder in children
- The LancetRetraction: Ileal-lymphoid-nodular hyperplasia
- Brian DeerRevealed: MMR research scandal (Sunday Times, 22.02.2004)
- Brian DeerMMR doctor given legal aid thousands (Sunday Times, 31.12.2006)
- BMJWakefield is struck off for the serious and wide-ranging findings against him
- American PsychologistLe Texier T.: Debunking the Stanford Prison Experiment
- Psychological ScienceWatts T. W., Duncan G. J., Quan H.: Revisiting the Marshmallow Test
- Psychological ScienceRanehill E. u. a.: Assessing the Robustness of Power Posing
- Dana CarneyMy position on Power Poses
- American Economic Journal: Applied EconomicsLevitt S. D., List J. A.: Was There Really a Hawthorne Effect at the Hawthorne Plant?
- Harvard Business School, Baker LibraryThe Hawthorne Effect: Introduction
- BBCBusting the attention span myth
- BMJDoll R. u. a.: Mortality in relation to smoking, 50 years’ observations on male British doctors
- National Heart, Lung, and Blood InstituteFramingham Heart Study (FHS)
- ScienceOpen Science Collaboration: Estimating the reproducibility of psychological science
- NatureBegley C. G., Ellis L. M.: Raise standards for preclinical cancer research
- Nature Reviews Drug DiscoveryPrinz F., Schlange T., Asadullah K.: Believe it or not, how much can we rely on published data on potential drug targets?
- PLoS MedicineIoannidis J. P. A.: Why Most Published Research Findings Are False
- STAT NewsSilverman E.: Scientists say reproducibility is a big problem
- NatureVan Noorden R.: More than 10,000 research papers were retracted in 2023
- Crossref und Retraction WatchRetraction Watch Data (Stand 08.10.2026)
- Retraction WatchThe Retraction Watch Leaderboard (Stand 30.09.2026)
- Arzneimittelkommission der deutschen ÄrzteschaftIrreführende Werbung zu Sinupret letztinstanzlich verboten (BGH I ZR 204/19)
- VerbraucherzentraleLebensmittel mit Gesundheitsversprechen
- Europäische ZentralbankEuro-Referenzkurse (Stichtag 08.10.2026)
