Das Journal24. August 20267 Min. Lesezeit
Fünf berühmte Studien, fünf verschiedene Enden
Woran die Wiederholung scheiterte — und woran sie gelang
Daryl Bem brauchte für sein Ergebnis keine ungewöhnlichen Mittel. 2011 druckte das Journal of Personality and Social Psychology, eine der angesehensten Zeitschriften des Fachs, seinen Aufsatz mit dem Schluss, Menschen könnten zukünftige Ereignisse vorwegnehmen. Die Statistik war Standard, die Stichproben waren üblich, die Gutachter fanden keinen formalen Fehler — und das Ergebnis war wissenschaftlich höchst unplausibel. Damit stand eine Frage im Raum, die unangenehmer war als jede einzelne Fälschung: Wenn die üblichen Methoden Präkognition belegen können, was belegen sie dann noch? Drei unabhängige Wiederholungsversuche von Ritchie, Wiseman und French fanden 2012 nichts davon wieder.
Die Antwort kam vier Jahre später. Die Open Science Collaboration, ein Verbund von über zweihundert Forschenden, nahm sich die Jahrgänge 2008 dreier führender Zeitschriften vor, einen Rahmen von 488 Artikeln. Aus ihm brachte sie hundert Wiederholungen zu Ende, so nah am Original wie möglich, oft mit den Materialien der Erstautoren. 97 % der Originalbefunde waren signifikant gewesen. Rund ein Drittel der ursprünglich signifikanten Befunde ließ sich erneut zeigen, 36 % genau, und die Effektstärken fielen im Mittel von r = .403 auf r = .197 — ungefähr auf die Hälfte. Seither hängt über jedem Lehrbuchkapitel die Frage, in welcher Hälfte es steht.
Die Ursachen dieser Zahl sind bekannt und unspektakulär: unterdimensionierte Stichproben, Auswertungen mit vielen offenen Entscheidungen, eine Publikationspraxis, die nur signifikante Ergebnisse druckt. Wie viel die zweite Ursache allein austrägt, führten Joseph Simmons, Leif Nelson und Uri Simonsohn 2011 vor. Wer während der Auswertung frei entscheidet, wann er das Sammeln beendet und welche Kontrollvariablen und Bedingungen er berichtet, kann nahezu jede Hypothese signifikant aussehen lassen. Keine dieser Ursachen ist Betrug; zusammen erzeugen sie eine Literatur, in der zu viele Befunde zu gut aussehen. Die Gegenmittel sind ebenso unspektakulär und wirken: Vorregistrierung nimmt der Auswertung die offenen Entscheidungen, geteilte Daten machen Nachrechnen möglich, Mehrlabor-Studien ersetzen das einzelne Labor durch ein Netz. Many Labs 2 hat 2018 vorgemacht, wie das aussieht — achtundzwanzig klassische Befunde, 186 Forschende, 60 Labore, 125 Stichproben und eine saubere Trennung zwischen dem, was hält, und dem, was nicht hält.
Zwei Missverständnisse verdienen eigene Sätze. Das erste: Die Replikationskrise sei ein Beleg dafür, dass in der Psychologie gelogen werde. Tatsächlich spielten aufgedeckte Fälschungen — der Fall Stapel ist der bekannteste — den Auftakt. Die Prüfungen von 2015 und 2018 aber handeln nicht von Betrug, sondern von Anreizen: Ein Fach, das Überraschung belohnt und Wiederholung nicht, bekommt Überraschungen. Das zweite: Die Krise sei eine Eigenheit der Psychologie. Sie ist es nicht, aber die Quoten fallen ungleich aus. In der Krebs-Vorklinik bestätigte ein Amgen-Team nur 6 von 53 nachgeprüften Vorstudien, in der experimentellen Ökonomie hielten 11 von 18 — deutlich schlechter und deutlich besser als in der Psychologie. Fünf berühmte Fälle aus diesem Archiv zeigen, wie verschieden die Enden ausfallen.
| Fall | Wie geprüft wurde | Ausgang |
|---|---|---|
| Open Science Collaboration, 2015 | 100 Wiederholungen aus drei Zeitschriften | 36 % erneut signifikant, Effekte von r = .403 auf r = .197 |
| Ebbinghaus, Vergessenskurve | 2015 nach Originalrezept, eine Versuchsperson | bestanden — nur das 31-Tage-Intervall wich ab |
| Kahneman, Rahmungseffekt | Many Labs 2, Dutzende Länder | hielt |
| Kahneman, Priming-Kapitel | keine Wiederholung nötig | vom Autor selbst zurückgenommen |
| Stanford-Gefängnis | Archivauswertung statt Labor | gefallen — Anleitungen an die Wärter |
| Festinger, ein Dollar gegen zwanzig | Hunderte Varianten | Kern hielt, die elegantesten Wahlparadigmen nicht |
| Milgram, Gehorsam | Burger 2009, bis zur 150-Volt-Marke | 70 gegen 82,5 Prozent — kein bedeutsamer Unterschied |
Ebbinghaus' Vergessenskurve: bestanden
Der älteste Befund des Archivs ist zugleich sein am wörtlichsten geprüfter. Hermann Ebbinghaus lernte in den 1880er-Jahren sinnlose Silben und vermaß sein eigenes Vergessen. 2015 wiederholten Jaap Murre und Joeri Dros das Experiment nach Originalrezept — ein einziger Proband, der zweiundzwanzigjährige Dros selbst, rund 70 Stunden Datenerhebung — und legten ihre Kurve über die von 1885. Die Form deckte sich; nur beim Intervall von 31 Tagen wich die Nachmessung ab, was die Autoren offen als ungeklärt vermerken. Eine Studie mit der Stichprobengröße eins bestand die Wiederholung nach hundertdreißig Jahren, weil ihr Verfahren vollständig offenlag. Replizierbarkeit, das ist die erste Lehre, ist keine Frage der Fallzahl allein, sondern der Durchsichtigkeit.
Kahneman: ein Befund hielt, ein Kapitel nicht
Kahnemans und Tverskys Prospect Theory gehört zu den Gewinnern der Krise: Many Labs 2 prüfte den Rahmungseffekt in Dutzenden Ländern, und er hielt. Zugleich fiel ein Kapitel aus Kahnemans eigenem Bestseller — die Priming-Befunde, denen er breiten Raum gegeben hatte, erwiesen sich als unterdimensioniert und schlecht replizierbar. Kahneman zog die Konsequenz in zwei Schritten. 2012 schrieb er einen offenen Brief an die Priming-Forschung, der unabhängige Wiederholungen einforderte und mit einer Warnung begann:
I see a train wreck looming. … your field is now the poster child for doubts about the integrity of psychological research
2017 folgte eine öffentliche Stellungnahme. Dort räumte er ein, den unterdimensionierten Studien zu viel geglaubt zu haben; die Effekte könnten nicht so groß und so robust sein, wie sein Kapitel sie dargestellt habe. Der Fall zeigt die zweite Lehre: Die Krise verläuft nicht zwischen Personen, sondern zwischen Befunden. Derselbe Autor kann auf beiden Seiten stehen.
Das Stanford-Gefängnis: gefallen, aber nicht im Labor
Das Stanford-Gefängnisexperiment war nie eine Studie im strengen Sinn — keine Kontrollgruppe, der Versuchsleiter als Gefängnisdirektor mitten im Geschehen. Was es zu Fall brachte, war kein Labor, sondern ein Archiv. Thibault Le Texier wertete die Bestände in Stanford aus — 2018 als Buch, 2019 im American Psychologist — und fand Anleitungen an die Wärter, die die Lehrbuchfassung vom spontanen Rollenverfall nicht überlebten. Die BBC-Studie, 2002 gesendet und 2006 publiziert, hatte die Anordnung schon vorher unter unabhängiger Aufsicht neu aufgesetzt, ausdrücklich nicht als Replikation, sondern als Gegenprobe — und ein anderes Ergebnis geliefert. Dritte Lehre: Manche Befunde fallen nicht im Labor, sondern im Aktenschrank.
Festingers Dissonanz: der Kern hielt, die Ränder nicht
Festingers Experiment von 1959 — ein Dollar gegen zwanzig — gilt als robust: Das Grundmuster, dass die kleinere Rechtfertigung die größere Einstellungsänderung erzwingt, wurde in Hunderten Varianten wiedergefunden. Aber die Krise hat auch hier sortiert. Die Wahlparadigmen, die kognitive Dissonanz besonders elegant zeigen sollten, gerieten unter Verdacht, weil ein Teil ihrer Ergebnisse auf einem statistischen Artefakt der Anordnung beruhen kann. Der Bestand blieb, die Familie schrumpfte. Vierte Lehre: Auch bestätigte Theorien verlieren in der Prüfung Randbezirke.
Milgrams Gehorsam: repliziert und trotzdem neu bewertet
Milgrams Experimente zum Gehorsam wurden 2009 von Jerry Burger in entschärfter Form wiederholt — aus ethischen Gründen nur bis zur 150-Volt-Marke. In Burgers Basisbedingung gingen 70 % der Teilnehmenden bis dorthin, bei Milgram waren es 82,5 % gewesen; der Unterschied ist nicht signifikant. Zugleich zeigte Gina Perrys Archivarbeit, wie stark der Versuchsleiter vom Skript abwich und wie unvollständig die Nachbefragung war. Was übrig bleibt, ist enger und härter zugleich: Der Befund existiert, seine Auslegung als Beleg für blinden Gehorsam nicht. Fünfte Lehre: Replikation und Neubewertung sind zwei verschiedene Prüfungen, und eine Studie kann die eine bestehen und die andere verlieren.
Was bleibt
Gesichert ist die Zahl von 2015 und ihre Diagnose. Ein Drittel der geprüften Befunde hielt, die Effekte schrumpften um etwa die Hälfte, und die Ursachen liegen in der Praxis des Fachs, nicht im Charakter seiner Leute. Strittig bleibt, wie weit sich die Zahl verallgemeinern lässt. Sie stammt aus drei Zeitschriften eines einzigen Jahrgangs, sie sagt nichts über die Lehrbücher insgesamt und noch weniger über Befunde, die nie geprüft wurden — und das sind die meisten.
Die fünf Fälle zeigen zudem, dass „hält“ und „fällt“ zu grob sind. Ein Befund kann repliziert und zugleich neu ausgelegt werden. Ein Kern kann halten, während seine elegantesten Varianten wegbrechen. Und eine Studie kann im Archiv scheitern, ohne je im Labor geprüft worden zu sein. Im Alltag erkennt man belastbare Befunde an lernbaren Merkmalen: große oder viele Stichproben, vorregistrierte Auswertung, unabhängige Wiederholungen, Effekte, die nicht mit jeder neuen Studie kleiner werden. Dazu kommen Autoren, die ihre eigenen Zahlen nach unten korrigieren, wenn es die Daten verlangen. Das Archiv führt an jeder Akte einen Replikationsstatus. Er ist keine Note für die Person, sondern eine Auskunft über die Beweislage, und er ändert sich, wenn sich die Lage ändert. Genau das unterscheidet eine Krise von einem Zusammenbruch: Ein Fach, das seine eigenen Befunde nachprüft und die Ergebnisse veröffentlicht, funktioniert.
Quellen und warum sie hier stehen
Bem, D. J. (2011). Feeling the future: Experimental evidence for anomalous retroactive influences on cognition and affect. Journal of Personality and Social Psychology, 100(3), 407–425.
Der Auslöser — nicht wegen eines Fehlers, sondern weil kein formaler Fehler zu finden war. Genau das machte die Frage unangenehm.
Ritchie, S. J., Wiseman, R., & French, C. C. (2012). Failing the future: Three unsuccessful attempts to replicate Bem's „retroactive facilitation of recall“ effect. PLoS ONE, 7(3), e33423.
Drei unabhängige Wiederholungen, dreimal nichts. Und ein Lehrstück nebenbei: Die Zeitschrift, die Bem druckte, lehnte diese Arbeit ab.
Simmons, J. P., Nelson, L. D., & Simonsohn, U. (2011). False-positive psychology: Undisclosed flexibility in data collection and analysis allows presenting anything as significant. Psychological Science, 22(11), 1359–1366.
Beziffert, was die zweite Ursache allein austrägt: Wer während der Auswertung frei entscheidet, kann fast jede Hypothese signifikant aussehen lassen.
Open Science Collaboration (2015). Estimating the reproducibility of psychological science. Science, 349(6251), aac4716.
Die Zahl, um die es geht — und ihre Grenzen: drei Zeitschriften, ein Jahrgang, hundert Wiederholungen.
Klein, R. A., Vianello, M., Hasselman, F., u. a. (2018). Many Labs 2: Investigating variation in replicability across samples and settings. Advances in Methods and Practices in Psychological Science, 1(4), 443–490.
Die Antwort in Form eines Verfahrens: 28 Befunde, 60 Labore, 125 Stichproben — und eine saubere Trennung zwischen dem, was hält, und dem, was nicht hält.
Murre, J. M. J., & Dros, J. (2015). Replication and analysis of Ebbinghaus' forgetting curve. PLOS ONE, 10(7), e0120644.
Der erste der fünf Fälle: eine Studie mit der Stichprobengröße eins, die nach hundertdreißig Jahren bestand — weil ihr Verfahren vollständig offenlag.
Kahneman, D. (26. September 2012). Offener Brief an die Priming-Forschung; sowie seine Stellungnahme zu Schimmacks Priming-Analyse (Februar 2017).
Die Fundstelle des Zitats — und der zweite der fünf Fälle: Derselbe Autor steht auf beiden Seiten der Krise, mit einem gehaltenen Befund und einem zurückgenommenen Kapitel.
Le Texier, T. (2019). Debunking the Stanford Prison Experiment. American Psychologist, 74(7), 823–839.
Der dritte Fall, und der einzige, der nicht im Labor scheiterte, sondern im Aktenschrank: Anleitungen an die Wärter, die die Lehrbuchfassung nicht überlebten.
Reicher, S., & Haslam, S. A. (2006). Rethinking the psychology of tyranny: The BBC prison study. British Journal of Social Psychology, 45(1), 1–40.
Die Gegenprobe unter unabhängiger Aufsicht — ausdrücklich keine Replikation, und mit anderem Ergebnis.
Burger, J. M. (2009). Replicating Milgram: Would people still obey today? American Psychologist, 64(1), 1–11.
Der fünfte Fall: 70 gegen 82,5 Prozent bis zur 150-Volt-Marke, der Unterschied nicht bedeutsam. Der Befund existiert — seine Auslegung als blinder Gehorsam nicht.
Begley, C. G., & Ellis, L. M. (2012). Raise standards for preclinical cancer research. Nature, 483(7391), 531–533.
Der Vergleich nach außen, nach unten: 6 von 53 nachgeprüften Vorstudien bestätigt. Die Krise ist keine Eigenheit der Psychologie.
Camerer, C. F., Dreber, A., Forsell, E., u. a. (2016). Evaluating replicability of laboratory experiments in economics. Science, 351(6280), 1433–1436.
Der Vergleich nach oben: 11 von 18. Zusammen mit der Krebs-Vorklinik zeigt er, dass die Quote am Fach hängt und nicht an der Wissenschaft.