Das Journal26. April 20268 Min. Lesezeit
Sieben Denkfehler — und welche die Prüfung bestanden haben
Ein Feldführer, sortiert nach Beweislage statt nach Bekanntheit
Birte Englich, Thomas Mussweiler und Fritz Strack legten erfahrenen Richterinnen und Richtern einen fertig aufbereiteten Strafrechtsfall vor. Bevor die Befragten ihr Strafmaß nannten, sollten sie würfeln; das Ergebnis des Wurfs bestimmte die Höhe der Forderung, die im Fall als Antrag der Staatsanwaltschaft ausgewiesen war. Wer eine hohe Zahl gewürfelt hatte, verhängte im Mittel eine längere Strafe als wer eine niedrige gewürfelt hatte. Die Befragten wussten, woher die Zahl kam. Sie half trotzdem, das Urteil zu bestimmen.
Solche Befunde sind der Kern eines Forschungsprogramms, das in den 1970er-Jahren begann, als Daniel Kahneman und Amos Tversky Entscheidungsfehler nicht als Dummheit beschrieben, sondern als Nebenwirkungen brauchbarer Faustregeln. Ihr Gründungstext sagt beides in einem Satz:
These heuristics are highly economical and usually effective, but they lead to systematic and predictable errors
Wer nur die zweite Hälfte zitiert, macht aus einem Befund über gute Werkzeuge einen Katalog menschlicher Mängel. Aus dem Programm ist inzwischen ein Genre geworden, und Genres sortieren nach Bekanntheit. Dieser Feldführer sortiert anders: nach Beweislage. Er beginnt beim bestbelegten Muster und endet bei dem, dessen Kern gerade offen bestritten wird.
Sieben Muster, vom bestbelegten zum umstrittensten
Anker. Eine Zahl im Raum zieht die Schätzung zu sich, auch wenn sie erkennbar zufällig ist. Die Verankerung gehört zu den am besten replizierten Befunden der Psychologie überhaupt: Many Labs 1 prüfte sie 2014 in 36 Laboren in zwölf Ländern, und die Ankereffekte fielen dort stärker aus als im Original. Verhandler, Preisschilder und Erstforderungen leben davon. Dazu gehört die Reihenfolge im Kleinen — was zuerst kommt, rahmt, was folgt; Interviews, Fragebögen und Speisekarten sind darauf gebaut, und die Absicherung dagegen heißt Rotation.
Rückschaufehler. Nach dem Ausgang erscheint der Ausgang absehbar — „das war doch klar“. Dokumentiert seit Baruch Fischhoffs Studien von 1975, bestätigt 2004 in einer Metaanalyse der bis dahin vorliegenden Forschung. Er ist gemein gegen jede faire Bewertung von Entscheidungen: Beurteilt wird mit Wissen, das der Entscheider nicht hatte.
Bestätigungsfehler. Belege, die passen, werden gesucht und gewichtet; Belege, die stören, übersehen oder zerpflückt. Der Effekt trägt die Barnum-Geschichte in diesem Journal und Loftus' Erinnerungsbefunde gleich mit: Auch das Gedächtnis sucht bestätigend. Peter Wasons Auswahlaufgabe — 1966 vorgestellt, 1968 publiziert — zeigte den Kern im Labor; die Literatur seither zeigt ihn überall.
Verfügbarkeit. Wie wahrscheinlich etwas wirkt, hängt daran, wie leicht Beispiele einfallen. Flugzeugabstürze fühlen sich nach den Nachrichten häufiger an als Autounfälle; seltene, bildstarke Risiken werden über-, banale untergeschätzt. Der Befund von 1973 gehört zum robusten Kern des Programms. Die Feinheit, die gern angehängt wird — es zähle die Leichtigkeit des Einfallens, nicht die Menge der Beispiele —, steht schlechter da: Das Paradigma, mit dem Schwarz und Kollegen sie 1991 zeigten, hat spätere Wiederholungsversuche nicht bestanden.
Überkonfidenz. Die Spannen, die Menschen für ihre Schätzungen angeben, sind zu eng; Fachleute sind dagegen nicht immun. Hier lohnt sich eine Unterscheidung, die Don Moore und Paul Healy 2008 in die Literatur gebracht haben: Überkonfidenz ist nicht ein Muster, sondern drei. Man kann die eigene Leistung überschätzen, man kann sich für besser als die anderen halten, und man kann seine Schätzungen für genauer halten, als sie sind. Die drei laufen nicht parallel — die zweite kehrt sich bei schwierigen Aufgaben sogar um, dann hält man sich für schlechter als der Durchschnitt. Am stabilsten steht die dritte da: zu enge Spannen. Die Justiz-Anwendung steht in der Loftus-Geschichte dieses Journals: Sicherheit von Zeugen ist ein Gefühl, kein Gütesiegel.
Dissonanzreduktion. Nach der Entscheidung wird die gewählte Option schöner und die verworfene blasser; wer viel investiert hat, redet die Investition gut. Festingers Ein-Dollar-Experiment ist der Klassiker der kognitiven Dissonanz; das Grundmuster hält, die elegantesten Wahlparadigmen bekamen in der Replikationskrise Reparaturbedarf — die Akte 027 führt beides auf.
Verlustaversion. Derselbe Betrag wiegt als Verlust schwerer denn als Gewinn — die Wertfunktion der Prospect Theory, in der Kahneman-Akte dieses Archivs samt Zeichnung. Der Rahmungseffekt, ihre bekannteste Folge, bestand 2018 die Mehrlabor-Prüfung. Der Kern selbst ist dagegen offen umstritten: David Gal und Derek Rucker bestritten 2018, dass Verluste im Mittel überhaupt schwerer wiegen; ihre Kritiker hielten die Zurückweisung für überzogen, räumten aber ein, dass die Hauptbelege — Besitztumseffekt und Status-quo-Neigung — mehrere Erklärungen zulassen. Der Streit ist nicht entschieden. Ausgerechnet das populärste Muster der Liste steht am schwächsten da.
| Muster | Belegstand | Woran er hängt |
|---|---|---|
| Anker | ohne Vorbehalt einzurechnen | Many Labs 1: 36 Labore, 12 Länder — stärker als im Original |
| Rückschaufehler | ohne Vorbehalt einzurechnen | Fischhoff 1975, Metaanalyse 2004 |
| Bestätigungsfehler | als Phänomen gesichert | Wason 1968 im Labor, breite Literatur seither |
| Verfügbarkeit | im Kern gesichert | 1973 robust — die Leichtigkeits-Feinheit von 1991 nicht |
| Überkonfidenz | gesichert, aber dreiteilig | Moore & Healy 2008: drei Muster, die nicht parallel laufen |
| Dissonanzreduktion | Grundmuster hält | die elegantesten Wahlparadigmen brauchten Reparatur |
| Verlustaversion | Kern offen bestritten | Gal & Rucker 2018 gegen die Standardlesart |
Wo die Muster teuer werden
Zwei Anwendungsfelder zeigen, was auf dem Spiel steht. In der Medizin entscheidet die Basisraten-Vernachlässigung über Diagnosen: Ein positiver Test für eine seltene Krankheit bedeutet auch bei hoher Testgüte meist keine Erkrankung — wer die Grundhäufigkeit ignoriert, liest das Ergebnis falsch, und Studien mit Ärztinnen und Ärzten zeigen diesen Fehler regelmäßig. Gerd Gigerenzer und Ulrich Hoffrage wiesen 1995 zugleich das Gegenmittel nach: Dieselbe Aufgabe, in natürlichen Häufigkeiten statt in Prozenten formuliert, wird von einem weit größeren Teil der Befragten richtig gelöst — ohne jede Schulung.
Vor Gericht wiederum treffen mehrere Muster zusammen: Anker wie im Würfelversuch, Rückschaufehler (die Tat wirkt nach der Tat vorhersehbar) und die Überkonfidenz der Zeugen. Das ist der Grund, warum Verfahrensregeln hier mehr ausrichten als Appelle an die Unvoreingenommenheit.
Drei Fallen der Verzerrungsliste
Das Genre hat eingebaute Fallen, und wer die Muster ernst nimmt, sollte sie kennen. Die erste ist die Inflation: Online-Sammlungen führen weit über hundert „Biases“, von denen viele Umbenennungen, Spezialfälle oder Einmalbefunde sind. Die Zahl der gut belegten Grundmuster ist klein; die sieben oben decken den größten Teil des Alltagsgebrauchs.
Die zweite Falle ist die Normfrage, und sie hat einen Namen: Gerd Gigerenzer. Ein Teil der „Fehler“ verschwindet, wenn man Wahrscheinlichkeiten als Häufigkeiten formuliert, und einfache Heuristiken schlagen in unsicheren Umgebungen manchmal die aufwendige Rechnung. Fehler ist, was von einer Norm abweicht — und über die Norm lässt sich streiten. Kahneman und Tversky antworteten 1996 im selben Heft und verteidigten die Grundmuster; Tversky starb im selben Jahr. Fortgesetzt wurde der Streit als vereinbartes Experiment: Kahneman prüfte 2001 gemeinsam mit Gigerenzers Mitarbeiter Ralph Hertwig und Barbara Mellers als Schiedsrichterin, ob Häufigkeitsformate den Konjunktionsfehler auflösen. Sie taten es nicht durchgängig — und die Kontrahenten legten das Ergebnis bis zuletzt verschieden aus.
Die dritte Falle ist die bequemste: die Verzerrung als Waffe. Wer Listen von Denkfehlern kennt, findet sie mühelos — beim Gegenüber. Die Forschung hat dafür einen eigenen Befund, den blinden Fleck für die eigene Verzerrung: Menschen halten sich im Mittel für weniger verzerrt als den Durchschnitt, und die Erklärung der Verzerrung ändert daran wenig. In der Studie von Emily Pronin und ihren Mitautoren beharrten die Teilnehmenden auf ihrer Objektivität, nachdem ihnen der Effekt ausdrücklich beschrieben worden war.
Was tatsächlich gegen sie hilft
Die verbreitete Kurzfassung lautet: Aufklärung verändert wenig, Formate viel. Häufigkeiten statt Prozente, Außensicht statt Innensicht, Checklisten statt Willenskraft, strukturierte Entscheidungsprozesse statt Bauchappellen — die wirksamen Gegenmittel bauen die Umgebung um, nicht den Kopf. Die Kurzfassung ist inzwischen zu kurz. Carey Morewedge und Kollegen zeigten 2015, dass eine einzige Schulung — ein Lernvideo oder ein eigens gebautes Lernspiel — mehrere Verzerrungen messbar verringerte, und der Effekt war zwei Monate später noch nachweisbar. Eine Nachfolgearbeit von Anne-Laure Sellier fand 2019 dieselbe Wirkung im Feld: Trainierte Führungskräfte suchten in einer scheinbar unabhängigen Geschäftsaufgabe seltener nur nach bestätigenden Daten und trafen häufiger die bessere Entscheidung. Der Kopf ist also nicht ganz unzugänglich; er ist nur teurer umzubauen als das Formular.
Auf der Architekturseite wird derweil die eigene Bilanz verhandelt. Eine Metaanalyse von Mertens und Kollegen bescheinigte den „Nudge“-Eingriffen 2022 mittlere Wirkung; Maier und Kollegen rechneten dieselben Daten im selben Jahr auf Publikationsverzerrung durch und fanden danach keinen Beleg mehr übrig. Zur Arbeit von Mertens und Kollegen erschien im selben Jahr zudem eine Korrektur, unter anderem wegen Datenpunkten aus einer zurückgezogenen Studie und wegen Kodierfehlern. Wer heute eine Zahl für die Wirksamkeit von Nudges nennt, nennt eine Parteinahme.
Was bleibt
Von den sieben Mustern sind zwei so gut belegt, dass man sie ohne Vorbehalt in eine Entscheidung einrechnen kann: Anker und Rückschaufehler. Drei weitere — Bestätigungsfehler, Verfügbarkeit, Dissonanzreduktion — sind als Phänomen gesichert, während einzelne berühmte Paradigmen dahinter wackeln; das ändert nichts an ihrer Existenz, wohl aber an der Sicherheit, mit der man Effektgrößen nennen darf. Die Verlustaversion, das Aushängeschild des Genres, ist der einzige Posten, bei dem der Streit den Kern erreicht hat. Diese Rangfolge ist der eigentliche Ertrag: Nicht jede Verzerrung ist gleich gut belegt, und die bekannteste ist es nicht.
Im Alltag erkennt man das Missbrauchsmuster daran, dass der Verzerrungsbegriff nach der Meinungsverschiedenheit auftaucht und erklärt, warum die andere Seite irrt. Nützlich wird der Feldführer erst in der umgekehrten Richtung — vorher, auf die eigene Entscheidung angewandt, und am besten als Verfahren: Vorab-Festlegungen, Basisraten nachschlagen, die Gegenthese aufschreiben, Spannen weiter fassen, als sich richtig anfühlt. Denn die Verzerrungslehre ist keine Lehre von der Unvernunft. Kahnemans und Tverskys Pointe war immer, dass dieselben Faustregeln, die die Fehler erzeugen, den Alltag tragen — schnell, sparsam, meistens richtig. Ein Urteilssystem ohne Verfügbarkeitsheuristik wäre nicht klüger, sondern gelähmt. Die Fehler sind der Preis der Geschwindigkeit, und die Kunst besteht darin, die Stellen zu kennen, an denen der Preis zu hoch ist.
Quellen und warum sie hier stehen
Tversky, A., & Kahneman, D. (1974). Judgment under uncertainty: Heuristics and biases. Science, 185(4157), 1124–1131.
Der Gründungstext des Programms — und die Fundstelle des Zitats. Sein Satz über die Faustregeln ist die Rahmung, ohne die der ganze Feldführer als Fehlerkatalog missverstanden würde.
Tversky, A., & Kahneman, D. (1973). Availability: A heuristic for judging frequency and probability. Cognitive Psychology, 5, 207–232.
Der Verfügbarkeitsbefund selbst, der zum robusten Kern gehört — im Unterschied zu der Feinheit, die ihm 1991 angehängt wurde.
Schwarz, N., Bless, H., Strack, F., Klumpp, G., Rittenauer-Schatka, H., & Simons, A. (1991). Ease of retrieval as information: Another look at the availability heuristic. Journal of Personality and Social Psychology, 61(2), 195–202.
Genau jene Feinheit — es zähle die Leichtigkeit des Einfallens, nicht die Menge der Beispiele. Ihr Paradigma hat spätere Wiederholungsversuche nicht bestanden.
Kahneman, D., & Tversky, A. (1979). Prospect theory: An analysis of decision under risk. Econometrica, 47, 263–291.
Die Wertfunktion, aus der die Verlustaversion stammt — der populärste und zugleich am offensten bestrittene Posten der Liste.
Gal, D., & Rucker, D. D. (2018). The loss of loss aversion: Will it loom larger than its gain? Journal of Consumer Psychology, 28, 497–516.
Der Angriff auf den Kern: Verluste wiegen im Mittel womöglich gar nicht schwerer. Der Streit darüber ist nicht entschieden, und der Artikel gibt ihn deshalb offen wieder.
Fischhoff, B. (1975). Hindsight ≠ foresight: The effect of outcome knowledge on judgment under uncertainty. Journal of Experimental Psychology: Human Perception and Performance, 1, 288–299.
Die Erstbeschreibung des Rückschaufehlers — eines der beiden Muster, die ohne Vorbehalt eingerechnet werden können.
Guilbault, R. L., Bryant, F. B., Brockway, J. H., & Posavac, E. J. (2004). A meta-analysis of research on hindsight bias. Basic and Applied Social Psychology, 26(2–3), 103–117.
Die Bestätigung dieses Musters über die bis dahin vorliegende Forschung hinweg.
Wason, P. C. (1968). Reasoning about a rule. Quarterly Journal of Experimental Psychology, 20, 273–281.
Die Auswahlaufgabe, die den Bestätigungsfehler im Labor zeigt — der Kern, den die Literatur seither überall wiederfindet.
Moore, D. A., & Healy, P. J. (2008). The trouble with overconfidence. Psychological Review, 115(2), 502–517.
Die Unterscheidung, ohne die der Überkonfidenz-Eintrag nicht lesbar wäre: drei Muster statt eines, und sie laufen nicht parallel.
Pronin, E., Lin, D. Y., & Ross, L. (2002). The bias blind spot: Perceptions of bias in self versus others. Personality and Social Psychology Bulletin, 28, 369–381.
Die dritte Falle des Genres, belegt: Die Teilnehmenden beharrten auf ihrer Objektivität, nachdem ihnen der Effekt ausdrücklich beschrieben worden war.
Englich, B., Mussweiler, T., & Strack, F. (2006). Playing dice with criminal sentences: The influence of irrelevant anchors on experts' judicial decision making. Personality and Social Psychology Bulletin, 32(2), 188–200.
Die Szene, mit der der Artikel beginnt. Entscheidend ist nicht, dass der Anker wirkte, sondern dass die Befragten wussten, woher die Zahl kam.
Klein, R. A., u. a. (2014). Investigating variation in replicability: A „many labs“ replication project. Social Psychology, 45(3), 142–152.
36 Labore in zwölf Ländern — und die Ankereffekte fielen stärker aus als im Original. Das ist der Grund, warum der Anker in diesem Feldführer ganz vorn steht.
Gigerenzer, G., & Hoffrage, U. (1995). How to improve Bayesian reasoning without instruction: Frequency formats. Psychological Review, 102(4), 684–704.
Die zweite Falle, die Normfrage: Ein Teil der „Fehler“ verschwindet, sobald man Wahrscheinlichkeiten als Häufigkeiten formuliert.
Gigerenzer, G. (1996). On narrow norms and vague heuristics: A reply to Kahneman and Tversky. Psychological Review, 103, 592–596.
Die Zuspitzung des Streits um die Norm — und die Erwiderung, auf die Kahneman und Tversky im selben Heft antworteten.
Mellers, B., Hertwig, R., & Kahneman, D. (2001). Do frequency representations eliminate conjunction effects? An exercise in adversarial collaboration. Psychological Science, 12(4), 269–275.
Der seltene Fall eines vereinbarten Experiments zwischen den Lagern. Dass die Kontrahenten das Ergebnis bis zuletzt verschieden auslegten, gehört zum Befund.
Morewedge, C. K., Yoon, H., Scopelliti, I., Symborski, C. W., Korris, J. H., & Kassam, K. S. (2015). Debiasing decisions: Improved decision making with a single training intervention. Policy Insights from the Behavioral and Brain Sciences, 2(1), 129–140.
Der Befund, der die bequeme Kurzfassung „Aufklärung hilft nicht“ korrigiert: Eine einzige Schulung wirkte, und zwei Monate später noch.
Sellier, A.-L., Scopelliti, I., & Morewedge, C. K. (2019). Debiasing training improves decision making in the field. Psychological Science, 30(9), 1371–1379.
Dieselbe Wirkung außerhalb des Labors, in einer scheinbar unabhängigen Geschäftsaufgabe.
Mertens, S., Herberz, M., Hahnel, U. J. J., & Brosch, T. (2022). The effectiveness of nudging: A meta-analysis of choice architecture interventions across behavioral domains. PNAS, 119, e2107346118 — samt Korrektur (PNAS, 119(19), 2022).
Die eine Hälfte der Nudge-Bilanz, samt der Korrektur wegen Datenpunkten aus einer zurückgezogenen Studie und Kodierfehlern.
Maier, M., Bartoš, F., Stanley, T. D., Shanks, D. R., Harris, A. J. L., & Wagenmakers, E.-J. (2022). No evidence for nudging after adjusting for publication bias. PNAS, 119, e2200300119.
Die andere Hälfte: dieselben Daten, auf Publikationsverzerrung durchgerechnet, und danach bleibt kein Beleg übrig. Wer heute eine Zahl nennt, nennt eine Parteinahme.