Das Journal29. August 20267 Min. Lesezeit
Dreißig Sekunden reichen — für manches
Welche Eigenschaften ein Ausschnitt verrät und welche er erfindet
Nalini Ambady und Robert Rosenthal schnitten 1993 aus Videoaufnahmen von 13 Lehrenden je drei Ausschnitte von 10 Sekunden heraus, schalteten den Ton ab und legten sie fremden Beurteilenden vor. Diese sahen dreißig Sekunden stummes Verhalten und wussten nichts über die Personen. Ihre Einschätzungen sagten voraus, wie die Studierenden dieselben Lehrenden am Ende des Semesters bewerten würden.
Der Befund ist bis heute unbequem, weil er in beide Richtungen schneidet. Er zeigt, dass in sehr kurzen Ausschnitten expressiven Verhaltens — in der Fachsprache „thin slices“ — echte Information stecken kann. Er zeigt aber ebenso, dass eine hochoffizielle Beurteilung über ein ganzes Semester in dreißig Sekunden Körpersprache vorweggenommen wird. Welche der beiden Zahlen das Maß der Wahrheit ist, sagt die Studie nicht.
Schon der Titel der Arbeit nennt übrigens zwei Quellen des Urteils nebeneinander: das nonverbale Verhalten und die körperliche Attraktivität. Beide waren in denselben Stummclips enthalten, und beide standen den Beurteilenden gleichermaßen zur Verfügung. Wer den Befund als Beleg für Menschenkenntnis liest, muss diese zweite Quelle mitlesen.
Was die Metaanalyse fand
Ein Jahr zuvor hatten dieselben beiden Forschenden die vorliegenden Arbeiten zusammengefasst. Ihre Metaanalyse über 38 Ergebnisse ergab eine mittlere Trefferquote von r = .39.
Was diese Zahl wert ist, lässt sich mit einem Werkzeug beziffern, das Robert Rosenthal selbst mitentwickelt hat: Man übersetzt die Trefferquote in einen Anteil richtiger Zuordnungen. Aus r = .39 wird dann eine Trefferrate von rund 70 gegen 30 Prozent. Das ist deutlich mehr als Zufall und deutlich weniger als Können — ungefähr die Auflösung, mit der man aus dreißig Sekunden Stummfilm eine Rangfolge erkennt, aber keine Person.
Bemerkenswerter als die Höhe war ein Nebenbefund:
Studies using longer periods of behavioral observation did not yield greater predictive accuracy
Ausschnitte unter einer halben Minute sagten nicht schlechter voraus als vier- bis fünfminütige Beobachtungen. Mehr Zuschauen brachte nicht mehr Genauigkeit.
Diese Gleichwertigkeit ist inzwischen bestritten. Dana Carney, Randall Colvin und Judith Hall fanden 2007 das Gegenteil: Bei ihnen stieg die Genauigkeit mit der Beobachtungsdauer, und etwa eine Minute ergab das beste Verhältnis von Aufwand und Treffsicherheit. Der Streit ist nicht entschieden. Eine veröffentlichte Re-Analyse, die die Metaanalyse von 1992 korrigieren würde, liegt bis heute nicht vor. Die belegte Einschränkung kommt von Carney und Kollegen: Die Genauigkeit hängt stark davon ab, welches Merkmal beurteilt wird und wie lange man hinsieht.
Welche Eigenschaften sich in Sekunden zeigen
Genau diese Abhängigkeit vom Merkmal ist der brauchbarste Teil des Befundes. In fünfsekündigen Ausschnitten wurden negativer Affekt, Extraversion, Gewissenhaftigkeit und Intelligenz bereits mäßig gut getroffen. Positiver Affekt, Neurotizismus, Offenheit und Verträglichkeit brauchten dagegen längere Beobachtung.
Die Aufteilung wirkt zunächst willkürlich, folgt aber einer Logik. Merkmale, die sich unmittelbar in sichtbares Verhalten übersetzen — Tempo, Lautstärke, Blickverhalten, Ordnung der Bewegungen —, sind in Sekunden da. Merkmale, die innere Zustände betreffen und die Menschen aktiv regulieren, sind es nicht. Ängstlichkeit lässt sich verbergen, Ausdrucksstärke nicht.
Vier Stellen, an denen es scheitern kann
David Funder hat 1995 beschrieben, was zwischen einer Eigenschaft und einem zutreffenden Urteil über sie alles gelingen muss. Sein Modell heißt Realistic Accuracy Model, und das Wort „realistisch“ trägt darin eine Ansage: Gemessen wird ein Urteil nicht daran, ob andere Beurteilende es teilen, sondern daran, ob die Eigenschaft tatsächlich vorliegt. Das klingt selbstverständlich, war es in diesem Forschungsfeld aber lange nicht — jahrzehntelang galt Übereinstimmung als Ersatzmaß für Richtigkeit, weil sie leichter zu haben ist. Das Modell nennt vier Stufen. Erstens Relevanz: Das Merkmal muss überhaupt Verhalten erzeugen, das mit ihm zu tun hat. Zweitens Verfügbarkeit: Dieses Verhalten muss in der beobachteten Situation vorkommen und nicht bloß anderswo. Drittens Entdeckung: Die beurteilende Person muss es bemerken. Und viertens Verwertung: Sie muss es richtig deuten.
Die Kette reißt an jeder Stufe, und die zweite reißt am häufigsten. Ein Bewerbungsgespräch zeigt zuverlässig, wie jemand Bewerbungsgespräche führt — nicht automatisch, wie er sechs Monate später im Team arbeitet. Zehn Sekunden Unterricht sagen etwas über die Wirkung einer Lehrperson auf Studierende, aber wenig über ihre Sorgfalt bei Prüfungen. Eine Bewerbung, ein Streit oder eine Kameraaufnahme erzeugen Rollen statt neutraler Ausschnitte; die ökologische Validität der Szene entscheidet mit darüber, was aus ihr überhaupt folgen kann.
Funders Modell erklärt außerdem, warum es einen brauchbaren Wahrheitsmaßstab braucht. Selbstbericht, Fremdbericht, Verhalten und Erfolg messen nicht dasselbe. Ein Urteil, das mit dem Selbstbild einer Person übereinstimmt, kann mit ihrem Verhalten auseinanderfallen — und keines der beiden ist automatisch das Richtige.
Was der Ausschnitt erfindet
Neben der Information reist etwas anderes mit derselben Geschwindigkeit. 2005 zeigten Alexander Todorov und Kollegen, dass Kompetenzurteile den Ausgang amerikanischer Kongresswahlen besser als der Zufall vorhersagen. Die Urteile beruhten ausschließlich auf dem Gesicht der Kandidaten. Bei den Senatswahlen des Jahres 2004 trafen sie in 68,8 Prozent der Rennen zu, und sie hingen linear mit dem Vorsprung des Siegers zusammen. Eine Sekunde Betrachtung des Gesichts genügte dafür. Die Urteile waren zudem spezifisch für Kompetenz und nicht bloß allgemeine Sympathie.
Man beachte, was hier vorhergesagt wird. Nicht die Kompetenz der Gewählten, sondern das Wahlergebnis. Ein Eindruck, der sich in einer Sekunde bildet und über die tatsächliche Eignung nichts weiß, hat messbaren Anteil an einer Entscheidung, die als Musterfall überlegten Abwägens gilt.
Wie wenig Zeit ein solcher Eindruck braucht, haben Janine Willis und Todorov 2006 nachgemessen. In fünf Experimenten reichten 100 Millisekunden Gesichtsbetrachtung, damit die Urteile über Attraktivität, Sympathie, Vertrauenswürdigkeit, Kompetenz und Aggressivität hoch mit den Urteilen ohne Zeitbeschränkung übereinstimmten. Längeres Hinsehen erhöhte die Übereinstimmung nicht. Es erhöhte die Sicherheit, mit der die Beurteilenden bei ihrem Urteil blieben. Zwei Nebenbefunde runden das Bild. Zwischen 100 und 500 Millisekunden wurden die Urteile negativer und fielen schneller; mit längerer Betrachtung wurden die Eindrücke zugleich differenzierter. Der Blick arbeitet also weiter — nur nicht an der Frage, ob er recht hat.
Das ist die eigentliche Falle. Zeit fühlt sich wie Prüfung an, ohne eine zu sein. Akzent, Kleidung, Körper, Geschlecht und Herkunft beeinflussen Eindrücke, selbst wenn sie für die Frage irrelevant sind. Und wenn mehrere Beurteilende übereinstimmen, ist das noch keine Wahrheit — eine Unterscheidung, auf der Funder ausdrücklich besteht. Konsens misst, wie ähnlich Menschen urteilen, nicht wie gut. Viele Beurteilende können denselben kulturellen Bias teilen und ihn füreinander bestätigen.
| Prüfung | Jahr | Umfang | Was dabei herauskam |
|---|---|---|---|
| Ambady & Rosenthal, Metaanalyse | 1992 | 38 Ergebnisse | r = .39; unter ½ Minute nicht schlechter als 4–5 Minuten |
| Ambady & Rosenthal, Lehrende | 1993 | 13 Lehrende, 3 × 10 Sekunden stumm | Semesterbewertungen vorhergesagt |
| Funder, Modell | 1995 | vier Stufen | Relevanz, Verfügbarkeit, Entdeckung, Verwertung |
| Todorov u. a., Senatswahlen | 2005 | Rennen von 2004 | Kompetenzurteil aus dem Gesicht trifft in 68,8 % |
| Willis & Todorov | 2006 | fünf Experimente | 100 ms genügen; mehr Zeit erhöht nur die Sicherheit |
| Carney, Colvin & Hall | 2007 | Ausschnitte verschiedener Länge | Genauigkeit steigt mit der Dauer, rund eine Minute am günstigsten |
Intuition mit Rückspiegel
Eine nützliche erste Einschätzung wird als Hypothese behandelt. Was genau habe ich beobachtet? Welche alternative Ursache gibt es? Würde ich dasselbe Verhalten bei einer anderen Person gleich deuten? Welche spätere Information würde mich umstimmen?
Praktisch hilft es, Beobachtung und Deutung zu trennen: „sprach dreimal dazwischen“ ist ein Befund, „ist respektlos“ bereits eine Erklärung. Mehrere Szenen, unterschiedliche Beobachtende und eine vorher festgelegte Frage vermindern den Spielraum, in dem Sympathie, Stereotype und Erwartungen unbemerkt zu Eigenschaften werden.
Was bleibt
Der erste Eindruck ist weder Zauberei noch Aberglaube, sondern ein Messgerät mit sehr ungleicher Auflösung. Für Merkmale, die sich in sichtbares Verhalten übersetzen, ist er brauchbar und erstaunlich schnell. Für alles, was nach innen gerichtet ist oder reguliert werden kann, ist er es nicht. Und für Merkmale, die man einem Gesicht ansehen zu können glaubt, liefert er zuverlässig ein Urteil — eines, das mit der Person nichts zu tun haben muss.
Woran man den Unterschied im Alltag erkennt, ist keine Frage der Intensität, sondern eine Frage der Zeit. Wenn längeres Hinsehen den Eindruck nur fester macht, ohne ihn zu ändern, misst man die eigene Sicherheit und nicht mehr die andere Person. Der erste Eindruck kann eine Tür öffnen. Er sollte nicht das Schloss austauschen, bevor die Person überhaupt gesprochen hat.
Quellen und warum sie hier stehen
Ambady, N., & Rosenthal, R. (1992). Thin slices of expressive behavior as predictors of interpersonal consequences: A meta-analysis. Psychological Bulletin, 111, 256–274.
Die Arbeit, die den Begriff prägt und die beiden tragenden Zahlen liefert: r = .39 über 38 Ergebnisse, und der Nebenbefund, dass längeres Beobachten nicht genauer machte. Das Zitat steht auf S. 256.
Ambady, N., & Rosenthal, R. (1993). Half a minute: Predicting teacher evaluations from thin slices of nonverbal behavior and physical attractiveness. Journal of Personality and Social Psychology, 64, 431–441.
Die Szene, mit der der Artikel beginnt — und die zweite Urteilsquelle, die schon im Titel steht: körperliche Attraktivität. Wer den Befund als Menschenkenntnis liest, muss sie mitlesen.
Funder, D. C. (1995). On the accuracy of personality judgment: A realistic approach. Psychological Review, 102, 652–670.
Das Vier-Stufen-Modell, an dem der Artikel zeigt, wo die Kette reißt — und die Unterscheidung zwischen Konsens und Richtigkeit, auf der der vorletzte Abschnitt steht.
Carney, D. R., Colvin, C. R., & Hall, J. A. (2007). A thin slice perspective on the accuracy of first impressions. Journal of Research in Personality, 41, 1054–1072.
Der offene Widerspruch zur Gleichwertigkeit von 1992 — und die Quelle für die Aufteilung, welche Merkmale in Sekunden sichtbar werden und welche nicht.
Todorov, A., Mandisodza, A. N., Goren, A., & Hall, C. C. (2005). Inferences of competence from faces predict election outcomes. Science, 308(5728), 1623–1626.
Der Befund, an dem der Artikel sich dreht: Vorhergesagt wird nicht die Kompetenz der Gewählten, sondern das Wahlergebnis — 68,8 Prozent der Senatsrennen von 2004.
Willis, J., & Todorov, A. (2006). First impressions: Making up your mind after a 100-ms exposure to a face. Psychological Science, 17(7), 592–598.
Misst, wie wenig Zeit ein Eindruck braucht — und den entscheidenden Nebenbefund: Längeres Hinsehen erhöhte nicht die Übereinstimmung, sondern die Sicherheit.