Zum Hauptinhalt springen

Mustererkennung

Wann Ihr Bauchgefühl zuverlässig ist, wann es Zufall für Regel hält und woran Sie den Unterschied erkennen, bevor Sie entscheiden

Erfahrene Führungskräfte erkennen Muster, und meistens ist das ihre größte Stärke. Manchmal ist es ihr teuerster Fehler. Dieser Artikel erklärt, unter welchen zwei Bedingungen intuitive Mustererkennung nachweislich funktioniert, warum ausgerechnet Personalentscheidungen diese Bedingungen nicht erfüllen, wie Scheinmuster entstehen und mit welchem Prüfraster Sie beides im Alltag auseinanderhalten.


Zwei Szenen aus demselben Haus

Der Küchenchef schaut um 18:40 Uhr auf die Bonliste, sagt einen einzigen Satz zur Vorbereitung, und zwanzig Minuten später läuft die Küche durch einen Ansturm, den außer ihm niemand kommen sah. Gefragt, woran er das erkannt habe, zuckt er mit den Schultern. Man sieht das eben.

Zwei Wochen später sitzt dieselbe Person mit der Direktion im Bewerbungsgespräch. Nach sieben Minuten steht das Urteil fest: Wird nicht funktionieren, den Typ kenne ich. Auch hier: Man sieht das eben.

Beide Male arbeitet dasselbe geistige Werkzeug. Beide Male fühlt es sich identisch an. Und in einem der beiden Fälle ist es hochzuverlässig, im anderen kaum besser als Raten.

Welcher Fall welcher ist, lässt sich erstaunlich präzise bestimmen. Nur nicht am Gefühl.

Was Intuition tatsächlich ist

Der Nobelpreisträger Herbert Simon hat die brauchbarste Definition geliefert, und sie ist unromantisch: Die Situation liefert einen Hinweisreiz, dieser Hinweis öffnet den Zugriff auf im Gedächtnis abgelegte Information, und diese Information liefert die Antwort. Intuition, so Simon, ist nicht mehr und nicht weniger als Wiedererkennen.

Das ist keine Abwertung. Es ist eine Präzisierung, die alles Weitere erklärt. Wenn Intuition Wiedererkennen ist, dann hängt ihre Qualität an genau zwei Dingen: Gibt es in dieser Umgebung überhaupt etwas Wiederkehrendes zu erkennen, und hatte die Person ausreichend Gelegenheit, es zu lernen.

Gary Klein hat mit Feuerwehreinsatzleitern gearbeitet und beschrieben, wie erfahrene Führungskräfte im Einsatz nicht zwischen Optionen abwägen, sondern eine Situation als Typ wiedererkennen und sofort die dazu passende Reaktion abrufen. Das funktioniert dort hervorragend. Feuer verhält sich physikalisch, immer wieder ähnlich, und die Rückmeldung kommt innerhalb von Minuten.

Der Schachbefund, der das Prinzip auf den Punkt bringt

William Chase und Herbert Simon haben 1973 in Cognitive Psychology ein Experiment beschrieben, das seither zum Standardrepertoire der Expertiseforschung gehört. Schachmeister und Anfänger bekamen für wenige Sekunden eine Stellung gezeigt und sollten sie danach rekonstruieren.

Bei echten Partiestellungen waren die Meister den Anfängern haushoch überlegen. Bei zufällig auf das Brett gesetzten Figuren verschwand ihr Vorsprung fast vollständig.

Die Meister hatten kein besseres Gedächtnis. Sie hatten gelernte Muster, und die griffen nur dort, wo tatsächlich Struktur vorhanden war. Wo keine Struktur ist, nützt auch dreißig Jahre Erfahrung nichts.

Genau das ist die Frage, die sich jede Führungskraft vor einer Bauchentscheidung stellen sollte: Habe ich hier eine Partiestellung vor mir oder zufällig verteilte Figuren?

Die zwei Bedingungen, unter denen Intuition trägt

Daniel Kahneman und Gary Klein haben 2009 im American Psychologist etwas Ungewöhnliches getan. Zwei Forscher mit gegensätzlichen Grundhaltungen, einer als Skeptiker der Intuition, einer als ihr Anwalt, haben gemeinsam einen Aufsatz geschrieben und darin geklärt, worüber sie sich tatsächlich einig sind. Der Titel sagt es: A Failure to Disagree.

Ihr gemeinsames Ergebnis besteht aus zwei Bedingungen. Verlässliche intuitive Expertise entsteht nur, wenn beide erfüllt sind.

→  Erstens eine Umgebung mit ausreichender Regelmäßigkeit. In der Fachsprache: ein High-Validity-Environment. Es muss stabile Hinweise geben, die tatsächlich mit dem Ergebnis zusammenhängen. Wo Zufall dominiert, gibt es nichts zu lernen.

→  Zweitens die Gelegenheit, diese Regelmäßigkeiten zu lernen, und zwar durch ausgedehnte Übung mit schneller und eindeutiger Rückmeldung. Wer nie erfährt, ob seine Einschätzung stimmte, kann sie auch nicht verbessern, egal wie viele Jahre er im Beruf ist.

Beide Bedingungen sind unabhängig voneinander notwendig. Ein Anästhesist arbeitet in einer regelmäßigen Umgebung mit sofortiger Rückmeldung, seine Intuition ist verlässlich. Ein langfristiger politischer Prognostiker arbeitet in einer unregelmäßigen Umgebung ohne brauchbare Rückmeldung, seine Intuition ist es nicht, unabhängig von Erfahrung und Bekanntheitsgrad.

Der unangenehmste Satz aus dieser Forschung

Kahneman und Klein formulieren einen Befund, der die praktische Konsequenz dieses ganzen Themas trägt: Es gibt keinen subjektiven Marker, der richtige Intuitionen von solchen unterscheidet, die aus fehlerhaften Heuristiken stammen.

Anders gesagt: Das Gefühl der Sicherheit fühlt sich in beiden Fällen gleich an. Ein Küchenchef, der den Ansturm kommen sieht, und derselbe Küchenchef, der nach sieben Minuten einen Bewerber ablehnt, sind subjektiv gleich sicher.

Daraus folgt die eigentliche Handlungsanweisung dieses Artikels. Prüfen Sie nicht Ihr Gefühl, prüfen Sie die Umgebung. Das Gefühl kann Ihnen nichts über seine eigene Qualität sagen. Die Umgebung kann es.

Wo die Bedingungen im Hotel erfüllt sind und wo nicht

Für den Betriebsalltag lässt sich das erstaunlich klar sortieren. Entscheidend sind immer dieselben zwei Fragen: Wiederholt sich das oft genug, und erfahre ich schnell genug, ob ich richtig lag?

Umgebungen, in denen Bauchgefühl im Gastgewerbe berechtigt ist:

→  Ablauf und Timing im Service und in der Küche. Hunderte Wiederholungen pro Monat, Rückmeldung innerhalb von Minuten.

→  Einschätzung einer Gästesituation am Empfang. Ob eine Reklamation gleich eskaliert oder sich mit zwei Sätzen auflösen lässt, erkennen erfahrene Kräfte tatsächlich zuverlässig.

→  Auslastungsverläufe im eigenen Haus über die Woche und das Jahr. Klare Regelmäßigkeit, messbare Rückmeldung.

→  Technische Störungen, die sich ankündigen. Wer den Konvektomaten seit acht Jahren bedient, hört die Vorstufe eines Defekts früher als jedes Wartungsintervall.

Umgebungen, in denen dasselbe Bauchgefühl unzuverlässig wird:

→  Personalauswahl. Wenige Wiederholungen pro Jahr, verzögerte und lückenhafte Rückmeldung.

→  Prognosen darüber, wer im Team kündigen wird. Die Rückmeldung kommt erst mit der Kündigung und dann ohne die eigentliche Begründung.

→  Einschätzung, wer sich als Führungskraft eignet. Die Rückmeldung kommt nach Monaten, vermischt mit hundert anderen Einflüssen.

→  Ursachenzuschreibung bei Konflikten. Hier gibt es faktisch gar keine objektive Rückmeldung, nur eine Erzählung im Nachhinein.

→  Neue Situationen ohne Vorbild, etwa die erste Eröffnung, der erste Tarifwechsel, die erste Übernahme eines zweiten Hauses.

Die Liste ist unbequem, weil ausgerechnet die folgenreichsten Entscheidungen alle in der unteren Hälfte stehen.

Das Feedback-Loch bei Personalentscheidungen

Ein Grund dafür verdient eigene Aufmerksamkeit, weil er selten benannt wird. Bei Personalentscheidungen fehlt strukturell die Hälfte der Rückmeldung.

Wenn Sie jemanden einstellen, sehen Sie, wie es läuft. Wenn Sie jemanden ablehnen, sehen Sie nichts. Nie. Sie erfahren nicht, ob die abgelehnte Person die bessere Wahl gewesen wäre, weil dieser Verlauf nie stattfindet.

Damit lernt man aus Einstellungen einseitig. Jede Fehleinstellung ist sichtbar und schmerzt, jede Fehlablehnung bleibt unsichtbar und kostenlos. Ein Muster, das auf so einseitigem Material trainiert wurde, wirkt von innen gut bestätigt und ist es nicht.

Dazu kommt die Zahl. Ein Haus mit vierzig Beschäftigten führt vielleicht fünfzehn Auswahlgespräche im Jahr. Das sind in zehn Jahren einhundertfünfzig Fälle mit halber Rückmeldung. Ein Küchenchef sammelt in derselben Zeit hunderttausende Wiederholungen mit vollständiger Rückmeldung.

Was die Daten zu Personalentscheidungen tatsächlich sagen

An dieser Stelle wird es messbar. Zwei Forschungsstränge sind für den Betriebsalltag relevant.

Der erste stammt aus der Vorhersageforschung. Paul Meehl hat bereits 1954 die Frage aufgeworfen, ob geschulte Fachleute besser urteilen als eine schlichte, festgelegte Auswertungsregel. William Grove und Kollegen haben die Frage 2000 in Psychological Assessment meta-analytisch beantwortet: Mechanische Vorhersageverfahren waren im Mittel etwa zehn Prozent genauer als klinische Urteile. In 33 bis 47 Prozent der untersuchten Studien war das mechanische Verfahren deutlich überlegen, in nur 6 bis 16 Prozent das menschliche Urteil.

Ein Detail dieser Auswertung ist für Auswahlgespräche besonders unangenehm: Das menschliche Urteil schnitt gerade dann besonders schlecht ab, wenn ein persönliches Interview zu den Informationsquellen gehörte.

Der zweite Strang betrifft die Eignungsdiagnostik direkt. Philip Sackett und Kollegen haben 2022 im Journal of Applied Psychology die gängigen Validitätswerte für Auswahlverfahren neu berechnet, nachdem sich gezeigt hatte, dass frühere Meta-Analysen systematisch zu stark für Varianzeinschränkung korrigiert hatten. Die Werte fielen dadurch überwiegend niedriger aus als die jahrzehntelang zitierten Zahlen von Schmidt und Hunter aus dem Jahr 1998.

Die Rangfolge in der Neuberechnung: strukturierte Interviews rund .42, Tests zum Fachwissen rund .40, empirisch gewichtete Biografiedaten rund .38, Arbeitsproben rund .33, kognitive Fähigkeitstests rund .31. Das unstrukturierte Gespräch, also genau das Format, in dem Mustererkennung nach sieben Minuten ihr Urteil fällt, liegt bei rund .19.

Der Abstand zwischen .42 und .19 ist der praktische Kern. Es geht nicht darum, Auswahlgespräche abzuschaffen. Es geht darum, sie zu strukturieren, weil dieselbe Gesprächszeit dann etwa doppelt so viel Vorhersagekraft liefert.

Zur Einordnung gehört auch: Diese Werte sind Durchschnitte über viele Berufe und Kontexte, und gerade bei strukturierten Interviews streuen sie erheblich. Sie sind eine Richtgröße für die Wahl des Verfahrens, keine Vorhersage für den einzelnen Bewerber.

Wie Scheinmuster entstehen

Der zweite Fehlermodus ist nicht das zu schwache, sondern das zu willige Erkennen. Menschen finden Muster auch dort, wo keine sind, und die Forschung dazu ist alt und stabil.

Loren und Jean Chapman haben 1967 gezeigt, dass geschulte Fachleute Zusammenhänge zwischen Testmerkmalen und Diagnosen zu sehen glaubten, die in den Daten nachweislich nicht existierten. Sie nannten das illusorische Korrelation. Entscheidend war nicht die Datenlage, sondern die Erwartung: Was zusammenzupassen scheint, wird als zusammengehörig erinnert.

Im Betrieb sieht das so aus. Zwei Auszubildende aus derselben Berufsschule haben abgebrochen, also gilt diese Schule als schlecht. Drei Reklamationen kamen an einem Dienstag, also ist Dienstag der schwierige Tag. Zwei Leute aus der Spätschicht sind gegangen, also stimmt etwas mit der Spätschicht nicht. Vielleicht. Vielleicht sind es aber auch zwei Fälle bei fünfzig Gelegenheiten, und das ist schlicht kein Muster.

Drei Merkmale unterscheiden das Scheinmuster vom echten. Es beruht auf wenigen Fällen, es ist nach hinten erzählt statt nach vorn geprüft, und es hat keinen plausiblen Mechanismus. Wo alle drei zutreffen, sollte man nicht handeln, sondern zählen.

Die Gegenprobe: auch der Skeptiker kann sich irren

An dieser Stelle wird der Artikel gern zu einem Plädoyer gegen Bauchgefühl. Das wäre genauso falsch, und dafür gibt es ein hübsches Beispiel aus der Forschung selbst.

Über Jahrzehnte galt der sogenannte Hot-Hand-Effekt im Basketball als Musterbeispiel dafür, dass Menschen in Zufallsfolgen Muster sehen. Die Grundlage war eine Untersuchung von Gilovich, Vallone und Tversky aus dem Jahr 1985.

2018 haben Joshua Miller und Adam Sanjurjo in Econometrica gezeigt, dass die damalige Auswertungsmethode einen systematischen statistischen Fehler enthielt. Nach dessen Korrektur kehrt sich der Befund um: Es gibt Hinweise darauf, dass der Effekt real ist. Die Spielerinnen und Spieler hatten das Muster also gesehen, und die Wissenschaft hatte es zunächst wegkorrigiert.

Die Lehre daraus ist nicht, dass Statistik unzuverlässig wäre. Sie ist, dass beide Richtungen geprüft gehören. Ein Muster zu unterstellen kann falsch sein. Ein Muster zu bestreiten, weil es nach Aberglaube klingt, ebenfalls. Beide Male hilft nur nachzählen.

Das Prüfraster: fünf Fragen vor der Bauchentscheidung

Diese fünf Fragen dauern zusammen unter einer Minute und ersetzen jede Grundsatzdiskussion über Intuition.

→  Wie oft habe ich genau diese Situation schon erlebt? Bei unter etwa zwanzig Fällen ist Vorsicht angebracht, unabhängig von der Berufserfahrung insgesamt.

→  Habe ich nach diesen Fällen jeweils erfahren, ob ich richtig lag? Wenn nein, hat sich das Muster nie korrigieren können.

→  Kenne ich auch die Fälle, in denen ich Nein gesagt habe? Wenn nein, ist mein Material einseitig.

→  Kann ich benennen, woran genau ich es erkenne? Wer wenigstens zwei konkrete Hinweisreize nennen kann, hat vermutlich ein echtes Muster. Wer nur „Erfahrung“ sagt, vielleicht nicht.

→  Gibt es einen plausiblen Mechanismus, warum dieser Hinweis mit dem Ergebnis zusammenhängt? Ohne Mechanismus bleibt Korrelation Zufallsverdacht.

Drei oder mehr Nein-Antworten bedeuten nicht, dass die Entscheidung falsch wird. Sie bedeuten, dass sie ein Verfahren braucht statt eines Gefühls.

Vier Werkzeuge, die im Betrieb funktionieren

→  Das Entscheidungsjournal. Vor jeder größeren Personalentscheidung drei Zeilen: was ich erwarte, woran ich es festmache, wann ich nachschaue. Nach sechs Monaten nachlesen. Das ist die einzige Möglichkeit, sich das fehlende Feedback selbst zu bauen, und sie kostet zwei Minuten pro Fall.

→  Kriterien vor dem Kandidaten. Wer erst die Anforderungen festlegt und dann Menschen bewertet, entscheidet anders als jemand, der nach dem Gespräch begründet. Reihenfolge ist hier alles.

→  Dieselben Fragen für alle. Ein strukturiertes Gespräch ist kein Verhör, sondern schlicht ein fester Fragenkatalog mit vorher festgelegten Bewertungsankern. Genau dieser Unterschied steckt in der Spanne zwischen .19 und .42.

→  Die Basisrate nachschlagen, bevor man das Muster glaubt. Wenn zwei von zwei Azubis einer Schule abgebrochen haben, lautet die nächste Frage: Wie viele waren es insgesamt, und wie hoch ist die Abbruchquote in unserem Haus über alle Schulen? Meistens löst sich das Muster an dieser Stelle auf.

Wo Sie Ihrem Bauchgefühl unbedingt folgen sollten

Damit dieser Artikel nicht in die falsche Richtung kippt, gehört der Gegenpol ausdrücklich dazu. Es gibt Situationen, in denen das Zögern teurer ist als der mögliche Irrtum.

→  Bei akuten Sicherheits- und Gesundheitsfragen. Wenn etwas im Betrieb sich falsch anfühlt, wird zuerst gehandelt und danach geprüft.

→  Bei operativen Entscheidungen unter Zeitdruck in Ihrer eigenen Kerndomäne. Genau dafür ist das Muster gebaut worden.

→  Als Frühwarnung, nicht als Urteil. Ein ungutes Gefühl bei einer Bewerbung ist ein guter Anlass, gezielter nachzufragen, und ein schlechter Grund, das Gespräch innerlich zu beenden.

Der letzte Punkt ist der praktisch wichtigste. Intuition als Hinweis ist wertvoll. Intuition als Beschluss ist es in Umgebungen niedriger Validität nicht.

Was in den ersten Wochen passiert, wenn Sie umstellen

→  Woche eins: Widerstand. Strukturierte Gespräche fühlen sich künstlich an, und das stimmt auch. Der Eindruck verschwindet ungefähr beim vierten Gespräch.

→  Woche zwei bis vier: Der Eindruck, langsamer zu sein. Ist teilweise richtig. Ein strukturiertes Gespräch dauert länger in der Vorbereitung und kürzer in der Auswertung.

→  Nach etwa drei Monaten: Die ersten Einträge im Entscheidungsjournal werden fällig. Hier entsteht der eigentliche Nutzen, weil zum ersten Mal sichtbar wird, welche der eigenen Vorhersagen tatsächlich getroffen haben.

→  Nach etwa einem Jahr: Die Trefferquote der eigenen Einschätzungen lässt sich beziffern. Fast alle Führungskräfte finden dabei zwei bis drei Muster, die stabil funktionieren, und ein bis zwei, die sich als Erzählung herausstellen.

Abgrenzung zu fünf verwandten Artikeln dieser Reihe

Dieses Thema berührt mehrere frühere Artikel, ist aber mit keinem identisch.

Der Bestätigungseffekt beschreibt, wie wir Informationen bevorzugt so auswählen, dass sie zu einer bestehenden Annahme passen. Er erklärt, warum ein einmal gefasstes Muster stabil bleibt. Dieser Artikel setzt davor an und fragt, ob das Muster überhaupt eine Grundlage hat.

Die Verfügbarkeitsheuristik erklärt, warum leicht erinnerbare Fälle unser Urteil dominieren. Sie ist einer der Mechanismen, über die Scheinmuster entstehen, aber sie ist nicht die Frage nach der Validität der Umgebung.

Der Halo-Effekt beschreibt, wie ein einzelnes auffälliges Merkmal die Bewertung aller übrigen färbt. Er ist ein typischer Fehler im unstrukturierten Auswahlgespräch, aber eben ein einzelner Fehler und nicht die grundsätzliche Frage, wann Wiedererkennen trägt.

Der Rückschaufehler erklärt, warum wir hinterher glauben, wir hätten es kommen sehen. Er sorgt dafür, dass unsere Trefferquote in der Erinnerung besser aussieht, als sie war, und ist damit einer der Gründe, warum das Entscheidungsjournal schriftlich geführt werden muss.

Der Überkonfidenzeffekt beschreibt die generelle Neigung, die eigene Treffsicherheit zu überschätzen. Dieser Artikel liefert die spezifische Erklärung dafür, wann diese Überschätzung besonders groß wird: in Umgebungen ohne verlässliche Rückmeldung.

Drei Einwände, die berechtigt sind

„Ich liege mit meinem Bauchgefühl bei Bewerbern fast immer richtig.“ Das kann stimmen und lässt sich nicht am Gefühl entscheiden. Die einzige Möglichkeit, es herauszufinden, ist, die Einschätzung vorher aufzuschreiben und später nachzulesen. Wer das ein Jahr lang tut, weiß es. Vorher weiß es niemand, auch nicht nach zwanzig Berufsjahren.

„Struktur nimmt dem Gespräch die Menschlichkeit.“ Ein häufiger und nachvollziehbarer Einwand. Er verwechselt Struktur mit Steifheit. Feste Fragen und Bewertungsanker regeln, was verglichen wird, nicht wie man miteinander spricht. Der Smalltalk bleibt, nur zählt er nicht mehr als Kriterium.

„Bei uns entscheidet ohnehin der Praxistag.“ Das ist bereits ein gutes Verfahren, denn eine Arbeitsprobe gehört zu den treffsichereren Methoden. Wichtig ist dann nur, dass auch der Praxistag vorher festgelegte Kriterien hat. Sonst wird er zu einem langen Gespräch mit Schürze.

Fazit

Mustererkennung ist keine mystische Gabe und kein Denkfehler. Sie ist Wiedererkennen, und sie ist genau so gut wie die Umgebung, in der sie gelernt wurde.

Deshalb lautet die praktische Regel nicht, dem Bauchgefühl zu misstrauen. Sie lautet, vor der Entscheidung kurz die Umgebung zu prüfen statt das Gefühl. Wiederholt sich das oft genug? Erfahre ich, ob ich richtig lag? Kenne ich auch die Fälle, die ich abgelehnt habe?

In der Küche wird die Antwort dreimal Ja lauten. Im Bewerbungsgespräch dreimal Nein. Und genau deshalb gehört in die eine Situation ein schneller Blick und in die andere ein Fragenkatalog.

Quellen und Anmerkungen

·  Chase, W. G. & Simon, H. A. (1973). Perception in chess. Cognitive Psychology, 4(1), 55–81. — Überlegenheit von Schachmeistern bei echten Partiestellungen, weitgehendes Verschwinden des Vorsprungs bei zufällig gesetzten Figuren.

·  Klein, G. (1998). Sources of Power: How People Make Decisions. Cambridge, MA: MIT Press. — Recognition-Primed Decision Model, Untersuchungen mit Feuerwehreinsatzleitern.

·  Kahneman, D. & Klein, G. (2009). Conditions for intuitive expertise: A failure to disagree. American Psychologist, 64(6), 515–526. — Zwei Bedingungen für verlässliche Intuition; Simons Definition von Intuition als Wiedererkennen; die Feststellung, dass kein subjektiver Marker richtige von fehlerhaften Intuitionen unterscheidet.

·  Meehl, P. E. (1954). Clinical versus Statistical Prediction. Minneapolis: University of Minnesota Press.

·  Grove, W. M., Zald, D. H., Lebow, B. S., Snitz, B. E. & Nelson, C. (2000). Clinical versus mechanical prediction: A meta-analysis. Psychological Assessment, 12(1), 19–30. — Mechanische Verfahren im Mittel rund 10 Prozent genauer; deutliche Überlegenheit in 33 bis 47 Prozent der Studien, deutliche Unterlegenheit in 6 bis 16 Prozent; besonders schwache Ergebnisse des menschlichen Urteils bei Einbezug persönlicher Interviews.

·  Sackett, P. R., Zhang, C., Berry, C. M. & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection: Addressing systematic overcorrection for restriction of range. Journal of Applied Psychology. — Neuberechnete Validitätswerte, unter anderem strukturierte Interviews rund .42 und unstrukturierte rund .19; die Werte liegen überwiegend unter den lange zitierten Schätzungen von Schmidt & Hunter (1998).

·  Chapman, L. J. & Chapman, J. P. (1967). Genesis of popular but erroneous psychodiagnostic observations. Journal of Abnormal Psychology, 72(3), 193–204. — Illusorische Korrelation.

·  Gilovich, T., Vallone, R. & Tversky, A. (1985). The hot hand in basketball: On the misperception of random sequences. Cognitive Psychology, 17(3), 295–314.

·  Miller, J. B. & Sanjurjo, A. (2018). Surprised by the hot hand fallacy? A truth in the law of small numbers. Econometrica, 86(6), 2019–2047. — Nachweis eines systematischen Auswertungsfehlers in der klassischen Analyse; nach Korrektur Hinweise auf einen realen Effekt.

·  Anmerkung zur Verwendung der Validitätszahlen: Es handelt sich um Durchschnittswerte über viele Berufe, Branchen und Länder. Gerade bei strukturierten Interviews streuen die Werte erheblich. Sie eignen sich zur Wahl eines Verfahrens, nicht als Vorhersage für einen einzelnen Bewerber.

·  Anmerkung zur Schwelle von etwa zwanzig Fällen im Prüfraster: Diese Zahl ist eine Praxisfaustregel von ClarityLead Lab zur Orientierung, kein aus einer Studie abgeleiteter Grenzwert. Die zugrunde liegende Aussage der Forschung lautet lediglich, dass verlässliche Muster ausgedehnte Übung mit Rückmeldung voraussetzen.

·  Anmerkung zur früheren Verwendung in dieser Reihe: In unserem Artikel zum Dunning-Kruger-Effekt wurden noch die Validitätsschätzungen von Schmidt & Hunter (1998) zitiert. Die hier verwendeten Werte von Sackett und Kollegen (2022) sind der aktuellere Stand und fallen niedriger aus. Die inhaltliche Aussage, dass strukturierte Verfahren unstrukturierten deutlich überlegen sind, bleibt in beiden Auswertungen bestehen.