noesisnoesis
Wie gemessen wird

Was ist Reliabilität bei psychologischen Tests?

Reliabilität bezeichnet die Konsistenz einer Messung, nicht deren Korrektheit. Ein Test kann hochreliabel sein und dennoch das Falsche messen – weshalb sie die erste Frage ist, die gestellt wird, aber niemals die letzte.

Reliabilität ist der Grad, in dem eine Messung wiederholbar ist und nicht auf Zufallsfehler zurückgeht. Wenn Sie sich innerhalb einer Minute dreimal wiegen und dabei 71, 78 und 66 Kilogramm erhalten, wäre die Waage unzuverlässig – und Sie hätten keine Möglichkeit, Ihr tatsächliches Gewicht daraus abzuleiten. Die psychologische Messung steht vor demselben Problem, jedoch mit weitaus weniger präzisen Instrumenten.

Das Entscheidende beim Verständnis von Reliabilität ist, was sie nicht beansprucht. Eine Badezimmerwaage, die konstant acht Kilogramm zu viel anzeigt, ist vollkommen reliabel und völlig falsch. Reliabilität betrifft Konsistenz; ob die Zahl das Richtige bedeutet, ist eine gesonderte Frage, die als Validität bezeichnet wird. Reliabilität ist notwendig für Validität, aber bei Weitem nicht hinreichend.

Die verschiedenen Formen

Interne Konsistenz fragt, ob die Items einer Skala miteinander übereinstimmen. Wenn zehn Fragen alle dasselbe zugrunde liegende Merkmal erfassen sollen, sollten Personen, die bei einer Frage hohe Werte angeben, tendenziell auch bei den anderen hohe Werte angeben. Dies wird üblicherweise als Cronbachs Alpha oder besser als McDonalds Omega berichtet.

Retest-Reliabilität fragt, ob dieselbe Person zu zwei verschiedenen Zeitpunkten ähnliche Ergebnisse erzielt. Dies ist die Form, die für Persönlichkeitseigenschaften am wichtigsten ist, die per Definition stabil sein sollen. Sie wird auch am häufigsten nicht berichtet, da sie erfordert, dieselben Teilnehmer Wochen später erneut zu kontaktieren.

Interrater-Reliabilität kommt zum Einsatz, wenn Menschen das Instrument auswerten – bei klinischen Interviews, projektiven Verfahren oder Verhaltensbeobachtungen. Sie fragt, ob zwei geschulte Beurteiler, die dasselbe Material betrachten, zu demselben Schluss gelangen.

Paralleltest-Reliabilität fragt, ob zwei verschiedene Versionen desselben Tests, die als gleichwertig konzipiert wurden, dieselben Ergebnisse liefern. Sie ist überall dort relevant, wo ein Test mehr als einmal eingesetzt wird und die Bekanntheit der Items ein Problem darstellt.

Die Zahlen lesen

Reliabilitätskoeffizienten reichen von 0 bis 1. Die Konventionen sind grob und werden häufig falsch angewendet, aber grob gesagt: Über 0,90 ist erforderlich, wenn ein Wert das Leben einer Einzelperson beeinflusst; 0,80 bis 0,90 ist solide für die meisten Anwendungsbereiche; 0,70 bis 0,80 ist für Forschungszwecke und Gruppenvergleiche akzeptabel; und unter 0,70 enthält der Wert mehr Messfehler, als die meisten Schlussfolgerungen vertragen können.

Zwei Hinweise zu diesen Schwellenwerten: Erstens handelt es sich um Konventionen, nicht um Gesetze – das akzeptable Niveau hängt vollständig davon ab, wofür der Wert verwendet wird. Zweitens deutet ein sehr hoher Alpha-Wert bei einer kurzen Skala meist darauf hin, dass die Items nahezu Umformulierungen voneinander sind, was Konsistenz auf Kosten der Konstruktabdeckung erkauft. Eine Skala mit zehn Fragen, die alle auf leicht unterschiedliche Weise fragen „Sind Sie organisiert?», wird eine hervorragende interne Konsistenz aufweisen, aber Gewissenhaftigkeit nur eng erfassen.

Was das für Ihren eigenen Wert bedeutet

Reliabilität schlägt sich direkt darin nieder, wie viel Vertrauen eine einzelne Zahl verdient. Ein Test mit einer Reliabilität von 0,85 weist einen Messfehler auf, der groß genug ist, dass eine Differenz von wenigen Punkten zwischen zwei Personen – oder zwischen Ihrem heutigen und Ihrem letztmonatigen Ergebnis – mit großer Wahrscheinlichkeit Rauschen statt Signal ist.

Dies ist die praktische Konsequenz: Ein gutes Instrument berichtet seine Reliabilität, damit Sie wissen, wie groß die Unsicherheit um Ihren Wert herum ist. Der technische Ausdruck dieser Unsicherheit ist der Standardmessfehler, der einen Reliabilitätskoeffizienten in ein Plus-minus-Band um den Wert umrechnet.

Ein Instrument, das überhaupt keinen Reliabilitätswert angibt, ist dadurch nicht präziser. Es hat lediglich darauf verzichtet, Ihnen mitzuteilen, wie unpräzise es ist.

Auf die Probe stellen

Über Messung zu lesen ist das eine. Den eigenen Wert mit Quelle, Normstichprobe und Grenzen zu sehen ist das andere. Kostenlos, ohne Anmeldung.

Weiterlesen

Was ist Reliabilität bei psychologischen Tests? | NOESIS