noesisnoesis
測定の仕組み

心理テストにおける信頼性とは

信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。

信頼性は、測定がノイズではなく再現可能である度合いです。1分間に3回体重を量って71、78、66キログラムと出たら、その体重計は信頼できません。そして、そこから実際の体重を知る方法はありません。心理学的測定は、はるかに精度の低い装置で同じ問題に直面しています。

信頼性について理解すべき重要なことは、それが主張しないことです。常に8キログラム多く表示する体重計は、完全に信頼性があり、完全に間違っています。信頼性は一貫性についてであり、その数値が正しいことを意味するかどうかは別の問題であり、妥当性と呼ばれます。信頼性は妥当性の必要条件ですが、十分条件にはほど遠いのです。

その形態

内的整合性は、尺度上の項目が互いに一致しているかを問います。10の質問がすべて同じ基礎的特性を測定するはずであれば、一つに高く答えた人は他にも高く答える傾向があるはずです。これは通常、クロンバックのα係数、またはより良くは、マクドナルドのオメガとして報告されます。

再テスト信頼性は、同じ人物が2つの時点で同様の得点を取るかを問います。これは、定義上安定しているはずの特性にとって最も重要な形態です。また、数週間後に同じ参加者を追跡する必要があるため、最も報告されないことが多い形態でもあります。

評定者間信頼性は、人間が測定器具を採点する場合に適用されます。臨床面接、投影法、行動観察などです。同じ資料を見ている2人の訓練を受けた評定者が同じ結論に達するかを問います。

平行テスト信頼性は、等価に構築された同じテストの2つの異なるバージョンが同じ得点を生み出すかを問います。テストが複数回実施され、項目への露出が懸念される場合に重要です。

数値の読み方

信頼性係数は0から1の範囲です。慣例はおおよそのもので広く誤用されていますが、大まかに言えば:0.90以上は得点が個人の人生に影響する場合に必要、0.80から0.90はほとんどの応用的使用に堅実、0.70から0.80は研究および集団比較に許容可能、0.70以下はほとんどの結論が耐えられるよりも多くのノイズを含むことを意味します。

これらの閾値について2つの注意点があります。第一に、これらは慣例であり法則ではなく、許容されるレベルは得点が何に使われるかに完全に依存します。第二に、短い尺度での非常に高いαは、通常、項目がほぼ互いの言い換えであることを示しており、構成概念をカバーすることを犠牲にして一貫性を得ています。「あなたは整理整頓されていますか」とわずかに異なる表現で問う10の質問からなる尺度は、優れた内的整合性を持ちながら、誠実性の狭い読み取りとなるでしょう。

自分の得点にとっての意味

信頼性は、一つの数値がどれだけの信頼に値するかに直接変換されます。信頼性0.85のテストでは、2人の間の数点の差、または今日の得点と先月の得点の差は、シグナルではなくノイズである可能性が非常に高いほどの測定誤差を伴います。

実際的な帰結は次の通りです。良い測定器具は信頼性を報告するので、得点を取り巻く不確実性の幅がわかります。その不確実性の技術的表現が測定の標準誤差であり、信頼性係数を得点の前後のプラスマイナスの幅に変換します。

信頼性の数値をまったく報告しない測定器具が、それだけで精密であるわけではありません。単に、どれだけ不精密であるかを伝えることを拒んだだけです。

実践で確かめる

測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。

続きを読む

心理テストにおける信頼性とは | NOESIS — 心理測定テスト