心理テストにおける信頼性とは
信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
信頼性は、測定がノイズではなく再現可能である度合いです。1分間に3回体重を量って71、78、66キログラムと出たら、その体重計は信頼できません。そして、そこから実際の体重を知る方法はありません。心理学的測定は、はるかに精度の低い装置で同じ問題に直面しています。
信頼性について理解すべき重要なことは、それが主張しないことです。常に8キログラム多く表示する体重計は、完全に信頼性があり、完全に間違っています。信頼性は一貫性についてであり、その数値が正しいことを意味するかどうかは別の問題であり、妥当性と呼ばれます。信頼性は妥当性の必要条件ですが、十分条件にはほど遠いのです。
その形態
内的整合性は、尺度上の項目が互いに一致しているかを問います。10の質問がすべて同じ基礎的特性を測定するはずであれば、一つに高く答えた人は他にも高く答える傾向があるはずです。これは通常、クロンバックのα係数、またはより良くは、マクドナルドのオメガとして報告されます。
再テスト信頼性は、同じ人物が2つの時点で同様の得点を取るかを問います。これは、定義上安定しているはずの特性にとって最も重要な形態です。また、数週間後に同じ参加者を追跡する必要があるため、最も報告されないことが多い形態でもあります。
評定者間信頼性は、人間が測定器具を採点する場合に適用されます。臨床面接、投影法、行動観察などです。同じ資料を見ている2人の訓練を受けた評定者が同じ結論に達するかを問います。
平行テスト信頼性は、等価に構築された同じテストの2つの異なるバージョンが同じ得点を生み出すかを問います。テストが複数回実施され、項目への露出が懸念される場合に重要です。
数値の読み方
信頼性係数は0から1の範囲です。慣例はおおよそのもので広く誤用されていますが、大まかに言えば:0.90以上は得点が個人の人生に影響する場合に必要、0.80から0.90はほとんどの応用的使用に堅実、0.70から0.80は研究および集団比較に許容可能、0.70以下はほとんどの結論が耐えられるよりも多くのノイズを含むことを意味します。
これらの閾値について2つの注意点があります。第一に、これらは慣例であり法則ではなく、許容されるレベルは得点が何に使われるかに完全に依存します。第二に、短い尺度での非常に高いαは、通常、項目がほぼ互いの言い換えであることを示しており、構成概念をカバーすることを犠牲にして一貫性を得ています。「あなたは整理整頓されていますか」とわずかに異なる表現で問う10の質問からなる尺度は、優れた内的整合性を持ちながら、誠実性の狭い読み取りとなるでしょう。
自分の得点にとっての意味
信頼性は、一つの数値がどれだけの信頼に値するかに直接変換されます。信頼性0.85のテストでは、2人の間の数点の差、または今日の得点と先月の得点の差は、シグナルではなくノイズである可能性が非常に高いほどの測定誤差を伴います。
実際的な帰結は次の通りです。良い測定器具は信頼性を報告するので、得点を取り巻く不確実性の幅がわかります。その不確実性の技術的表現が測定の標準誤差であり、信頼性係数を得点の前後のプラスマイナスの幅に変換します。
信頼性の数値をまったく報告しない測定器具が、それだけで精密であるわけではありません。単に、どれだけ不精密であるかを伝えることを拒んだだけです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。