収束的妥当性と弁別的妥当性
表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
収束的妥当性と弁別的妥当性は、一つの要件の両面です。測定は理論的に一致すべきものと相関しなければならず、かつ、異なるものであると主張する対象とは高すぎる相関を持ってはなりません。一方だけを満たすことは部分的な成功ではなく、通常、構成概念がそれ自身が主張するものではないことを示すサインです。
収束的妥当性
収束的エビデンスは、測定が同じものの他の指標と一致していることを示します。新しい不安尺度は、確立された不安尺度、臨床家の評定、そして理想的には、生理的測定や観察された回避行動など、質問紙以外のものとも実質的に相関すべきです。
ここでの相関は通常0.50以上が期待され、比較測定が同じ構成概念の確立された測定器具である場合は0.70以上が多いです。それ以下の場合、新しい尺度か比較対象のどちらかが別のものを測定しています。
罠があります。既存の尺度との0.95の相関は勝利ではありません。新しい測定器具が再パッケージであることを意味し、正直な問いは何を追加するかになります。収束的妥当性は下限であり、最大化すべき目標ではありません。
弁別的妥当性
弁別的エビデンスは、測定が異なると主張する構成概念から分離していることを示します。興味深い失敗事例が存在するのはここです。
このパターンは文献全体で繰り返されます。グリットは誠実性との相関が約0.84であり、メタ分析では誠実性を統制すると学業予測にほとんど何も追加しないことが判明するほど近いのです。自己報告式の情動知能は、情緒安定性、外向性、誠実性の組み合わせと大きく重なります。ダークトライアド全体の共有分散は、HEXACOモデルの誠実・謙虚性を考慮に入れると大部分が消失します。いずれの場合も、構成概念は新領域として提示され、結果として既存の地図の名前を変えた領域であることが判明しました。
弁別的妥当性は、方法効果が表面化する場所でもあります。ある研究のすべての自己報告式構成概念が互いに0.4の相関を示す場合、共通因子はおそらく共有された心理ではなく、回答者の回答スタイルです。
決定的な検証
決定的な手順は増分的妥当性です。まず確立された測定を回帰に投入し、次に新しい測定を投入して、新しい方が結果における追加の分散を説明するかどうかを確認します。説明しない場合、構成概念は理論的にはなお興味深いかもしれませんが、その測定器具はその分野がすでに持っていないものを測定していません。
これは厳しい基準であり、非常に多くの公開された尺度がこれにさらされたことがありません。さらされた場合、結果は上記の冗長性の知見であることが頻繁にあります。それはスキャンダルではなく、通常の科学的選別です。しかし、構成概念の人気がそれがこの検証を生き残るかどうかについて何の情報も提供しないことを意味します。
読み手にとって何が変わるか
テストが複数の得点を報告する場合、有用な質問はそれらの得点が実際に異なるかどうかです。互いに0.8の相関を持つ4つの次元は、4つのラベルを持つ1つの次元であり、そこから構築されたプロフィールは、ほとんど独立した情報を持たないまま差別化されて見えるでしょう。
尺度間相関を報告する測定器具では、これを自分で確認できます。4象限タイプを提示しながら象限間の関係を一度も示さない測定器具は、確認を不可能にしています。通常、それが意図されたことです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。