noesisnoesis
測定の仕組み

心理テストにおける妥当性とは

妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。

妥当性とは、テストがそれが主張するものを測定しているかどうか、そしてその得点から人々が引き出す結論が正当なものであるかどうかを問うものです。これは心理測定学における中心的な問いであり、エビデンスではなくマーケティングの主張で答えられることが最も多い問いです。

1980年代のメシックの研究以来保持されている現代的な理解では、妥当性は測定器具の固定された属性ではありません。特定の用途のための得点の解釈の属性です。同じ質問紙が、ある人の自己認識を記述するためにはよく検証されていながら、その人を採用するかどうかの決定にはまったく検証されていないということがあり得ます。何に対して妥当かを述べずに「このテストは妥当です」と言うことは、主張ではなくスローガンです。

エビデンスの種類

妥当性は、いくつかの種類の蓄積されたエビデンスから構築されます。古いテキストではこれらを妥当性の別々の種として提示しますが、現在の見方では、単一のケースを支持する異なる論証として扱います。

内容エビデンスは、項目が構成概念を適切にカバーしているかどうかを問います。睡眠と食欲についてのみ尋ねるうつ病尺度は、身体症状をカバーし、気分と認知の症状を見逃しています。内容カバレッジは通常、主題の専門家によって判断されます。非常に短い尺度が常に妥協である理由がここにあります。

内部構造エビデンスは、項目が理論が述べる通りにグループ化されるかどうかを問います。モデルが4つの異なるファセットを主張するなら、因子分析は4つの因子を回復すべきです。そして重要なことに、尺度が構築されたデータだけでなく、独立した標本においてです。非常に多くの測定器具が開発標本では意図した構造を回復しながら、他のデータでは失敗します。

他の変数との関係は、ほとんどの作業が行われる場所です。収束的エビデンスは、尺度が相関すべきものと相関していることを示します。弁別的エビデンスは、異なるべきものと高すぎる相関を持たないことを示します。これは慢性的に軽視される要件であり、多くの新しくブランド化された構成概念を沈ませるものです。基準関連エビデンスは、得点が重要な結果と関連することを示します。同時に測定されるか、事前に予測されるかのいずれかです。

結果エビデンスは、テストが使用されたときに何が起こるかを問います。測定器具が構成概念とは無関係な理由であるグループを系統的に不利にするなら、それは倫理的な問題であるだけでなく、妥当性の問題です。

ほとんどの主張を露呈させる問い

妥当性の主張の最も鋭い検証は増分的妥当性です。この測定器具は、より安価で、より古い、確立された測定がすでに伝えていることに何かを追加するか。

驚くべき数のブランド化された構成概念がここで失敗します。既存のBig Fiveドメインとの相関が0.7以上であり、同じ大きさで同じ結果を予測し、古い測定を統計的に統制すると何も追加しません。構成概念は新しいですが、測定は新しくないのです。これが、真剣な測定器具文書の批判セクションが不正確さよりも冗長性をめぐることが非常に多い理由です。

何を確認すべきか

テストが検証されていると主張する人がいる場合、有用な質問は具体的なものです。どの基準に対して検証されたのか。どの集団で、どの規模で。因子構造は独立した標本で確認されたか。回答に商業的利益のない研究者による公開エビデンスはあるか。確立された代替案に対して何かを追加するか。

それらの質問に正直な答えを持つ測定器具は、限界を含めて真剣に受け止める価値があります。検証が推薦文のページと何百万人もの人が受けたという主張から成る測定器具は、まったく異なる質問に答えています。人気はエビデンスではなく、テストを受けた人の数はその得点が何かを意味するかどうかについて何も語りません。

実践で確かめる

測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。

続きを読む