心理測定学とは
心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
心理測定学は、測定そのものを扱う心理学の一分野です。外向性が何を意味するかではなく、ある質問のセットが実際に外向性を測定しているかどうか、結果の数値にどれだけの誤差があるか、そしてその数値が何を予測する資格があるかについてです。
この区別は、思われるより重要です。誰でも、どれだけ社交的かについて20の質問を書いて回答を合計できます。心理測定学はその後に来る作業です。20の質問がまとまっていること、3つではなく1つのことを測定していること、同じ人が来月もおおよそ同じ得点を取ること、得点がその人の実際の行動に関連していること、そしてこの装置全体がリスボンの22歳にもミュンヘンの55歳にも同じように機能することを示す作業です。
なぜ一つの学問分野が必要だったか
物理的測定には、心理学にはない利点があります。測定しているものの横にメートル定規を置くことができます。誠実性にはメートル定規がありません。特性は直接観察できず、行動から推測されます。質問紙の回答は、その上にさらにもう一層の推論を重ねたものです。
これは心理測定学者が潜在変数と呼ぶものです。結果をもたらすほど実在しますが、間接的な指標を通じてしか到達できないものです。方法論的装置全体がこの間接性のために存在します。遭遇するあらゆる技法、つまり因子分析、信頼性係数、項目反応理論、基準標本は、誰も観察できない量について擁護可能な何かを述べようとする試みです。
3つの問い
語彙を取り除くと、心理測定学はあらゆる測定器具に3つのことを問います。
一貫しているか。 測定がほとんどノイズであれば、他の何も問題になりません。一貫性は、項目間(質問は互いに一致しているか)、時間を通じて(同じ人が来月も同じ得点を取るか)、そして関連する場合は評定者間で確認されます。これが信頼性です。
主張するものを測定しているか。 質問紙は完全に一貫していながら、間違ったものを測定することがあり得ます。リーダーシップの潜在力を測定すると主張しながら単純な自尊心と0.8の相関を持つ尺度は、自尊心を測定しています。これが妥当性であり、測定器具が持っているか持っていないかという属性ではなく、蓄積されたエビデンスから構築される論証です。
誰と比較してか。 素点の34はそれ自体では何も意味しません。参照グループに対してのみ解釈可能になります。34はどの集団と比較して高いのか、いつ、どこで測定されたのか。これが基準値の仕事であり、ほとんどの消費者向けテストが完全に省略する段階です。
良い実践はどのようなものか
よく構築された測定器具にはペーパートレイルがあります。誰かが項目がどのように書かれ、どれが廃棄されたかを公開しました。誰かが名前付きの標本で、標本サイズとともに信頼性係数を報告しました。誰かが因子構造が、構築に使われたものではなく、第二の独立した標本で維持されるかを検証しました。誰かが項目が言語や年齢グループ間で同じように振る舞うかを確認しました。別の誰かが、理想的にはその測定器具に利害関係のない者が、知見を再現しようとし、何が起こったかを報告しました。
これらのいずれもテストを無謬にしません。その限界を知りうるものにします。それは異なる、より有用な属性です。測定誤差が文書化されている測定器具は、2つの得点間の小さな差をどれだけ信頼できるかを示します。公開された誤差推定のない測定器具がより正確なのではありません。不正確であることについて、ただ静かなだけです。
読者にとっての位置づけ
心理測定学はテストが真実であるとは教えてくれません。得点がどこまで押し広げられると意味を失うかを教えてくれます。どの質問に答えられるか、どの集団で較正されたか、差がどのくらい大きければ注目に値するかです。
それはほとんどの性格製品がする約束より控えめです。しかし、エビデンスとの接触に耐える唯一の約束でもあります。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。