測定の標準誤差:得点がどれだけずれる可能性があるか
すべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
測定の標準誤差は、抽象的な信頼性係数を具体的なものに変換します。つまり、得点の前後に付くプラスマイナスの幅です。ほとんどの結果画面が答えないままにしている問いに答えるものです。別の日にテストを受けていたら、この数値はどれだけ違っていた可能性があるのか。
計算式はシンプルです。尺度の標準偏差に、1から信頼性を引いた値の平方根を掛けます。標準偏差が10で信頼性が0.85の尺度の場合、標準誤差は約3.9点です。
その幅が実際にカバーする範囲
おおよそ3分の2の確率で、その人の真の位置は観測得点から標準誤差1つ分の範囲内にあります。約95%の信頼を得るには、前後に約2つ分の標準誤差が必要です。
上記の例を取り上げます。ある人が62点を取りました。95%信頼区間は約54から70です。これは16点の幅であり、平均と明らかに平均以上の差が10点程度であるような尺度上での話です。
これはそのテスト特有の欠陥ではありません。信頼性0.85は立派な値です。これは心理学的測定の通常の精度であり、慎重なレポートが点ではなく幅を提示する理由です。
多くの人が見落とす影響
尺度間の小さな差は、通常意味がありません。 外向性が58で開放性が54の場合、正直な読み取り方は両者が区別できないということです。4点の差から物語を構築するプロフィール解釈は、ノイズを読んでいます。
時間経過による小さな変化も、通常意味がありません。 テストを再受験して5点動いたとしても、ほとんどの測定器具ではそれは誤差の範囲内です。真の特性変化は何年もかけて起こり、月ごとの数点の動きではなく、誤差の幅を明らかに超える動きとして現れます。
順位付けは問題を増幅させます。 わずか数点の素点の差が、分布の密集した中央部では10パーセンタイルの移動につながることがあります。そこにほとんどの人が位置しているからです。パーセンタイル順位は精密に見えますが、得点を表現する方法としては最も不安定です。
精度は尺度全体で均一ではありません。 古典的テスト理論はすべての得点に一つの誤差値を仮定しますが、これは単純化です。項目反応理論は特性の各レベルで誤差を個別にモデル化し、ほぼ常に極端な値でより大きくなります。最も重要な解釈がなされる場所で、まさにそうなのです。非常に高いまたは非常に低い得点は、中程度の得点よりも一般的に精度が低く、高くはありません。
正直な報告が印象的に見えない理由
信頼区間を報告する測定器具は、小数点以下1桁まで単一の数値を報告するものよりも曖昧に見えます。曖昧に見える方が真実を伝えています。精密に見える方も同じ基礎的誤差を持っており、それを示さないことを選択しているのです。
科学的に文書化されたテストと、カテゴリーに分類する商業製品を比較する際に、これは覚えておく価値があります。カテゴリーの境界は特定の得点に位置し、その1点下の人と1点上の人は統計的に同じ人です。タイプのラベルはこれを完全に隠します。これはタイプベースの測定器具に対するより深刻な議論の一つであり、記述された誤差を伴う連続得点が研究の標準である理由です。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。