noesisnoesis
測定の仕組み

測定の標準誤差:得点がどれだけずれる可能性があるか

すべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。

測定の標準誤差は、抽象的な信頼性係数を具体的なものに変換します。つまり、得点の前後に付くプラスマイナスの幅です。ほとんどの結果画面が答えないままにしている問いに答えるものです。別の日にテストを受けていたら、この数値はどれだけ違っていた可能性があるのか。

計算式はシンプルです。尺度の標準偏差に、1から信頼性を引いた値の平方根を掛けます。標準偏差が10で信頼性が0.85の尺度の場合、標準誤差は約3.9点です。

その幅が実際にカバーする範囲

おおよそ3分の2の確率で、その人の真の位置は観測得点から標準誤差1つ分の範囲内にあります。約95%の信頼を得るには、前後に約2つ分の標準誤差が必要です。

上記の例を取り上げます。ある人が62点を取りました。95%信頼区間は約54から70です。これは16点の幅であり、平均と明らかに平均以上の差が10点程度であるような尺度上での話です。

これはそのテスト特有の欠陥ではありません。信頼性0.85は立派な値です。これは心理学的測定の通常の精度であり、慎重なレポートが点ではなく幅を提示する理由です。

多くの人が見落とす影響

尺度間の小さな差は、通常意味がありません。 外向性が58で開放性が54の場合、正直な読み取り方は両者が区別できないということです。4点の差から物語を構築するプロフィール解釈は、ノイズを読んでいます。

時間経過による小さな変化も、通常意味がありません。 テストを再受験して5点動いたとしても、ほとんどの測定器具ではそれは誤差の範囲内です。真の特性変化は何年もかけて起こり、月ごとの数点の動きではなく、誤差の幅を明らかに超える動きとして現れます。

順位付けは問題を増幅させます。 わずか数点の素点の差が、分布の密集した中央部では10パーセンタイルの移動につながることがあります。そこにほとんどの人が位置しているからです。パーセンタイル順位は精密に見えますが、得点を表現する方法としては最も不安定です。

精度は尺度全体で均一ではありません。 古典的テスト理論はすべての得点に一つの誤差値を仮定しますが、これは単純化です。項目反応理論は特性の各レベルで誤差を個別にモデル化し、ほぼ常に極端な値でより大きくなります。最も重要な解釈がなされる場所で、まさにそうなのです。非常に高いまたは非常に低い得点は、中程度の得点よりも一般的に精度が低く、高くはありません。

正直な報告が印象的に見えない理由

信頼区間を報告する測定器具は、小数点以下1桁まで単一の数値を報告するものよりも曖昧に見えます。曖昧に見える方が真実を伝えています。精密に見える方も同じ基礎的誤差を持っており、それを示さないことを選択しているのです。

科学的に文書化されたテストと、カテゴリーに分類する商業製品を比較する際に、これは覚えておく価値があります。カテゴリーの境界は特定の得点に位置し、その1点下の人と1点上の人は統計的に同じ人です。タイプのラベルはこれを完全に隠します。これはタイプベースの測定器具に対するより深刻な議論の一つであり、記述された誤差を伴う連続得点が研究の標準である理由です。

実践で確かめる

測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。

続きを読む

測定の標準誤差:得点がどれだけずれる可能性があるか | NOESIS — 心理測定テスト