基準値とパーセンタイル:あなたの得点は何と比較されるのか
素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
あなたが誠実性尺度で34点を取りました。これは高いのでしょうか。
比較なしにはこの質問に答えることはできません。何点満点中の34点なのか、誰と比較してなのか、いつ測定されたのか。基準値は、素点を解釈可能な位置に変換する参照データであり、それを選ぶことはテスト構築における最も重要な決定の一つです。
変換の仕組み
基準標本は、標準的な条件下で測定器具を受けた人々のグループであり、その得点分布が物差しとなります。素点はその後、その分布内の位置として表されます。
パーセンタイル順位は、基準標本のうちあなたと同じかそれ以下の得点を取った人の割合を示します。70パーセンタイルは、その参照グループの70%がより低い得点を取ったことを意味します。パーセンタイルは直感的ですが、過小評価されがちな欠点があります。分布の密集した中央部では差を引き伸ばし、端では圧縮するのです。平均付近の数点の素点で多くのパーセンタイルが移動しますが、上位付近の同じ数点ではほとんど動きません。
標準得点(z得点、T得点、スタナイン、IQ式尺度)は、平均からの距離を標準偏差単位で表します。これらは得点間の実際の間隔を保持するため、結果に対して算術を行うあらゆる場面で好まれます。
なぜ参照グループがすべてか
同じ素点でも、基準標本によって非常に異なるパーセンタイルに位置する場合があります。一般成人集団に対してスコアリングされた誠実性と、現役の会計士の標本に対してスコアリングされた誠実性では、同じパーセンタイルにはなりません。どちらの数値も間違いではなく、異なる問いに答えているのです。
これにより、基準標本のいくつかの特性を知っておく価値があります。
誰が含まれていたか。 心理学専攻の学生を対象とした便宜的標本はいまだに一般的で、人類の狭いスライスを代表しています。若く、教育を受けた、裕福な西洋諸国出身者が不均衡に多いのです。そのような標本に基づく基準値は、他の集団にはうまく当てはまりません。
どのくらいの規模だったか。 裾における安定したパーセンタイル推定には大きな標本が必要です。数百人では、95パーセンタイルがどのようなものかの信頼できない像しか得られません。
いつ収集されたか。 基準値は変動します。さまざまな心理学的測定における集団の平均は数十年にわたって測定可能なほど移動しており、1995年の基準標本は2026年にテストを受ける集団をもはや記述していません。
層別化されているか。 多くの特性は年齢と性別によって系統的に変動します。刺激希求は年齢とともに急激に低下し、時間型は生涯を通じて変化します。55歳の人を全年齢の基準値と比較すると、両方において誤解を招く位置を生みます。
何を確認すべきか、そしてその不在が意味すること
よく文書化された測定器具は、基準標本の規模、構成、国、年を明示し、基準値が層別化されているかどうかを述べます。本格的なテストマニュアルはこれに章を費やしています。
ほとんどの無料オンラインテストはこれを一切報告しません。どの集団を指すかの記述なしにパーセンタイルを提供します。そのパーセンタイルは、記述されていない便宜的標本から導出されたか、異なる集団で収集された公開基準値から借用されたか、そのウェブサイトのテストをこれまでに受けた人々から生成されたものです。サイト運営者にさえ構成が不明な自己選択グループです。
パーセンタイルは画面上に表示され、本物と同じように見えます。両者を分けるのは、それに付随する文書化であり、それだけです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。