テストが何かを予測するとはどういう意味か
相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
性格研究は、誠実性が職務遂行能力を予測すると報告しています。この文を読むと、ほとんどの人はデータが示すよりもはるかに強いものを想像します。統計的主張と日常語の「予測する」の間のギャップが、心理テストの誤用の大部分が始まる場所です。
関係する数値
性格研究における効果量は、通常相関として報告されます。よく確立された関係のメタ分析値は、通常0.20から0.35の間に位置します。誠実性と職務遂行能力は約0.20から0.25です。仕事の満足度と職務遂行能力は約0.30です。一般的知的能力は、この分野で最も強い単一の予測因子であり、複雑な仕事に対しておおよそ0.50に達します。
相関を二乗すると、説明される分散の割合が得られます。0.25の相関は、人々の間の違いの約6%を説明します。94%は別のものです。能力、機会、訓練、マネジメント、健康、運。
なぜ0.25がそれでも真の知見なのか
集団レベルでは、小さな相関が実質的な集約的効果を生みます。1,000人を選抜する場合、0.25の予測因子は平均的な成果を測定可能かつ繰り返し改善します。保険会社や疫学者は、この規模の効果の上にまるごとの実務を構築しています。
問題は、集約的な利益と個人の予測は異なる量であることです。0.25の相関は、高得点の人々の間では低得点の人々の間よりも多くの人がうまく遂行することを意味します。そして同時に、高得点者の非常に多くがうまく遂行せず、低得点者の非常に多くが優れた成果を上げることも意味します。両方の記述は同じ数値から来ています。
個人のケース
ここが省略される段階です。相関は2つの分布間の関係を記述します。特定の個人についての記述を正当化するものではありません。
誠実性と遂行能力の相関が0.25であれば、ある人の誠実性得点を知ることは、その遂行能力のもっともらしい範囲をわずかにしか狭めません。1人の個人に対する予測区間は、ほぼ全結果範囲を含むほど広いままです。あなたが誠実性の80パーセンタイルにいると伝えられても、特定の仕事でどのように遂行するかについてはほとんど分かりません。
これが、基礎研究が健全であっても、性格得点を主要な選抜フィルターとして使用することが十分に支持されない理由です。研究は、特性が重要であるという主張を支持します。得点が応募者が何をするかを伝えるという主張は支持しません。
さらに2つの注意点
予測と因果は異なります。 この文献のほぼすべては相関的です。誠実性が健康結果を予測するという知見は、誠実性がより良い健康行動を引き起こしていること、第三の要因が両方を引き起こしていること、逆因果と整合的です。縦断的デザインは可能性を狭めますが、それらを閉じることはまれです。
自己報告基準は数値を膨張させます。 予測因子と結果の両方が同じ午後に同じ人物によって自己報告される場合、共通方法分散が相関を押し上げます。客観的結果や他者評定を使用する研究は通常より小さな効果を報告し、それらが重み付けすべきものです。
得点が実際に何に役立つか
予言ではなく記述として読むとき、テスト得点は真に有用です。それは、文書化された結果を持つ特性について参照集団に対してどこに位置するかを伝え、名前を付けることなく気づいていたかもしれないパターンに語彙を与えます。
それは持つ価値があります。予測とは異なるものであり、その区別は正直なレポートがあなたに推測させるのではなく、あなたのために行うべきものです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。