自己報告で測定できるものとできないもの
質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
広く使われている性格およびウェルビーイングの測定器具のほぼすべてが自己報告式の質問紙です。文を読み、それがどの程度自分に当てはまるかを評定し、評定を合計します。安価で、速く、スケーラブルであり、真の強みがあります。しかし、自分自身の結果を読む前に知っておく価値のある限界もあります。
うまく機能する場合
他の誰も観察できない内的状態。 生活満足度、知覚されたストレス、意味、感じられる不安。これらについて、その人は便利な情報源であるだけではなく、唯一の妥当な情報源です。観察者があなたの主観的ウェルビーイングを評定するのは推測にすぎません。
時間を通じて集約された典型的行動。 人々は、個々の事例を予測するのが苦手であっても、普段何をしているかを報告することにはそこそこ優れています。特性測定が機能するのは、場面を通じて平均化するからです。
それ自体として関心の対象である自己認識。 自分がどれだけ有能だと信じているかは、実際にどれだけ有能であるかとは独立に、何を試みるかを形作ります。自己効力感は、信念が結果をもたらすからこそ、正当な構成概念なのです。
機能しなくなる場合
社会的望ましさ反応。 人々は自分自身を実際よりも誠実で、共感的で、敵意が少ないと報告し、この効果は利害が大きくなるほど増大します。低リスクの自己理解の文脈では歪みは控えめです。採用においては深刻です。ほとんどの性格項目の透明な表現は偽りやすく、偽る動機が最も強い候補者は、雇用主が最も特定したい候補者です。
限られた自己洞察。 自己報告は、その人をよく知る情報提供者からの報告とそこそこの相関しかなく、そのギャップはまさに予測される場所で最大です。評価的重みを持つ特性について、そして自己像が最も不正確な人々においてです。自分自身の不注意に気づかない人は、それを報告する良い立場にありません。
能力対信念。 自己報告は能力を測定できません。自己報告式の情動知能は、自分がどれだけ感情的に有能だと信じているかを測定し、これは感情的判断を必要とする課題の遂行とはそこそこの相関しかありません。両方とも実在する構成概念ですが、同じものではなく、両者を混同することは商業的テスト市場における最も一般的な誤りの一つです。
参照グループ効果。 「私は一生懸命働く」は、人や文化によって異なる暗黙の比較グループに対して評定されます。これにより、素の自己報告の平均値の異文化比較は、見落としやすく修正しにくい方法で信頼できなくなります。
回答時の気分。 現在の感情は回顧的判断を系統的に色づけます。安定しているはずの構成概念に対する一回限りの得点は、特性の枠組みが示唆する以上の状態分散を含んでいます。
回答スタイル。 黙従(内容に関わらず同意する傾向)および極端な回答は、個人間および文化間で異なります。よく構築された尺度は逆転項目でこれを緩和しますが、それ自体のアーチファクトを導入します。混合表現の尺度は、内容ではなく表現を反映する疑似的な第二因子を日常的に生み出します。
これを踏まえて自分の結果を読む方法
自己報告の得点を、自分が自分自身をどう見ているかのよく構造化された説明として扱ってください。それは真に情報的ですが、自分がどのような人であるかの説明と同じではありません。
両者のギャップはしばしば最も興味深い部分です。得点が驚きをもたらすとき、テストが間違っているかどうかではなく、2つの読み方(あなた自身のものと測定器具のもの)のうちどちらを周りの人が認識するかという問いが、じっくり考える価値のあるものです。
それはまた、質問紙が提供できるものの正直な限界であり、いかなる単一の得点も判決ではなく一つの入力として扱うべき理由です。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。