構成概念妥当性とは
測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
構成概念妥当性は、測定器具が主張する理論的構成概念を、それと相関するもの、それより狭いもの、あるいはまったく一貫性のないものではなく、実際に測定しているかどうかを問います。これは妥当性エビデンスの最も深い形態であり、一つの研究ではなく何年もかけて確立されるものです。
困難さは構造的なものです。レジリエンスや情動知能のような構成概念は、物体ではなく、行動における提案された規則性です。尺度がそれを測定していることを示すには、構成概念が記述された通りに存在するという主張と、これらの特定の項目がそれに到達しているという主張を同時に擁護する必要があります。2つの主張は分離できません。これが、1955年にこのアイデアを導入したクロンバックとミールが、一つの測定器具ではなく理論的ネットワーク全体を検証するものとして枠組みを設定した理由です。
論証の構築方法
予測された相関パターン。 理論は、構成概念がどのものとどの程度強く関連すべきかを述べます。セルフコンパッションは生活満足度と正の相関、うつ病と負の相関、自尊心とはそこそこの相関を持つべきです。自尊心との相関が0.9であれば、それは独立した構成概念ではないことになります。これらの予測の一つ一つが検証可能な主張であり、一つの失敗は情報をもたらします。
予測された集団差。 理論が特性は年齢とともに発達する、または臨床集団で高まると述べるなら、測定器具はそれを示すべきです。理論が要求する差を見出せないことは、測定器具、理論、またはその両方に対するエビデンスです。
介入への反応。 構成概念が訓練可能であるとされるなら、得点は訓練後に変動し、対照群では変動しないはずです。何に対しても反応しない構成概念は、人為的産物と区別することが困難です。
内部構造。 因子構造は理論化された構造と一致すべきです。そして重要なことに、新鮮な標本においてです。開発データに対する探索的因子分析は、設計された構造を何であれ見出します。新しいデータに対する確認的分析こそが、主張が実際に検証される場所です。
多特性多方法のアイデア
キャンベルとフィスクの1959年の貢献は、構成概念妥当性が2つのことを同時に要求すると主張したことです。異なる方法による同じ特性の測定は一致すべきであり、同じ方法による異なる特性の測定は一致すべきではない。
後半がほとんどの測定器具が苦労するところです。自己報告された共感が自己報告された調和性と0.7の相関を持ち、観察者による共感評定とは0.2の相関しかない場合、質問紙が最も強く測定しているものは共感ではなく、質問紙上での自分の一般的な記述方法です。方法の分散は自己報告研究における最も持続的な問題の一つであり、真剣な検証作業が質問紙以外の基準を求める理由です。
結果を読む際にこれが重要な理由
構成概念妥当性は、得点とその解釈の間に立つものです。よく検証された測定器具が、ある特性が高いと報告する場合、その記述の背後にある推論の連鎖には、特性が一貫した量として振る舞うこと、これらの項目がそれを追跡すること、そして得点がテストを受ける人々の間で類似の意味を持つことを確立した数十年の公開研究が含まれています。
構成概念の検証がないテストが同じことを報告する場合、その得点は誰もチェックしていないアルゴリズムによって生成された数値です。両者は結果画面上ではまったく同じに見えます。違いは完全に文書化にあります。だからこそ文書化を探す価値があるのです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。