クロンバックのα係数とは何か、そして何でないか
心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
クロンバックのα係数は内的整合性の係数です。尺度上の項目が互いにどの程度相関しているかを示すものです。1951年に発表され、最も多く報告される心理測定統計量ですが、その普及ぶりは有用性を超えてしまっています。
αは0から1の範囲で、2つのものによって決まります。項目間の平均相関と、項目数です。この2番目の依存性が、ほとんどの誤解の原因です。
高いαが意味しないこと
尺度が一つのことを測定していることを意味しません。 これは最も一般的な誤りです。項目全体の相関が十分に高ければ、2つまたは3つの異なる因子を持つ尺度でもαは高くなり得ます。一次元性は因子分析によって確立する必要があります。αはそれを確立することができませんし、そのために作られたものでもありません。
尺度が妥当であることを意味しません。 αは項目が何を測定しているかについて何も語りません。靴のサイズに関する20の質問は、優れた内的整合性を持ちながら、心理学的なものの測定としてはゼロの妥当性を持つでしょう。
尺度が良いことを意味しません。 αは項目数とともに上昇するため、凡庸な項目の長い尺度が、優れた項目の短い尺度を上回ることがあります。項目間平均相関が0.2の40項目尺度でも、0.90を超えます。
非常に高いαはしばしば警告です。 おおよそ0.95を超えると、項目は通常ほぼ言い換えです。これは構成概念のカバレッジを犠牲にして整合性を得ているのです。つまり、尺度は一つの狭い側面を非常に精密に測定し、構成概念の残りを見逃しています。これは減衰のパラドックスと呼ばれ、より高い整合性が単調に良いわけではない理由です。
αが仮定すること
αは、特定の仮定の下での信頼性の下限です。タウ等価性、つまりすべての項目が基礎となる特性に等しく寄与するという仮定です。実際の尺度がこれを満たすことはほとんどありません。項目は因子への負荷量が異なり、そうなるとαは信頼性を過小評価します。
マクドナルドのオメガは等寄与の仮定を取り除き、実際の因子負荷量から信頼性を推定します。方法論者は20年にわたりαよりもオメガを推奨してきました。しかし、報告慣行の追随は遅く、主にαがすべての統計パッケージで1行で済むのにオメガはそうではないためです。
実践での読み方
おおよその慣例:0.70以上は集団比較の研究に許容可能、0.80以上は応用的使用に、0.90以上は得点が個人の意思決定に影響する場合に。これらは方向性として扱い、閾値としてではありません。必要なレベルは、得点が情報を提供する意思決定の重大さに依存します。
より情報量の多い数値は、通常同じ論文の他の場所にあります。項目間平均相関(0.15から0.50が健全な範囲)は、高いαが項目の質から来たのか量から来たのかを示します。項目数は反対の方向から同じことを示します。再テスト信頼性は、αが構造的に提供できないものを示します。同じ人物において得点が時間を通じて安定しているかどうかです。
αのみを報告する尺度は、取得が最も容易で、合格が最も容易な信頼性指標を報告しています。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。