心理測定テストはどのように作られるのか
構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
出版に至る心理測定器具は、通常5年から6年の作業を経ており、そのために書かれたもののほとんどを廃棄してきました。この手順を知っておく価値があります。なぜなら、各段階がテストが不適切でありうる方法に対応しているからです。
1. 構成概念を定義する
いかなる項目も書かれる前に、構成概念はその外側に何が位置するかを述べられるほど正確に特定されなければなりません。これは定義、次元構造の記述(1次元か複数か、複数の場合どのように関連するか)、そして隣接する構成概念のうちどれと区別されるべきかの明示的な説明を意味します。
この段階を省略することが、ほとんどの冗長な測定器具の起源です。概念の直感的な感覚から構築された尺度は、通常、新しい名前の下で確立された特性を測定することになります。
2. 項目プールを生成する
項目は、最終的に残るものをはるかに超えて起草されます。通常、最終的な数の3倍から5倍です。理論、既存の測定器具、記述される経験を持つ人々へのインタビュー、および主題の専門家から生まれます。
この段階でプールは、内容カバレッジ(構成概念全体をカバーしているか、1つの側面に集中しているか)、読解レベル、二重含意の表現、そして実際には別のことを尋ねている項目についてレビューされます。
3. パイロットと選別
プールは最初の標本に適用されます。分析は主に破壊的です。
分散がほとんどない項目は除去されます。全員が同じように答える質問は誰も区別しません。合計得点との相関が低い項目は除去されます。複数の因子に交差負荷する項目は除去されます。特性とは無関係な理由で人口統計グループ間で異なる振る舞いをする項目、つまり差異項目機能を示す項目は除去されます。この確認は最も一般的に省略されるものの一つです。
残るのは、通常、書かれたものの3分の1です。
4. 新鮮な標本で構造を確認する
これが、真剣な測定器具をその他から分ける段階です。開発標本に対する因子分析は設計された構造を回復します。項目がそれを生み出すように選択されたため、そうならざるを得ません。真のテストは、独立した標本での確認的因子分析です。
非常に多くの公開された尺度は、構築に使われたデータでのみ意図した構造を回復します。他の誰かが新しいデータを収集すると、因子は現れません。この失敗は十分に一般的であるため、「構造は独立した標本で確認されたか」は、いかなる測定器具についても尋ねる最も効率的な質問の一つです。
5. 妥当性エビデンスを蓄積する
同じ構成概念の確立された測定との相関。異なるべき構成概念との相関。これはより低いほうが望ましいです。重要な結果との関係。既存のものに対する増分的妥当性。構成概念に適切な間隔での再テスト安定性。
この段階は終わりません。測定器具が使用されている限り続き、出版から何年も経って測定器具が最も頻繁に不十分であることが判明する場所です。
6. 基準値を構築する
意図した集団に対して十分に大きく、十分に代表的な参照標本で、特性が年齢や性別によって異なる場合は層別化され、年と国が文書化されたものです。そして定期的に繰り返されます。基準値は変動するからです。
7. 他の場所で使用される場合は翻訳する
翻訳は言語的な作業ではありません。適切な適応とは、順翻訳、独立した逆翻訳、専門家レビュー、ターゲット言語話者との認知面接、そして新しい言語での新鮮な心理測定研究を行い、構造が維持されるか、項目が等価に機能するかを検証することを意味します。その研究なしに翻訳された測定器具は、原語での実績がどうであれ、その言語では未検証の測定器具です。
これが簡易クイズについて意味すること
午後に書かれたテストは、ステップ2を完了しています。もっともらしく見える結果、パーセンタイル、記述の段落を生み出すことは十分あり得ます。省略された段階は、そのいずれかが何かを意味するかどうかを確立するはずだったものです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。