テストが「科学的に検証済み」とはどういう意味か
この言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
「科学的に検証済み」は保護された用語ではありません。誰もそれを認証せず、監査する機関もなく、エビデンス基盤の全体が多くの人が受けたというだけの製品にも使われています。正しく使われる場合の意味を知っておく価値があります。
要約
検証された測定器具には、何を測定するか、どの程度正確に、どの集団で、そしてその得点が何のために正当に使用できるかを示す公開された記録があります。検証は認定証ではありません。通常何年もかけて蓄積されるエビデンスの集合体であり、通常、測定器具を称賛するよりもその使用を制約する知見を含んでいます。
文書化された限界の存在は、より良いシグナルの一つです。真の検証文献はそれらで溢れています。この尺度は青年ではうまく機能しない、その側面は再現されない、カットオフは集団に依存する。強みだけを報告する製品は、その検証を公開したのではなく、マーケティングを公開したのです。
決定的な4つの質問
出典論文は何か? 検証された測定器具には、査読付きジャーナルのオリジナル論文があり、著者、年、通常DOIが記されています。その論文は、項目がどのように開発され、初期の心理測定特性がどのようなものであったかを報告します。誰もその論文の名前を挙げられなければ、議論すべき検証はありません。
構造は他の誰かによって確認されたか? 開発チームは自分たちが設計した構造を回復させるでしょう。重要なのは、独立したグループが独立したデータで同じものを見つけたかどうかです。これは尋ねることのできる最も情報量の多い一つの質問であり、最も答えられないままにされる質問です。
基準値はどの集団に基づき、いつ作られたか? 得点は参照分布内の位置です。どの集団を指すかを述べずにパーセンタイルを報告する測定器具は、分母のない数値を提供したことになります。
何を追加するか? 確立された測定に対する増分的妥当性。非常に多くのブランド化された構成概念がここで失敗し、既存の特性との相関が高すぎて、何に対しても追加の分散を説明しません。これは科学的精査の通常の結果であり、誰かがその検証を実行しない限り見えないものです。
翻訳が複雑にする部分
英語で検証された測定器具は、それだけではドイツ語で検証されたことになりません。適切な異文化適応には、順翻訳と逆翻訳、専門家レビュー、認知面接、そして新しい言語での新鮮な心理測定研究が必要であり、因子構造が維持されるかどうか、個々の項目が集団間で等価に機能するかどうかを検証します。
これを省略する測定器具は一般的です。オリジナルの検証が完璧な質問紙でも、重要な項目が異なる含意を持つ言語ではまったく異なる振る舞いをすることがあり、その研究なしには知る方法がありません。テストが10の言語で提供されている場合、有用な質問は、10の言語で検証されたのか、1つの言語で検証されて9つに翻訳されたのかです。
検証が買わないもの
得点を確実にするものではありません。検証された測定器具でも測定誤差を伴い、個人の運命ではなく集団レベルの規則性を記述し、その項目が到達するものだけを測定します。
検証が買うのは、知りうる限界です。どれだけの誤差を、どの集団で、どの目的のために、確認できます。「このテストはあなたが本当は誰かを明らかにします」よりも控えめな主張ですが、それだけが持ちこたえるものです。
文書化が存在する場合どのようなものかを見たい方は、NOESISカタログのすべてのテストが、実装した測定器具、その著者と年、スコアリング方法、そしてその背後のエビデンスを記載しています。そのエビデンスが論争されている部分も含めてです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- インターネット上の性格テストの多くが信頼できない理由不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。