インターネット上の性格テストの多くが信頼できない理由
不誠実だからではなく、測定を信頼できるものにする手順が目に見えず、費用がかかり、省略しやすいからです。省略しても、結果の見た目は何も変わりません。
無料のオンライン性格テストと検証された心理測定器具は、見た目がまったく同じ出力を生みます。得点、パーセンタイル、あなたを記述する段落。違いは、結果画面からは見えない作業に完全にあります。
これは正確に理解する価値があります。通常の枠組みでは、インターネットのテストは詐欺だとされますが、それはほぼ間違っており、あまり役に立ちません。ほとんどは騙す意図のない人々によって作られています。構造的な理由で信頼できないのです。
通常省略されるもの
項目分析。 適切に構築された尺度では、ほとんどの草案項目はパイロット後に廃棄されます。誰も変動しない項目、合計との相関が低い項目、複数の因子に負荷する項目、年齢や言語グループ間で異なる振る舞いをする項目です。パイロットなしで書かれ公開されたテストは、機能しない項目も含めてすべてを残しています。
独立した構造確認。 尺度を構築したデータに対する因子分析は、設計した構造を回復させます。新鮮な標本でそれを確認することは別の研究であり、大部分の尺度が失敗する段階です。
基準値。 パーセンタイルはどこかから来なければなりません。サイトが参照集団を明示していなければ、その数値は以前の訪問者(構成が不明な自己選択グループ)から導出されたか、特に何からも導出されていません。
再テストデータ。 人々が来月も同じ得点を取ることを確認するには、彼らを再び見つける必要があります。これを行う人はほとんどいません。つまり、「特性」という言葉が暗示する安定性は実証されていないのです。
設計のインセンティブは反対方向に働く
エンゲージメントのために構築されたテストは、正確さのために構築されたテストとは異なる成果に最適化されており、両者は予測可能な方法で乖離します。
好ましい結果のほうがパフォーマンスが良いです。歓迎されない内容を伝える結果は共有されにくいため、結果は誰もが自分自身の中に認識する記述へと流れていきます。これがバーナム効果であり、1940年代に実証され、それ以来確実に再現されています。人々は一般的な性格の記述を、自分自身について非常に正確だと評価します。
タイプは次元よりもパフォーマンスが良いです。「あなたはアーキテクトです」は、「あなたは開放性の68パーセンタイルにあり、信頼区間は広いです」よりも共有しやすいです。タイプはまた測定誤差を隠します。カテゴリー境界の前後1点の人がまったく異なるラベルを受け取るからです。
短いほうが適切な長さよりパフォーマンスが良いです。質問が追加されるたびに回答者を失うため、テストは構成概念をカバーする長さではなく、完了率を最大化する長さに切り詰められます。
これらのいずれも嘘ではありません。正確さ以外の指標に対する最適化です。
約30秒で見分ける方法
著者と年を持つ名前付きのソース測定器具を探してください。基準値がどの集団から来ているかの記述を探してください。限界や測定誤差のいかなる承認も探してください。結果が連続得点かカテゴリーかを確認してください。同じページが20の質問からあなたの理想的なキャリア、パートナー、人生の目的を特定すると約束していないか確認してください。
測定器具の名前を挙げ、出典を引用し、基準値を明示し、何が分からないかを述べているテストは、その作業を行っています。それらのいずれも行っていないテストは、5分間の心地よい過ごし方であるかもしれませんが、生み出す数値は装飾です。
NOESISカタログのすべての測定器具は、どの公開テストを実装しているか、誰が書いたか、いつ書かれたか、どのようにスコアリングされるか、そしてその結果が何を確立しないかを明示しています。その最後の部分が、他と比較する価値のあるものです。
実践で確かめる
測定について読むことと、自分のスコアがその出典、ノルムサンプル、限界とともに報告されるのを見ることは別物です。
続きを読む
- 心理測定学とは心理学的測定が有効かどうかを見極める学問です。似た質問をする2つのテストでも、その結果の価値が大きく異なりうる理由がここにあります。
- 心理テストにおける信頼性とは信頼性は測定の一貫性であり、正しさではありません。テストは高い信頼性を持ちながら、間違ったものを測定することもあり得ます。信頼性は最初に問われる質問ですが、最後の質問ではありません。
- 心理テストにおける妥当性とは妥当性はテストが持つ属性ではありません。特定の得点の特定の解釈が、特定の目的に対して正当化できるかどうかの論証であり、新しい用途ごとに再構築する必要があります。
- 構成概念妥当性とは測定において最も難しい問題です。あなたが測定しているものが、定義した通りに存在するかどうか、そしてあなたの測定器具がそれに隣接するものではなく、それ自体に到達しているかどうかです。
- 収束的妥当性と弁別的妥当性表裏一体の2つの要件です。測定は、一致すべきものと一致し、かつ、異なると主張するものとは区別されなければなりません。弱い測定器具の多くは後者で失敗します。
- クロンバックのα係数とは何か、そして何でないか心理テストで最も報告される統計量であり、最も誤読される統計量です。αは尺度が一次元であることを示すものではなく、高い値はしばしば美点ではなく症状です。
- 測定の標準誤差:得点がどれだけずれる可能性があるかすべての得点には誤差の幅があり、ほとんどの心理テストではその幅は多くの人が想像するより広いです。差が本物なのかノイズなのかを教えてくれる数値です。
- 基準値とパーセンタイル:あなたの得点は何と比較されるのか素点だけでは解釈できません。参照集団との比較によって初めて意味を持ちます。どの集団が使われたかは、テストに関する最も重要でありながら最も知られていない事実の一つです。
- 心理測定テストはどのように作られるのか構成概念の定義から基準値の公開まで、この過程には何年もかかり、投入されたもののほとんどが廃棄されます。手順を知れば、簡易オンラインクイズがどの段階を省略しているかは明らかです。
- テストが「科学的に検証済み」とはどういう意味かこの言葉は規制されておらず、必要な作業を一切行っていない製品でも自由に使われています。意味がある場合の定義と、2つのケースを見分ける4つの質問を解説します。
- 自己報告で測定できるものとできないもの質問紙はあなた自身に観察者になるよう求めますが、それはあるものについてはうまく機能し、別のものについてはうまく機能しません。この方法が強いところと失敗するところを知ることで、あらゆる結果の読み方が変わります。
- テストが何かを予測するとはどういう意味か相関係数0.30は、性格研究においては強い知見ですが、ある個人に関する意思決定の根拠としては弱いものです。どちらの記述も正しく、この間のギャップがテスト結果の誤用の大部分を引き起こしています。
- スクリーニングは診断ではないスクリーニング質問紙は、高い偽陽性率を代償として受け入れ、可能な限り多くの該当例を拾い上げるよう設計されています。スクリーニングの得点を診断として読むことは、その設計意図を逆転させることです。