自陈量表能测量什么和不能测量什么
问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
几乎所有广泛使用的人格和幸福感测评工具都是自陈式问卷。你阅读一句陈述,评定它有多贴切地描述了你,这些评定被加总起来。这种方式成本低、速度快、易于规模化,也确实有真正的优势——但它也有一些失效模式,值得在你阅读自己的结果之前有所了解。
它表现良好的地方
其他任何人都无法观察到的内在状态。 生活满意度、感知压力、意义感、感受到的焦虑。对于这些,本人不仅仅是一个方便的来源;他们是唯一有效的来源。一个观察者对你主观幸福感的评定,只是猜测而已。
长期聚合而来的典型行为。 人们在报告自己通常做什么方面相当擅长,即使他们在预测任何单一事件方面表现不佳。特质测量之所以有效,正是因为它对多次场合取了平均。
作为其自身价值所在的自我感知。 你认为自己有多大能力,会影响你去尝试什么,这与你实际的能力无关。自我效能感之所以是一个合理的构念,正是因为这种信念本身就会产生后果。
它会失效的地方
社会称许性作答。 人们报告自己比实际更尽责、更有共情心、更少敌意,而且这种效应会随利害关系的增加而增强。在自我认知这种低风险的场景中,失真程度是温和的。而在招聘场景中,这种失真则很严重:大多数人格题目措辞透明,很容易被伪装作答,而最有动机去伪装的应聘者,恰恰是雇主最想识别出来的那些人。
有限的自我洞察。 自陈报告与熟悉这个人的知情者报告之间只有中等程度的相关,而这个差距恰恰在你能预测到的地方最大——即那些带有评价色彩的特质,以及那些自我认知最不准确的人身上。一个没有意识到自己不专心的人,并不适合去报告这一点。
能力与信念之间的差异。 自陈报告无法测量一种能力。自我报告的情商测量的是你认为自己在情绪方面有多大能力,而这与在需要情绪判断的任务上的实际表现只有中等程度的相关。这两者都是真实的构念;但它们不是同一个构念,而将两者混为一谈是商业测评市场中最常见的错误之一。
参照群体效应。 "我工作努力"这句话是相对于一个隐含的比较群体来评定的,而这个群体因人而异、因文化而异。这使得跨文化比较自陈报告的原始均值变得不可靠,而这种不可靠很容易被忽视,也很难纠正。
作答当下的情绪。 当下的情绪会系统性地影响回顾性的判断。对于一个理应稳定的构念,单次测量的分数所包含的状态方差,比特质框架所暗示的要多。
反应风格。 默许倾向——无论内容如何都倾向于同意——以及极端反应,在个体之间和文化之间都存在差异。构建良好的量表会用反向措辞的题目来缓解这个问题,但这也会带来自身的问题:混合措辞的量表经常会产生一个虚假的第二因子,反映的是措辞方式而非内容本身。
如何在了解这些之后解读自己的结果
把一个自陈分数当作对"你如何看待自己"的一份结构良好的说明,它确实具有信息价值,但这与"你实际上是怎样的"并不是一回事。
这两者之间的差距,往往是最有意思的部分。当一个分数让你感到意外时,值得深思的问题不是"这个测试是不是错了",而是你身边的人会更认同这两种解读——你自己的还是测评工具的——中的哪一种。
这也是一份问卷能够提供的诚实的极限,也是一个很好的理由,把任何单一分数当作一项输入,而不是一个定论。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。