当一项测试能够"预测"某些事物时意味着什么
0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
人格研究报告称尽责性能预测工作绩效。读到这句话时,大多数人脑海中浮现的东西,比数据实际显示的要强得多。统计学意义上的说法与"预测"一词日常含义之间的差距,正是心理测评被误用的地方。
涉及的数字
人格研究中的效应量通常以相关系数的形式报告。对于已确立的关系,元分析数值往往落在0.20到0.35之间。尽责性与工作绩效之间大约是0.20到0.25。工作满意度与工作绩效之间大约是0.30。一般心理能力——该领域中最强的单一预测因子——对于复杂工作的预测大约能达到0.50。
将相关系数平方,就得到了被解释的方差比例。0.25的相关系数解释了人与人之间大约6%的差异。剩下的94%来自别的东西:能力、机会、培训、管理、健康、运气。
为什么0.25依然是一个真实的发现
在人群规模上,小的相关系数会产生可观的总体效应。如果你要从一千人中进行选拔,一个相关系数为0.25的预测指标,能够可测量地、反复地改善你的平均结果。保险公司和流行病学家整个行业都建立在这种规模的效应之上。
问题在于,总体收益和个体预测是不同的量。0.25的相关系数意味着:在得分高的人当中,表现好的人比例更高——这也同时意味着,有相当多得分高的人表现不好,也有相当多得分低的人表现优异。这两个说法来自同一个数字。
个体案例
这正是经常被忽略的一步。相关系数描述的是两个分布之间的关系。它并不能用来对某个具体的人下判断。
如果尽责性与绩效的相关是0.25,那么知道某人的尽责性得分,只能把他绩效的合理范围稍稍收窄。对单个个体而言,预测区间仍然宽到几乎涵盖了整个结果范围。得知你在尽责性上处于第80百分位,对你在某个具体工作中会表现如何几乎没有什么说明力。
这就是为什么即便底层研究是可靠的,把人格分数作为主要的选拔筛选标准,依然缺乏充分的证据支持。这些研究支持的说法是:这个特质有影响。它们不支持的说法是:一个分数能告诉你一个应聘者会做什么。
另外两点提醒
预测和导致是两回事。 几乎所有这类文献都是相关性研究。尽责性能预测健康结果,这与"尽责性导致更好的健康行为"、"某个第三因素同时导致了这两者"以及"反向因果"这三种解释都是相符的。纵向设计能缩小可能性的范围;但很少能彻底排除它们。
自陈式效标会夸大数字。 当预测变量和结果变量都是由同一个人在同一个下午自我报告时,共同方法偏差会推高相关系数。使用客观结果或知情人评价的研究,通常报告的效应更小,而这些才是更应该被重视的研究。
一个分数真正的用处
把一个测试分数当作描述而非预言来读,它是真正有用的。它告诉你,在一个有据可查的重要特质上,你相对于一个参照人群处于什么位置,也为你可能已经注意到、却说不出名字的一种模式提供了词汇。
这本身就有价值。但它是一种不同于预测的东西,而这个区分应该由一份诚实的报告替你说清楚,而不是留给你自己去推测。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。