noesisnoesis
测量如何运作

当一项测试能够"预测"某些事物时意味着什么

0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。

人格研究报告称尽责性能预测工作绩效。读到这句话时,大多数人脑海中浮现的东西,比数据实际显示的要强得多。统计学意义上的说法与"预测"一词日常含义之间的差距,正是心理测评被误用的地方。

涉及的数字

人格研究中的效应量通常以相关系数的形式报告。对于已确立的关系,元分析数值往往落在0.20到0.35之间。尽责性与工作绩效之间大约是0.20到0.25。工作满意度与工作绩效之间大约是0.30。一般心理能力——该领域中最强的单一预测因子——对于复杂工作的预测大约能达到0.50。

将相关系数平方,就得到了被解释的方差比例。0.25的相关系数解释了人与人之间大约6%的差异。剩下的94%来自别的东西:能力、机会、培训、管理、健康、运气。

为什么0.25依然是一个真实的发现

在人群规模上,小的相关系数会产生可观的总体效应。如果你要从一千人中进行选拔,一个相关系数为0.25的预测指标,能够可测量地、反复地改善你的平均结果。保险公司和流行病学家整个行业都建立在这种规模的效应之上。

问题在于,总体收益和个体预测是不同的量。0.25的相关系数意味着:在得分高的人当中,表现好的人比例更高——这也同时意味着,有相当多得分高的人表现不好,也有相当多得分低的人表现优异。这两个说法来自同一个数字。

个体案例

这正是经常被忽略的一步。相关系数描述的是两个分布之间的关系。它并不能用来对某个具体的人下判断。

如果尽责性与绩效的相关是0.25,那么知道某人的尽责性得分,只能把他绩效的合理范围稍稍收窄。对单个个体而言,预测区间仍然宽到几乎涵盖了整个结果范围。得知你在尽责性上处于第80百分位,对你在某个具体工作中会表现如何几乎没有什么说明力。

这就是为什么即便底层研究是可靠的,把人格分数作为主要的选拔筛选标准,依然缺乏充分的证据支持。这些研究支持的说法是:这个特质有影响。它们不支持的说法是:一个分数能告诉你一个应聘者会做什么。

另外两点提醒

预测和导致是两回事。 几乎所有这类文献都是相关性研究。尽责性能预测健康结果,这与"尽责性导致更好的健康行为"、"某个第三因素同时导致了这两者"以及"反向因果"这三种解释都是相符的。纵向设计能缩小可能性的范围;但很少能彻底排除它们。

自陈式效标会夸大数字。 当预测变量和结果变量都是由同一个人在同一个下午自我报告时,共同方法偏差会推高相关系数。使用客观结果或知情人评价的研究,通常报告的效应更小,而这些才是更应该被重视的研究。

一个分数真正的用处

把一个测试分数当作描述而非预言来读,它是真正有用的。它告诉你,在一个有据可查的重要特质上,你相对于一个参照人群处于什么位置,也为你可能已经注意到、却说不出名字的一种模式提供了词汇。

这本身就有价值。但它是一种不同于预测的东西,而这个区分应该由一份诚实的报告替你说清楚,而不是留给你自己去推测。

付諸实测

阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。

继续阅读

当一项测试能够"预测"某些事物时意味着什么 | NOESIS