noesisnoesis
测量如何运作

什么是心理测试中的信度?

信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。

信度是指一次测量是可重复的、而非噪音的程度。如果你在一分钟内称了三次体重,结果分别是71、78和66公斤,那这台秤就是不可靠的——而且你也无法从中得知自己真实的体重。心理测量面临着同样的问题,而且所用的"仪器"远没有那么精确。

理解信度时最关键的一点,是它不主张什么。一台一直显示"重八公斤"的浴室秤是完全可靠的,却是完全错误的。信度关乎一致性;这个数字是否表示了正确的东西,是一个独立的问题,叫作效度。信度是效度的必要条件,但远远不是充分条件。

信度的几种形式

内部一致性问的是量表中的题目是否彼此一致。如果十道题都应该测量同一个底层特质,那么在其中一题得分高的人,在其他题目上也应该倾向于得分高。这通常以克隆巴赫α系数报告,或者更好的做法是麦克唐纳ω系数。

重测信度问的是同一个人在两次不同场合下的得分是否相似。对于特质——按定义就应该是稳定的——而言,这是最重要的一种信度形式。它也是最经常被忽略不报告的一种,因为这需要在数周之后重新找到同一批参与者。

评分者间信度适用于由人来评分的测评工具——临床访谈、投射技术、行为观察。它问的是两位受过训练的评分者在看同一份材料时,是否会得出相同的结论。

平行版本信度问的是同一测试的两个不同版本——设计上应该是等效的——是否产生相同的分数。在一个测试被多次施测、题目暴露成为顾虑的场合,这一点很重要。

如何解读这些数字

信度系数的取值范围从0到1。相关的经验法则较为粗略,也经常被误用,但大致而言:在分数会影响个人生活的场合需要0.90以上,0.80到0.90对大多数应用场景来说是可靠的,0.70到0.80对研究和组间比较是可接受的,而低于0.70则意味着这个分数所含的噪音,已经超出了大多数结论能够承受的程度。

关于这些阈值有两点需要提醒。第一,它们是经验法则,不是铁律——可接受的水平完全取决于这个分数将被用于什么目的。第二,一个短量表上非常高的α系数,通常表明这些题目几乎是彼此的同义改写,这换来了一致性,代价却是对构念覆盖不足。一个由十道题组成、全都在用略有不同的措辞问"你有条理吗?"的量表,会有极佳的内部一致性,却对尽责性的理解十分狭窄。

这对你自己的分数意味着什么

信度直接转化为一个单一数字值得被信任的程度。一个信度为0.85的测试,其测量误差大到足以让两个人之间几分的差异,或者你今天的分数和上个月的分数之间几分的差异,很可能只是噪音而非真实信号。

这带来了一个实际的启示:一个好的测评工具会报告其信度,让你知道你的分数周围的不确定性有多大。这种不确定性的技术表达方式,就是测量标准误,它把一个信度系数转化为一个围绕分数的正负区间。

一个完全不报告信度数字的测评工具,并不会因此更精确。它只是没有告诉你它有多不精确。

付諸实测

阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。

继续阅读