什么是心理测试中的信度?
信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
信度是指一次测量是可重复的、而非噪音的程度。如果你在一分钟内称了三次体重,结果分别是71、78和66公斤,那这台秤就是不可靠的——而且你也无法从中得知自己真实的体重。心理测量面临着同样的问题,而且所用的"仪器"远没有那么精确。
理解信度时最关键的一点,是它不主张什么。一台一直显示"重八公斤"的浴室秤是完全可靠的,却是完全错误的。信度关乎一致性;这个数字是否表示了正确的东西,是一个独立的问题,叫作效度。信度是效度的必要条件,但远远不是充分条件。
信度的几种形式
内部一致性问的是量表中的题目是否彼此一致。如果十道题都应该测量同一个底层特质,那么在其中一题得分高的人,在其他题目上也应该倾向于得分高。这通常以克隆巴赫α系数报告,或者更好的做法是麦克唐纳ω系数。
重测信度问的是同一个人在两次不同场合下的得分是否相似。对于特质——按定义就应该是稳定的——而言,这是最重要的一种信度形式。它也是最经常被忽略不报告的一种,因为这需要在数周之后重新找到同一批参与者。
评分者间信度适用于由人来评分的测评工具——临床访谈、投射技术、行为观察。它问的是两位受过训练的评分者在看同一份材料时,是否会得出相同的结论。
平行版本信度问的是同一测试的两个不同版本——设计上应该是等效的——是否产生相同的分数。在一个测试被多次施测、题目暴露成为顾虑的场合,这一点很重要。
如何解读这些数字
信度系数的取值范围从0到1。相关的经验法则较为粗略,也经常被误用,但大致而言:在分数会影响个人生活的场合需要0.90以上,0.80到0.90对大多数应用场景来说是可靠的,0.70到0.80对研究和组间比较是可接受的,而低于0.70则意味着这个分数所含的噪音,已经超出了大多数结论能够承受的程度。
关于这些阈值有两点需要提醒。第一,它们是经验法则,不是铁律——可接受的水平完全取决于这个分数将被用于什么目的。第二,一个短量表上非常高的α系数,通常表明这些题目几乎是彼此的同义改写,这换来了一致性,代价却是对构念覆盖不足。一个由十道题组成、全都在用略有不同的措辞问"你有条理吗?"的量表,会有极佳的内部一致性,却对尽责性的理解十分狭窄。
这对你自己的分数意味着什么
信度直接转化为一个单一数字值得被信任的程度。一个信度为0.85的测试,其测量误差大到足以让两个人之间几分的差异,或者你今天的分数和上个月的分数之间几分的差异,很可能只是噪音而非真实信号。
这带来了一个实际的启示:一个好的测评工具会报告其信度,让你知道你的分数周围的不确定性有多大。这种不确定性的技术表达方式,就是测量标准误,它把一个信度系数转化为一个围绕分数的正负区间。
一个完全不报告信度数字的测评工具,并不会因此更精确。它只是没有告诉你它有多不精确。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。