什么是Cronbach's α系数,以及它不是什么
心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
克隆巴赫α系数(Cronbach's alpha)是一种内部一致性系数:衡量一个量表中各题目之间相互关联的程度。它发表于1951年,是被报告次数最多的单一心理测量学统计量,而它的普及程度已经超出了它实际的有用程度。
α系数的取值范围从0到1,受两个因素驱动:题目之间的平均相关性,以及题目的数量。第二个依赖关系正是大多数误解的根源。
高α系数不代表什么
它不代表该量表测量的是同一件事。 这是最常见的错误。即使一个量表存在两三个不同的因子,只要题目整体上相关程度足够高,α系数依然可以很高。单维性必须通过因子分析来确立;α系数无法确立这一点,也从来不是为此而设计的。
它不代表该量表是有效的。 α系数完全没有说明这些题目测量的是什么。二十道关于鞋码的问题,会有极佳的内部一致性,但作为任何心理学指标的效度为零。
它不代表该量表是好的。 因为α系数会随题目数量增加而上升,一个由平庸题目组成的长量表,会在得分上超过一个由优秀题目组成的短量表。一个由四十道题组成、题目间平均相关仅为0.2的量表,其α系数会超过0.90。
非常高的α系数往往是一个警讯。 当α系数超过大约0.95时,这些题目通常几乎是彼此的同义改写。这换来了一致性,代价却是构念覆盖度:该量表对某个狭窄的方面测量得非常精确,却遗漏了构念的其余部分。这被称为衰减悖论,也是为什么一致性并非越高越好的原因。
它的前提假设
α系数是在一个特定假设——即"τ等值"(tau-equivalence,意味着每道题目对底层特质的贡献都相等)——下对信度的一个下界估计。真实的量表几乎从不满足这个假设。题目在因子上的负荷强度各不相同,而当出现这种情况时,α系数会低估真实的信度。
麦克唐纳ω系数(McDonald's omega)放弃了"贡献相等"这一假设,直接根据实际的因子负荷来估计信度。方法学家已经推荐用它取代α系数长达二十年之久。但报告实践的跟进却很缓慢,很大程度上是因为α系数是每个统计软件包里的一行代码,而ω系数则不是。
在实践中如何解读
大致的经验法则是:0.70及以上适用于比较组别的研究,0.80及以上适用于应用场景,0.90及以上适用于分数会影响个人决策的场景。应把这些数字当作方向性参考,而非硬性门槛——所需的水平完全取决于这个分数所服务的决策的重要程度。
更有信息价值的数字通常在同一篇论文的其他地方。题目间平均相关系数(0.15到0.50是一个健康的范围)能告诉你高α系数是来自题目质量还是题目数量。题目数量本身则从另一个角度告诉你同样的信息。重测信度能告诉你α系数在结构上无法告诉你的事情:这个分数在同一个人身上随时间是否稳定。
一个只报告α系数的量表,报告的是所有信度指标中最容易获得、也是最不严苛的一个。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。