聚合效度和区分效度
两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
聚合效度和区分效度是同一要求的两个方面。一个测量工具必须与理论上应该相关的事物相关,也必须不与其声称有所区别的事物过度相关。满足其一而不满足其二不是部分成功;这通常表明该构念并非其所声称的那样。
聚合效度
聚合证据表明,一个测量工具与同一事物的其他指标一致。一个新的焦虑量表应该与已建立的焦虑量表、临床评定,以及理想情况下与非问卷形式的指标(如生理测量或观察到的回避行为)有显著相关。
此处的相关系数通常预期在0.50以上,当比较工具是针对同一构念的成熟工具时,往往在0.70以上。低于此值,要么新量表要么比较量表测量的是其他东西。
有一个陷阱。与现有量表0.95的相关系数不是胜利,而是说明新工具只是重新包装,真正的问题变成了它增加了什么。聚合效度是一个下限,而非最大化的目标。
区分效度
区分证据表明,该测量工具与其声称不同的构念保持分离。这是有趣的失败案例所在。
这种模式在文献中反复出现。坚毅(Grit)与尽责性的相关约为0.84,接近到元分析发现,一旦控制了尽责性,它几乎不增加对学业表现的预测。自我报告的情绪智力与情绪稳定性、外向性和尽责性的组合高度重叠。黑暗三联征之间的共享方差在考虑了HEXACO模型中的诚实-谦逊维度后基本消失。在每种情况下,该构念都被呈现为新领域,结果却是已有地图上被重新命名的区域。
区分效度也是方法效应浮现的地方。如果一项研究中每个自我报告的构念与其他每个构念都相关0.4,那么共同因素可能是被试的反应风格,而非任何共享的心理特征。
决定性的检验
决定性的程序是增量效度:先将已建立的测量工具纳入回归模型,然后纳入新的,看新工具是否解释了结果中的任何额外方差。如果没有,该构念可能在理论上仍然有趣,但该工具并未测量该领域尚未拥有的任何东西。
这是一个严格的标准,许多已发表的量表从未接受过这样的检验。当它们接受检验时,结果往往就是上述的冗余发现。这不是丑闻,而是正常的科学修剪,但这确实意味着一个构念的流行程度并不能说明它是否通过了检验。
对读者意味着什么
当一个测试报告多个得分时,有用的问题是这些得分是否真正不同。四个相关0.8的维度实际上是一个带有四个标签的维度,由此构建的剖面看起来有差异化,但几乎不携带独立信息。
报告了量表间相关的工具让你可以自行检查。那些呈现四象限类型却从不展示象限之间关系的工具,已经使这种检查变得不可能,而这通常就是目的。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。