noesisnoesis
测量如何运作

聚合效度和区分效度

两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。

聚合效度和区分效度是同一要求的两个方面。一个测量工具必须与理论上应该相关的事物相关,也必须不与其声称有所区别的事物过度相关。满足其一而不满足其二不是部分成功;这通常表明该构念并非其所声称的那样。

聚合效度

聚合证据表明,一个测量工具与同一事物的其他指标一致。一个新的焦虑量表应该与已建立的焦虑量表、临床评定,以及理想情况下与非问卷形式的指标(如生理测量或观察到的回避行为)有显著相关。

此处的相关系数通常预期在0.50以上,当比较工具是针对同一构念的成熟工具时,往往在0.70以上。低于此值,要么新量表要么比较量表测量的是其他东西。

有一个陷阱。与现有量表0.95的相关系数不是胜利,而是说明新工具只是重新包装,真正的问题变成了它增加了什么。聚合效度是一个下限,而非最大化的目标。

区分效度

区分证据表明,该测量工具与其声称不同的构念保持分离。这是有趣的失败案例所在。

这种模式在文献中反复出现。坚毅(Grit)与尽责性的相关约为0.84,接近到元分析发现,一旦控制了尽责性,它几乎不增加对学业表现的预测。自我报告的情绪智力与情绪稳定性、外向性和尽责性的组合高度重叠。黑暗三联征之间的共享方差在考虑了HEXACO模型中的诚实-谦逊维度后基本消失。在每种情况下,该构念都被呈现为新领域,结果却是已有地图上被重新命名的区域。

区分效度也是方法效应浮现的地方。如果一项研究中每个自我报告的构念与其他每个构念都相关0.4,那么共同因素可能是被试的反应风格,而非任何共享的心理特征。

决定性的检验

决定性的程序是增量效度:先将已建立的测量工具纳入回归模型,然后纳入新的,看新工具是否解释了结果中的任何额外方差。如果没有,该构念可能在理论上仍然有趣,但该工具并未测量该领域尚未拥有的任何东西。

这是一个严格的标准,许多已发表的量表从未接受过这样的检验。当它们接受检验时,结果往往就是上述的冗余发现。这不是丑闻,而是正常的科学修剪,但这确实意味着一个构念的流行程度并不能说明它是否通过了检验。

对读者意味着什么

当一个测试报告多个得分时,有用的问题是这些得分是否真正不同。四个相关0.8的维度实际上是一个带有四个标签的维度,由此构建的剖面看起来有差异化,但几乎不携带独立信息。

报告了量表间相关的工具让你可以自行检查。那些呈现四象限类型却从不展示象限之间关系的工具,已经使这种检查变得不可能,而这通常就是目的。

付諸实测

阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。

继续阅读

聚合效度和区分效度 | NOESIS