noesisnoesis
测量如何运作

什么是建构效度?

测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。

结构效度问的是一个测评工具是否测量了它所声称的理论构念本身,而不是与之相关的某种东西、比它更狭窄的某种东西,或者根本不是任何连贯的东西。这是效度证据中最深层的一种形式,也是需要数年而非一项研究才能确立的一种。

这个困难是结构性的。像韧性或情商这样的构念,并不是一个实体对象;它是关于行为规律性的一种提议。要证明一个量表测量了它,你必须同时捍卫两个主张:这个构念确实如所描述的那样存在,以及这些特定的题目触及到了它。这两个主张无法分开来看,这也是为什么克隆巴赫(Cronbach)和米尔(Meehl)在1955年提出这个概念时,将其框定为对一整个理论网络的检验,而不是对单一测评工具的检验。

论证是如何构建的

预测的相关模式。 理论说明了这个构念应该与哪些事物相关、相关程度多强。自我同情应该与生活满意度呈正相关,与抑郁呈负相关,与自尊心只呈中等程度的相关——如果它与自尊心的相关高达0.9,那它就不是一个独立的构念了。这些预测中的每一个都是可检验的主张,而任何一个的失败都具有信息价值。

预期的组间差异。 如果理论说某个特质会随年龄发展,或在临床人群中升高,那么该测评工具应该体现出这一点。如果理论所要求的差异没有被发现,这就是反对该测评工具、该理论,或两者皆有的证据。

对干预的反应。 如果一个构念应该是可训练的,那么分数应该在训练后发生变化,而在对照组中不应发生变化。一个对任何干预都没有反应的构念,很难与人为的统计假象区分开来。

内部结构。 因子结构应该与理论假设的结构相匹配——而且重要的是,要在一个新样本中匹配。对开发数据进行的探索性因子分析,一定会找到设计时预设的结构;用新数据进行的验证性分析,才是这个主张真正被检验的地方。

多特质多方法的思路

坎贝尔(Campbell)和菲斯克(Fiske)在1959年的贡献,是坚持结构效度需要同时满足两个条件:用不同方法测量同一特质应该得出一致的结果,而用同一方法测量不同特质则不应该一致。

第二个条件正是大多数测评工具遇到困难的地方。如果你的自陈共情得分与自陈宜人性得分相关0.7,而与他人评定的共情相关只有0.2,那么你的问卷所测量的最主要的东西,不是共情,而是你在问卷上描述自己的一般方式。方法方差是自陈式研究中最持久的问题之一,这也是为什么严谨的验证工作总是在寻找一个非问卷类的效标,只要存在这样的效标。

这在解读你的结果时为何重要

结构效度是分数与其解读之间的关键支撑。当一个经过良好验证的测评工具报告你在某个特质上得分较高时,这个论断背后的推理链条,包含了数十年的已发表工作——它们确立了这个特质作为一个连贯的量而存在、这些题目确实追踪了它,并且这个分数对做测试的不同人来说含义大致相似。

而当一个没有经过结构效度验证的测试报告同样的内容时,这个分数只是一个没有人检验过的算法生成的数字。两者在结果页面上看起来一模一样。区别完全在于文档记录,这也是为什么值得去寻找这些文档。

付諸实测

阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。

继续阅读

什么是建构效度? | NOESIS