什么是建构效度?
测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
结构效度问的是一个测评工具是否测量了它所声称的理论构念本身,而不是与之相关的某种东西、比它更狭窄的某种东西,或者根本不是任何连贯的东西。这是效度证据中最深层的一种形式,也是需要数年而非一项研究才能确立的一种。
这个困难是结构性的。像韧性或情商这样的构念,并不是一个实体对象;它是关于行为规律性的一种提议。要证明一个量表测量了它,你必须同时捍卫两个主张:这个构念确实如所描述的那样存在,以及这些特定的题目触及到了它。这两个主张无法分开来看,这也是为什么克隆巴赫(Cronbach)和米尔(Meehl)在1955年提出这个概念时,将其框定为对一整个理论网络的检验,而不是对单一测评工具的检验。
论证是如何构建的
预测的相关模式。 理论说明了这个构念应该与哪些事物相关、相关程度多强。自我同情应该与生活满意度呈正相关,与抑郁呈负相关,与自尊心只呈中等程度的相关——如果它与自尊心的相关高达0.9,那它就不是一个独立的构念了。这些预测中的每一个都是可检验的主张,而任何一个的失败都具有信息价值。
预期的组间差异。 如果理论说某个特质会随年龄发展,或在临床人群中升高,那么该测评工具应该体现出这一点。如果理论所要求的差异没有被发现,这就是反对该测评工具、该理论,或两者皆有的证据。
对干预的反应。 如果一个构念应该是可训练的,那么分数应该在训练后发生变化,而在对照组中不应发生变化。一个对任何干预都没有反应的构念,很难与人为的统计假象区分开来。
内部结构。 因子结构应该与理论假设的结构相匹配——而且重要的是,要在一个新样本中匹配。对开发数据进行的探索性因子分析,一定会找到设计时预设的结构;用新数据进行的验证性分析,才是这个主张真正被检验的地方。
多特质多方法的思路
坎贝尔(Campbell)和菲斯克(Fiske)在1959年的贡献,是坚持结构效度需要同时满足两个条件:用不同方法测量同一特质应该得出一致的结果,而用同一方法测量不同特质则不应该一致。
第二个条件正是大多数测评工具遇到困难的地方。如果你的自陈共情得分与自陈宜人性得分相关0.7,而与他人评定的共情相关只有0.2,那么你的问卷所测量的最主要的东西,不是共情,而是你在问卷上描述自己的一般方式。方法方差是自陈式研究中最持久的问题之一,这也是为什么严谨的验证工作总是在寻找一个非问卷类的效标,只要存在这样的效标。
这在解读你的结果时为何重要
结构效度是分数与其解读之间的关键支撑。当一个经过良好验证的测评工具报告你在某个特质上得分较高时,这个论断背后的推理链条,包含了数十年的已发表工作——它们确立了这个特质作为一个连贯的量而存在、这些题目确实追踪了它,并且这个分数对做测试的不同人来说含义大致相似。
而当一个没有经过结构效度验证的测试报告同样的内容时,这个分数只是一个没有人检验过的算法生成的数字。两者在结果页面上看起来一模一样。区别完全在于文档记录,这也是为什么值得去寻找这些文档。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。