什么是心理测试中的效度?
效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
效度问的是一个测试是否测量了它声称要测量的东西,以及人们从其得分中得出的结论是否站得住脚。这是心理测量学中最核心的问题,也是最常被营销话术而非证据来回答的问题。
自20世纪80年代 Messick 的研究以来,现代的理解是:效度并不是一个测评工具固定不变的属性。它是针对特定用途对分数所做的某种解释的属性。同一份问卷可能在描述一个人的自我认知方面得到了良好的验证,却在用于决定是否录用这个人方面完全没有得到验证。说"这个测试是有效的"而不说明"对什么有效",并不是一个论断,而只是一句口号。
证据的种类
效度是由多种类型的证据积累而成的。较旧的教材把这些证据当作不同种类的效度分别呈现;目前的观点则把它们看作支持同一个论点的不同论据。
内容证据问的是题目是否恰当地覆盖了该构念。一个只询问睡眠和食欲的抑郁量表,覆盖了躯体症状,却遗漏了情绪和认知方面的症状。内容覆盖度通常由学科专家来判断,这也是为什么非常短的量表总是一种妥协。
内部结构证据问的是题目的分组是否符合理论所预测的方式。如果一个模型声称存在四个不同的方面,因子分析就应该在——关键是要在一个独立样本中,而不仅仅是量表编制所用的那个样本中——恢复出四个因子。相当多的测评工具能在开发样本中重现其预设的结构,却在任何其他人的样本中都无法做到。
与其他变量的关系是大部分工作所在之处。收敛证据表明该量表与理应相关的事物相关。区分证据表明它与理应有所区别的事物之间没有过高的相关——这是一个常被忽视的要求,也是让许多新贴标签的构念站不住脚的证据。效标证据表明该分数与某个重要的结果相关,无论是同时测量的还是提前预测的。
结果性证据问的是当这个测试被实际使用时会发生什么。如果一个测评工具因为与构念无关的原因系统性地使某个群体处于不利地位,那不仅仅是一个伦理问题,也是一个效度问题。
揭穿大多数效度说法的问题
对效度说法最严苛的检验是增量效度:这个测评工具是否比一个更便宜、更成熟、已经确立的测量方式提供了额外的信息?
相当多贴了新标签的构念在这一关就败下阵来。它们与已有的大五人格维度相关高达0.7甚至更高,以同样的幅度预测相同的结果,而一旦对旧的测量方式做统计控制后,就再没有增添任何东西。构念是新的,测量却不是。这也是为什么严肃的测评文档中的"批评"部分,讨论的往往是冗余问题而非不准确问题。
该关注什么
当有人声称一个测试"已经过验证"时,有用的问题都是具体的:针对什么效标进行了验证?在多大规模的哪个群体中?因子结构是否在一个独立样本中得到了确认?是否有来自与结果无商业利益关系的研究者发表的证据?它是否比一个已确立的替代方案增添了什么?
一个对这些问题给出诚实答案的测评工具,值得被认真对待,哪怕存在局限性。而一个仅凭一个推荐语页面、声称已有数百万人做过测试来"验证"自己的测评工具,其实回答的是一个完全不同的问题——受欢迎程度不是证据,做过某个测试的人数的多少,与其得分是否有意义毫无关系。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。