心理测量工具是如何构建的
从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
一个能够公开发表的心理测量工具,通常经历了五到六年的工作,其中大部分最初写出来的内容都被舍弃了。这个流程值得了解,因为它的每个阶段都对应着一种测试可能存在的不足。
1. 定义构念
在编写任何题目之前,必须把构念界定得足够精确,能够说清楚哪些内容不属于它。这意味着需要一个定义、一个维度结构的说明——是单一维度还是多个维度,如果是多个维度,它们之间是什么关系——以及一份明确的说明,指出它意在与哪些相邻构念区分开来。
跳过这一阶段是大多数冗余测评工具产生的根源。凭直觉对某个概念的理解而编制的量表,往往最终测量的是一个已有的特质,只是换了个新名字。
2. 生成题目库
题目的起草数量会远远超过最终能保留下来的数量——通常是最终数量的三到五倍。这些题目来自理论、来自已有的测评工具、来自对有相关经历的人的访谈,也来自学科专家。
在这个阶段,题目库会被审查内容覆盖度(是否涵盖了整个构念,还是集中在某一个方面?)、阅读难度、是否存在一题多问的情况,以及是否有题目实际上在问别的东西。
3. 试测与淘汰
题目库会被提交给第一批样本。这一阶段的分析主要是淘汰性质的。
方差几乎为零的题目会被淘汰——一个所有人回答都一样的问题无法区分任何人。与总分相关性差的题目会被淘汰。在多个因子上都有负荷的题目会被淘汰。因为与特质无关的原因而在不同人口群体间表现不同的题目——即差异性题目功能——也会被淘汰,而这项检验是最常被跳过的检验之一。
最终保留下来的通常只有最初编写题目的三分之一。
4. 在新样本中确认结构
这是区分严肃测评工具与其他工具的一步。对开发样本做因子分析,一定会恢复出设计时预设的结构——因为题目本来就是为了产生这个结构而挑选出来的。真正的检验是在一个独立样本中进行的验证性因子分析。
相当多已发表的量表,其预设结构只在用于构建它们的数据中才能被恢复出来。当其他人收集新数据时,这些因子就不再出现。这种失败足够普遍,以至于"该结构是否在独立样本中得到过确认?"成为评估任何测评工具时最有效的问题之一。
5. 积累效度证据
与同一构念的已确立测量方式的相关性。与理应有所区别的构念之间的相关性,而后者最好更低。与重要结果的关系。相对于已有工具的增量效度。在适合该构念的时间间隔上的重测稳定性。
这个阶段永远不会结束。只要这个测评工具还在使用,它就会持续下去,而且往往正是在发表多年之后,测评工具才被发现存在不足。
6. 建立常模
一个规模足够大、代表性足够强、适用于目标人群的参照样本,在特质随年龄或性别变化的情况下按此分层,并注明年份和国家。之后需要定期重新进行,因为常模会随时间漂移。
7. 翻译(如果要用于其他地区)
翻译不是一项语言练习。恰当的本地化改编意味着正向翻译、独立的回译、专家审查、与目标语言使用者的认知访谈,然后在新语言中开展一项全新的心理测量学研究,以检验其结构是否成立、题目功能是否等价。一个未经过这项研究就翻译出来的测评工具,无论其原版有多少资历,在这门语言中都是一个未经检验的工具。
这对"快速测验"意味着什么
一个下午写出来的测试,只完成了第二步。它很可能会产生一个看似合理的结果,一个百分位数和一段描述性文字。而它跳过的那些步骤,本来是用来确认这一切是否真的有意义的。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。