noesisnoesis
测量如何运作

心理测量工具是如何构建的

从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。

一个能够公开发表的心理测量工具,通常经历了五到六年的工作,其中大部分最初写出来的内容都被舍弃了。这个流程值得了解,因为它的每个阶段都对应着一种测试可能存在的不足。

1. 定义构念

在编写任何题目之前,必须把构念界定得足够精确,能够说清楚哪些内容不属于它。这意味着需要一个定义、一个维度结构的说明——是单一维度还是多个维度,如果是多个维度,它们之间是什么关系——以及一份明确的说明,指出它意在与哪些相邻构念区分开来。

跳过这一阶段是大多数冗余测评工具产生的根源。凭直觉对某个概念的理解而编制的量表,往往最终测量的是一个已有的特质,只是换了个新名字。

2. 生成题目库

题目的起草数量会远远超过最终能保留下来的数量——通常是最终数量的三到五倍。这些题目来自理论、来自已有的测评工具、来自对有相关经历的人的访谈,也来自学科专家。

在这个阶段,题目库会被审查内容覆盖度(是否涵盖了整个构念,还是集中在某一个方面?)、阅读难度、是否存在一题多问的情况,以及是否有题目实际上在问别的东西。

3. 试测与淘汰

题目库会被提交给第一批样本。这一阶段的分析主要是淘汰性质的。

方差几乎为零的题目会被淘汰——一个所有人回答都一样的问题无法区分任何人。与总分相关性差的题目会被淘汰。在多个因子上都有负荷的题目会被淘汰。因为与特质无关的原因而在不同人口群体间表现不同的题目——即差异性题目功能——也会被淘汰,而这项检验是最常被跳过的检验之一。

最终保留下来的通常只有最初编写题目的三分之一。

4. 在新样本中确认结构

这是区分严肃测评工具与其他工具的一步。对开发样本做因子分析,一定会恢复出设计时预设的结构——因为题目本来就是为了产生这个结构而挑选出来的。真正的检验是在一个独立样本中进行的验证性因子分析。

相当多已发表的量表,其预设结构只在用于构建它们的数据中才能被恢复出来。当其他人收集新数据时,这些因子就不再出现。这种失败足够普遍,以至于"该结构是否在独立样本中得到过确认?"成为评估任何测评工具时最有效的问题之一。

5. 积累效度证据

与同一构念的已确立测量方式的相关性。与理应有所区别的构念之间的相关性,而后者最好更低。与重要结果的关系。相对于已有工具的增量效度。在适合该构念的时间间隔上的重测稳定性。

这个阶段永远不会结束。只要这个测评工具还在使用,它就会持续下去,而且往往正是在发表多年之后,测评工具才被发现存在不足。

6. 建立常模

一个规模足够大、代表性足够强、适用于目标人群的参照样本,在特质随年龄或性别变化的情况下按此分层,并注明年份和国家。之后需要定期重新进行,因为常模会随时间漂移。

7. 翻译(如果要用于其他地区)

翻译不是一项语言练习。恰当的本地化改编意味着正向翻译、独立的回译、专家审查、与目标语言使用者的认知访谈,然后在新语言中开展一项全新的心理测量学研究,以检验其结构是否成立、题目功能是否等价。一个未经过这项研究就翻译出来的测评工具,无论其原版有多少资历,在这门语言中都是一个未经检验的工具。

这对"快速测验"意味着什么

一个下午写出来的测试,只完成了第二步。它很可能会产生一个看似合理的结果,一个百分位数和一段描述性文字。而它跳过的那些步骤,本来是用来确认这一切是否真的有意义的。

付諸实测

阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。

继续阅读

心理测量工具是如何构建的 | NOESIS