什么是心理测量学?
研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
心理测量学是心理学中关注测量本身的分支。它关心的不是外向性意味着什么,而是一组给定的题目是否真的测量了外向性、由此产生的数字中含有多少误差,以及这个数字究竟能够预测什么。
这个区别比听起来更重要。任何人都可以写二十道关于一个人有多外向的问题,然后把答案加起来。心理测量学做的是之后的工作:证明这二十道题彼此关联,证明它们测量的是一件事而非三件事,证明同一个人下个月的得分大致相同,证明这个分数与这个人实际的行为相关,并证明整套方法对里斯本一个22岁的人和慕尼黑一个55岁的人同样适用。
为什么需要这样一门学科
物理测量拥有心理学所没有的一个优势:你可以把一把米尺放在你要测量的东西旁边。尽责性没有对应的米尺。这个特质无法被直接观察——它是从行为中推断出来的,而问卷作答则是在这层推断之上又叠加的一层推断。
这正是心理测量学家所说的潜变量:一种真实到足以产生后果、却只能通过间接指标触及的东西。整套方法论体系的存在,正是因为这种间接性。你将会遇到的每一种技术——因子分析、信度系数、项目反应理论、常模样本——都是在试图对一个没有人能够直接观察到的量,给出站得住脚的说明。
三个问题
抛开专业术语,心理测量学对任何一个测评工具都会问三件事。
它是否一致? 如果测量结果主要是噪音,那其他一切都无关紧要了。一致性会在题目之间(这些问题是否彼此一致?)、时间上(同一个人下个月的得分是否相同?),以及在相关的情况下评分者之间进行检验。这就是信度。
它是否测量了它所声称的东西? 一份问卷可以完全一致,却依然测量了错误的东西。一个声称测量领导力潜力、却与单纯的自尊心相关高达0.8的量表,测量的其实是自尊心。这就是效度,它不是一个测评工具"有"或"没有"的属性,而是一个由累积证据构建起来的论证。
相对于谁? 一个34分的原始分数本身没有任何意义。只有对照一个参照群体,它才变得可解释:34分相对于哪个群体、在什么时候测得、在哪里测得,才算高?这是常模的工作,也是大多数消费级测试完全跳过的一步。
好的实践是什么样的
一个构建良好的测评工具会留下完整的文档记录。有人发表过题目是如何编写的、哪些被舍弃了。有人报告过在具名样本、具体样本量下的信度系数。有人在第二个独立样本中——而非最初用来构建它的那个样本中——检验过因子结构是否成立。有人检验过题目在不同语言和年龄群体中的表现是否一致。还有其他人——最好与该测评工具没有利益关系——尝试过复现这些发现,并报告了结果。
这些都不能使一个测试变得完美无缺。但它们能让这个测试的局限变得可知,而这是一个不同、也更有用的属性。一个测量误差被公开记录的测评工具,能告诉你两个分数之间的微小差异可以信任到什么程度。一个没有公开误差估计的测评工具,并不因此更精确;它只是对自己的不精确保持了沉默。
留给读者的结论
心理测量学不会告诉你一个测试是"真实的"。它会告诉你一个分数在失去意义之前能被推到多远——它能回答哪些问题,它是在哪些人群中校准的,以及一个差异要大到什么程度才值得注意。
这是一个比大多数人格产品所做出的承诺都要谦逊的承诺。但它也是唯一一个经得起证据检验的承诺。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。