noesisnoesis
测量如何运作

什么是心理测量学?

研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。

心理测量学是心理学中关注测量本身的分支。它关心的不是外向性意味着什么,而是一组给定的题目是否真的测量了外向性、由此产生的数字中含有多少误差,以及这个数字究竟能够预测什么。

这个区别比听起来更重要。任何人都可以写二十道关于一个人有多外向的问题,然后把答案加起来。心理测量学做的是之后的工作:证明这二十道题彼此关联,证明它们测量的是一件事而非三件事,证明同一个人下个月的得分大致相同,证明这个分数与这个人实际的行为相关,并证明整套方法对里斯本一个22岁的人和慕尼黑一个55岁的人同样适用。

为什么需要这样一门学科

物理测量拥有心理学所没有的一个优势:你可以把一把米尺放在你要测量的东西旁边。尽责性没有对应的米尺。这个特质无法被直接观察——它是从行为中推断出来的,而问卷作答则是在这层推断之上又叠加的一层推断。

这正是心理测量学家所说的潜变量:一种真实到足以产生后果、却只能通过间接指标触及的东西。整套方法论体系的存在,正是因为这种间接性。你将会遇到的每一种技术——因子分析、信度系数、项目反应理论、常模样本——都是在试图对一个没有人能够直接观察到的量,给出站得住脚的说明。

三个问题

抛开专业术语,心理测量学对任何一个测评工具都会问三件事。

它是否一致? 如果测量结果主要是噪音,那其他一切都无关紧要了。一致性会在题目之间(这些问题是否彼此一致?)、时间上(同一个人下个月的得分是否相同?),以及在相关的情况下评分者之间进行检验。这就是信度。

它是否测量了它所声称的东西? 一份问卷可以完全一致,却依然测量了错误的东西。一个声称测量领导力潜力、却与单纯的自尊心相关高达0.8的量表,测量的其实是自尊心。这就是效度,它不是一个测评工具"有"或"没有"的属性,而是一个由累积证据构建起来的论证。

相对于谁? 一个34分的原始分数本身没有任何意义。只有对照一个参照群体,它才变得可解释:34分相对于哪个群体、在什么时候测得、在哪里测得,才算高?这是常模的工作,也是大多数消费级测试完全跳过的一步。

好的实践是什么样的

一个构建良好的测评工具会留下完整的文档记录。有人发表过题目是如何编写的、哪些被舍弃了。有人报告过在具名样本、具体样本量下的信度系数。有人在第二个独立样本中——而非最初用来构建它的那个样本中——检验过因子结构是否成立。有人检验过题目在不同语言和年龄群体中的表现是否一致。还有其他人——最好与该测评工具没有利益关系——尝试过复现这些发现,并报告了结果。

这些都不能使一个测试变得完美无缺。但它们能让这个测试的局限变得可知,而这是一个不同、也更有用的属性。一个测量误差被公开记录的测评工具,能告诉你两个分数之间的微小差异可以信任到什么程度。一个没有公开误差估计的测评工具,并不因此更精确;它只是对自己的不精确保持了沉默。

留给读者的结论

心理测量学不会告诉你一个测试是"真实的"。它会告诉你一个分数在失去意义之前能被推到多远——它能回答哪些问题,它是在哪些人群中校准的,以及一个差异要大到什么程度才值得注意。

这是一个比大多数人格产品所做出的承诺都要谦逊的承诺。但它也是唯一一个经得起证据检验的承诺。

付諸实测

阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。

继续阅读