noesisnoesis
测量如何运作

测量标准误:您的得分可能偏差多少

每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。

测量标准误把一个抽象的信度系数转化为具体可用的东西:一个围绕分数的正负区间。它回答了大多数结果页面都没有回答的问题——如果我换一个下午参加测试,这个分数可能会有多大的不同?

计算公式很简单。用量表的标准差乘以1减去其信度后的平方根。对于一个标准差为10、信度为0.85的量表,测量标准误约为3.9分。

这个区间实际覆盖的范围

大约三分之二的情况下,一个人的真实水平会落在其观测分数正负一个标准误的范围内。要达到约95%的置信度,则需要正负大约两个标准误。

以上面的例子为例。有人得了62分。95%的区间大约从54分到70分。这是一个16分的窗口,而在这个量表上,"平均水平"和"明显高于平均水平"之间的典型差距可能只有10分。

这不是那个特定测试的缺陷。0.85的信度已经相当不错了。这是心理测量的正常精度水平,也是为什么审慎的报告会呈现区间而非单一数值的原因。

人们容易忽视的后果

量表之间的微小差异通常没有意义。 如果你的外向性得分是58,开放性得分是54,诚实的解读是:这两者其实无法区分开来。那些从四分的差距中构建叙事的剖面解读,其实是在解读噪音。

随时间的微小变化通常也没有意义。 重新参加测试后移动了5分,对大多数测评工具来说都在误差范围之内。真正的特质变化会在数年间发生,表现为明显超出误差范围的移动,而不是月度间几分的波动。

排序会放大这个问题。 几分的原始分差异,可能在分布密集的中段让一个人移动十个百分位名次,因为大多数人恰恰都聚集在那里。百分位排名看起来很精确,实际上却是表达分数最不稳定的方式。

精度在量表上并非均匀分布。 经典测验理论假定每个分数都有同一个误差值,这是一种简化。项目反应理论会在特质的每个水平上分别估计误差,而且误差几乎总是在两端更大——恰恰是在那些解读最具后果性的地方。一个非常高或非常低的分数,通常比一个中等分数的精度更低,而不是更高。

为什么诚实的报告看起来不那么令人印象深刻

一个报告置信区间的测评工具,看起来比一个精确到小数点后一位、只报告单一数字的工具更"模糊"。而更模糊的那个才是在说实话。那个看起来精确的工具,其实存在同样的底层误差,只是选择不展示出来。

在将一个有科学文献支持的测试与一个把你归入某个类别的商业产品进行比较时,这一点值得牢记。类别的边界设在某个具体分数上,而恰好在这个边界一分之下和一分之上的两个人,在统计上其实是同一个人。类型标签完全掩盖了这一点——这也是反对基于类型的测评工具的较有力论据之一,也是为什么带有明确误差说明的连续分数是研究领域的标准做法。

付諸实测

阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。

继续阅读