测量标准误:您的得分可能偏差多少
每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
测量标准误把一个抽象的信度系数转化为具体可用的东西:一个围绕分数的正负区间。它回答了大多数结果页面都没有回答的问题——如果我换一个下午参加测试,这个分数可能会有多大的不同?
计算公式很简单。用量表的标准差乘以1减去其信度后的平方根。对于一个标准差为10、信度为0.85的量表,测量标准误约为3.9分。
这个区间实际覆盖的范围
大约三分之二的情况下,一个人的真实水平会落在其观测分数正负一个标准误的范围内。要达到约95%的置信度,则需要正负大约两个标准误。
以上面的例子为例。有人得了62分。95%的区间大约从54分到70分。这是一个16分的窗口,而在这个量表上,"平均水平"和"明显高于平均水平"之间的典型差距可能只有10分。
这不是那个特定测试的缺陷。0.85的信度已经相当不错了。这是心理测量的正常精度水平,也是为什么审慎的报告会呈现区间而非单一数值的原因。
人们容易忽视的后果
量表之间的微小差异通常没有意义。 如果你的外向性得分是58,开放性得分是54,诚实的解读是:这两者其实无法区分开来。那些从四分的差距中构建叙事的剖面解读,其实是在解读噪音。
随时间的微小变化通常也没有意义。 重新参加测试后移动了5分,对大多数测评工具来说都在误差范围之内。真正的特质变化会在数年间发生,表现为明显超出误差范围的移动,而不是月度间几分的波动。
排序会放大这个问题。 几分的原始分差异,可能在分布密集的中段让一个人移动十个百分位名次,因为大多数人恰恰都聚集在那里。百分位排名看起来很精确,实际上却是表达分数最不稳定的方式。
精度在量表上并非均匀分布。 经典测验理论假定每个分数都有同一个误差值,这是一种简化。项目反应理论会在特质的每个水平上分别估计误差,而且误差几乎总是在两端更大——恰恰是在那些解读最具后果性的地方。一个非常高或非常低的分数,通常比一个中等分数的精度更低,而不是更高。
为什么诚实的报告看起来不那么令人印象深刻
一个报告置信区间的测评工具,看起来比一个精确到小数点后一位、只报告单一数字的工具更"模糊"。而更模糊的那个才是在说实话。那个看起来精确的工具,其实存在同样的底层误差,只是选择不展示出来。
在将一个有科学文献支持的测试与一个把你归入某个类别的商业产品进行比较时,这一点值得牢记。类别的边界设在某个具体分数上,而恰好在这个边界一分之下和一分之上的两个人,在统计上其实是同一个人。类型标签完全掩盖了这一点——这也是反对基于类型的测评工具的较有力论据之一,也是为什么带有明确误差说明的连续分数是研究领域的标准做法。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。