常模和百分位数:您的得分与什么比较
原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
你在尽责性量表上得了34分。这算高吗?
这个问题在没有比较对象的情况下是无法回答的。34分是满分多少中的34分,相对于谁而言,又是在什么时候测得的?常模是把原始分数转化为可解释位置的参照数据,而如何选择常模,是测评工具编制中较为重大的决定之一。
转换是如何进行的
一个常模样本是一群在标准条件下完成该测评工具的人,他们的得分分布成为衡量的标尺。原始分数随后被表达为在该分布中的一个位置。
百分位数表示常模样本中得分等于或低于你的比例。第70百分位意味着该参照群体中有70%的人得分比你低。百分位数很直观,但有一个不太被重视的缺陷:它们会拉大分布中间密集区域的差异,同时压缩两端的差异。在均值附近,几分的原始分差异可能让你移动很多个百分位名次;而在顶端附近,同样几分的差异几乎不会带来任何变化。
标准分数——z分数、T分数、九分制标准分、智商式量表——以标准差为单位表示与均值的距离。它们保留了分数之间的实际间距,这也是为什么在涉及对结果进行运算时,人们更偏好使用标准分数。
为什么参照群体是关键所在
同样的原始分数,根据常模样本的不同,可能落在非常不同的百分位上。将尽责性得分与一般成年人群体对照,和与一群执业会计师样本对照,产生的百分位不会相同,而且两个数字都没有错——它们回答的是不同的问题。
这使得常模样本的几个特性值得了解。
样本中的人是谁。 心理学本科生这种便利样本仍然很常见,而他们只代表人类中很窄的一个切面:年轻、受过教育,而且不成比例地来自富裕的西方国家。基于他们建立的常模难以推广到其他人群。
样本规模有多大。 要在分布的尾部得到稳定的百分位估计,需要较大的样本量。只有几百人的样本,很难可靠地反映第95百分位是什么样子。
数据是何时采集的。 常模会随时间漂移。在一系列心理测量指标上,人群的均值在数十年间发生了可观测的变化,一个来自1995年的常模样本,已经无法准确描述2026年正在参加测试的人群了。
是否经过分层。 许多特质会随年龄和性别系统性地变化。寻求刺激的倾向随年龄增长而明显下降;时型偏好也会随人生阶段变化。将一个55岁的人与一个不分年龄的整体常模相比较,会在两个方向上都产生误导性的位置判断。
该关注什么,以及缺失这些信息意味着什么
一个记录完备的测评工具会说明其常模样本的规模、构成、国家和年份,并说明常模是否经过分层。严肃的测试手册会为此专门用几个章节来说明。
大多数免费的在线测试对此只字不提。它们给你一个百分位数,却不说明这个百分位数所指的是哪个群体。这个百分位数要么来自一个未说明的便利样本,要么借用自在不同人群中收集的已发表常模,要么来自之前做过该网站测试的人——这是一个构成情况连网站运营者自己都不清楚的自选样本。
这个百分位数依然会显示在屏幕上,看起来和真实的百分位数一模一样。真正能把两者区分开来的,只有伴随的文档说明,别无其他。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。