为什么大多数网络人格测试不可靠
不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
一个网上的免费人格测试和一个经过验证的心理测量工具,产生的输出看起来一模一样:一个分数、一个百分位数、一段描述你的文字。区别完全在于结果页面上看不到的那些工作。
这一点值得说清楚,因为通常的说法——网络测试是骗局——大多是错误的,也没什么用。大多数测试的制作者并没有欺骗的意图。它们不可靠是出于结构性的原因。
通常被跳过的环节
题目分析。 在一个构建良好的量表中,大多数起草的题目在试测后都会被舍弃:没有人在其上产生差异的题目、与总分相关性差的题目、在多个因子上都有负荷的题目、在不同年龄或语言群体中表现不同的题目。一个没有经过试测就发布的测试,保留了所有题目,包括那些不起作用的。
独立的结构确认。 对用来构建量表的数据做因子分析,一定会恢复出你设计时预设的结构。在一个新样本中确认它是一项独立的研究,而这正是相当一部分量表失败的环节。
常模。 百分位数总得有个来源。如果网站没有说明其参照人群,那这个数字要么来自之前的访问者——一个构成情况未知的自选群体,要么根本没有任何具体依据。
重测数据。 要确认人们下个月的得分是否相同,需要重新找到这些人。几乎没有人这样做,这意味着"特质"这个词所暗示的稳定性,其实从未被证实过。
设计激励的方向不对
一个为了参与度而设计的测试,与一个为了准确性而设计的测试,优化的是不同的目标,而这两者会以可预测的方式渐行渐远。
讨喜的结果表现更好。一个告诉你不受欢迎的事情的结果,被分享的次数更少,所以结果会逐渐趋向于每个人都能在自己身上找到共鸣的描述。这就是巴纳姆效应,早在20世纪40年代就已被证实,此后一再被重复验证:人们会认为泛泛而谈的人格描述精确地契合了自己。
类型比维度表现更好。"你是建筑师型"比"你在开放性上处于第68百分位,置信区间较宽"更容易被分享。类型还会掩盖测量误差,因为一个在类别边界一分之差的人,会得到完全不同的标签。
简短比充分表现更好。每多一道题都会流失一些受测者,所以测试会被压缩到能最大化完成率的长度,而不是能充分覆盖构念的长度。
这些都不是谎言。它们只是针对准确性以外的其他指标做的优化。
三十秒左右的辨别方法
寻找一个有具名作者和年份的原始测评工具。寻找一个说明常模来自哪个人群的声明。寻找任何关于局限性或测量误差的说明。看看结果是一个连续分数还是一个类别。看看同一个页面是否还承诺仅凭二十道题就能识别你理想的职业、伴侣或人生目标。
一个注明了其所实现的测评工具、引用了来源、说明了常模、并说明了它无法确定什么的测试,是下了功夫的。一个什么都没做的测试,可能依然是消磨五分钟的愉快方式——但它产生的数字只是装饰。
NOESIS 目录中的每一个测评工具都注明了它实现的是哪个已发表的测试、由谁编写、哪一年编写、如何评分,以及其结果无法确定什么。最后这一点,正是最值得比较的内容。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。