筛查不等于诊断
筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。
抑郁筛查问卷、焦虑筛查量表、酒精使用筛查工具——这些都是现存验证最充分的测评工具之一,却也经常被误读。得分高于临界值并不意味着你患有该疾病。它从来就不是为此而设计的。
设计上的权衡
每一个筛查工具都在两种错误之间做权衡:漏掉真正患病的人,以及标记出实际没有患病的人。筛查工具被刻意调整为更倾向于第二种错误。在初级医疗中漏诊一例抑郁的代价很高;而一个假阳性的代价只是与临床医生的一次对话。
其后果是可以用算术推导出来的。一个敏感度为88%、特异度为85%的筛查工具听起来非常出色。将它应用于一个实际患病率为5%的人群,在每100个筛查结果为阳性的人中,大约有74人实际上并没有患病。这个测评工具的表现完全符合设计预期。但大多数阳性结果依然是假阳性。
这是基础率算术问题,也是为什么即便对于验证充分的测评工具,在低患病率场景下进行普遍筛查依然存在争议的原因。
什么是临界值
临界值是为了某个人群中的某个目的而选定的决策阈值,而不是一个天然的边界。传统的PHQ-9临界值10分,是在患病率相对较高的人群中推导出来的;应用到别处,表现会不同。个体参与者数据的元分析显示,该临界值的已发表准确性估计,因优化阈值的选择性报告而被系统性地夸大了。
对于某些测评工具,故意不设定统一的通用临界值。世界卫生组织的SRQ-20在数十个国家使用,其最佳阈值会因国家、语言和性别而有很大差异,以至于发布一个全球通用的数字,造成的伤害可能比交由本地验证来得更大。
诊断是另一套流程
诊断需要临床医生确认症状的存在及持续时间、其功能影响,并排除其他解释——包括医学状况、物质使用,以及表现相似的其他障碍。它会考量病史和情境。而一份问卷完全不做这些。它只是统计某个时间窗口内的自我报告症状频率。
两个人可能产生完全相同的分数,却对应着完全不同的临床情况,因为总分把若干种异质的症状压缩成了一个数字。这个分数是提示需要进一步了解的信号;进一步的了解才是诊断。
这个分数真正的用途
一个提示。 高分是与专业人士交谈的理由。这是其设计初衷,也确实是一个真正有价值的用途。
追踪变化。 这是一个被低估的功能。在治疗过程中反复测量,能显示某种方法是否有效,这比任何单一分数都更有信息价值。基于测量的照护正是建立在这一基础之上。
人群描述。 在研究和公共卫生领域,这些测评工具用于估计群体间的症状负担,这正是它们最擅长的用途。
解读自己的结果
如果你在一个筛查工具上得分超过了阈值,正确的解读是:这值得与合格的专业人士谈一谈。而不是:我患有这种疾病。
如果你的得分低于阈值,正确的解读是:这一次特定的筛查没有标记出任何异常。而不是:我没事。筛查工具会漏诊,这是权衡的另一半,而对于一个自我感觉不适的人来说,一个较低的分数并不能让人安心。
在NOESIS发布筛查类测评工具的地方,报告会说明已发表的阈值、注明来源,并明确表示该结果不是诊断。这种表述方式不是法律形式上的走过场;这正是这些测评工具自身对其用途的说明。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 一项测试被称为"经过验证"意味着什么?这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。