一项测试被称为"经过验证"意味着什么?
这个词不受监管,被未做任何验证工作的产品随意使用。以下是它真正有意义时的含义,以及区分两种情况的四个关键问题。
"经过科学验证"不是一个受保护的术语。没有人认证它,没有机构审核它,而且它出现在一些产品上,其全部证据基础只是很多人做过这些测试。了解它在被正确使用时的含义是值得的。
简短版本
一个经过验证的工具有已发表的记录,表明它测量什么、精确度如何、在哪些人群中适用,以及其得分可以合法用于什么目的。验证不是一份证书。它是一个证据体系,通常经过数年积累,通常包含限制该工具使用而非美化它的发现。
有记录的局限性的存在是较好的信号之一。真正的验证文献充满了这些:这个量表在青少年中表现不佳,那个层面无法复制,临界值取决于人群。一个只报告优势的产品没有发表其验证结果;它发表的是其营销材料。
四个关键问题
**来源出版物是什么?**一个经过验证的工具有一篇发表在同行评审期刊上的原始论文,有作者、年份,通常还有DOI。那篇论文报告了题目的开发方式和初始心理测量特性。如果没有人能说出论文名称,就没有验证可以讨论。
**结构是否被他人确认过?**开发团队会找回他们设计的结构。重要的是,一个独立的研究组,使用独立的数据,是否发现了相同的东西。这是你能问的最具信息量的问题,也是最常得不到回答的问题。
**常模基于哪个人群建立,何时建立?**得分是在参考分布中的位置。一个报告百分位数却不说明参考人群的工具,给了你一个没有分母的数字。
**它增加了什么?**相对于已建立的测量工具的增量效度。大量的品牌化构念在这里失败,与已有特质的相关性如此之高,以至于它们不能解释任何额外的方差。这是科学审查的正常结果,除非有人做了这个检验,否则它是不可见的。
翻译带来的复杂性
一个在英语中经过验证的工具并不因此在德语中也经过验证。适当的跨文化适应需要正向和回译、专家评审、认知访谈,然后在新语言中进行全新的心理测量研究,检验因素结构是否成立,以及各题目在不同群体中的功能是否等价。
跳过这一步的工具很常见。一份原始验证无可挑剔的问卷,在某个关键题目带有不同含义的语言中可能表现得相当不同,而如果没有做过研究,就无从得知。当一个测试提供十种语言版本时,有用的问题是它是在十种语言中验证的,还是在一种语言中验证后翻译成了九种。
验证不能提供什么
它不能使得分确定。一个经过验证的工具仍然带有测量误差,仍然描述的是群体水平的规律而非个人的命运,仍然只测量其题目所能触及的范围。
验证提供的是可知的限度。你可以了解误差有多大、在哪个人群中、用于什么目的。这比"这个测试揭示了真实的你"是一个更小的声明,但它是唯一经得起考验的声明。
如果你想看看文档存在时是什么样子,NOESIS目录中的每个测试都标明了它所实施的工具、作者和年份、计分方法,以及背后的证据,包括有争议的部分。
付諸实测
阅读关於测量的文章是一件事,親眼看到自己的得分连同其来源、常模樣本与限制一起呈现则是另一件事。免费进行测验,无需註冊。
继续阅读
- 什么是心理测量学?研究心理测量是否可靠的学科——也是为什么问类似问题的两个测试,其结果价值可能天差地别的原因。
- 什么是心理测试中的信度?信度是测量的一致性,而非正确性。一个测试可以高度可靠但仍然测量了错误的东西——这就是为什么它是被问到的第一个问题,但绝不是最后一个。
- 什么是心理测试中的效度?效度不是测试拥有的属性。它是关于对特定得分的特定解释、在特定目的下是否站得住脚的论证——每一个新用途都必须重新构建。
- 什么是建构效度?测量中最难的问题:你测量的事物是否如你定义的那样存在,你的工具是否触及了它而非相邻的东西。
- 聚合效度和区分效度两个镜像要求:一项测量必须与其应该一致的内容一致,同时与其声称不是的东西保持区分。大多数薄弱的工具在第二点上失败。
- 什么是Cronbach's α系数,以及它不是什么心理测试中被引用最多、也最容易被误读的统计量。α系数并不能告诉你量表是单维的,而且高值往往是症状而非优点。
- 测量标准误:您的得分可能偏差多少每个得分都有误差范围,对于大多数心理测试来说,这个范围比人们想象的要宽。这个数字告诉你差异何时是真实的,何时只是噪音。
- 常模和百分位数:您的得分与什么比较原始得分本身无法解释。只有与参考群体对比才有意义——而使用了哪个群体,是任何测试中最关键却最少被披露的事实之一。
- 心理测量工具是如何构建的从建构定义到发布常模,这个过程需要数年时间,并淘汰了大部分投入。了解这些步骤后,哪些步骤被快速网络测验跳过了就一目了然。
- 为什么大多数网络人格测试不可靠不是因为它们不诚实,而是因为使测量值得信赖的步骤是不可见的、昂贵的且容易跳过的——而跳过这些步骤不会改变结果的外观。
- 自陈量表能测量什么和不能测量什么问卷要求你成为自己的观察者,这在某些方面比其他方面更有效。了解这种方法的优势和局限性,会改变你对任何结果的解读方式。
- 当一项测试能够"预测"某些事物时意味着什么0.30的相关系数在人格研究中是强发现,但在对个人做决定时是弱依据。两个陈述都是对的,而两者之间的差距导致了测试结果的大部分误用。
- 筛查不等于诊断筛查问卷的设计目标是尽可能多地捕捉可能的案例,以高假阳性率为代价。将筛查得分当作诊断来解读,恰恰颠倒了它的设计初衷。