선별검사는 진단이 아닙니다
선별용 설문지는 가능한 많은 사례를 포착하도록 설계되며, 그 대가로 높은 위양성률을 받아들입니다. 선별 점수를 진단으로 해석하는 것은 그것이 설계된 목적을 정반대로 뒤집는 일입니다.
우울증 선별 설문지, 불안 선별검사, 알코올 사용 선별검사. 이들은 현존하는 가장 잘 타당화된 검사도구들이지만, 일상적으로 잘못 해석되고 있습니다. 절단점 이상의 점수가 나왔다는 것이 그 상태를 가지고 있다는 의미는 아닙니다. 원래 그런 목적으로 설계된 것이 아닙니다.
설계상의 절충
모든 선별 도구는 두 가지 오류 사이의 절충점에 놓여 있습니다: 해당 상태를 가진 사람을 놓치는 것과, 가지지 않은 사람을 표시하는 것. 선별 도구는 의도적으로 두 번째 방향으로 조정되어 있습니다. 1차 진료에서 우울증 사례를 놓치는 것은 비용이 크지만, 거짓 양성은 임상가와의 대화 한 번의 비용만 발생시킵니다.
그 결과는 산술적으로 따라옵니다. 민감도 88퍼센트, 특이도 85퍼센트인 선별검사는 우수하게 들립니다. 실제로 해당 상태를 가진 사람이 5퍼센트인 인구집단에 이를 적용하면, 양성으로 나온 100명 중 약 74명은 그 상태를 가지고 있지 않습니다. 이 도구는 명시된 대로 정확히 작동하고 있는 것입니다. 그럼에도 대부분의 양성은 여전히 거짓 양성입니다.
이것이 기저율의 산술이며, 잘 타당화된 검사도구라 할지라도 저유병률 환경에서의 전면적 선별이 논쟁이 되는 이유입니다.
절단점이란 무엇인가
절단점은 특정 인구집단 내에서 특정 목적을 위해 선택된 결정 임계값이며, 자연적인 경계가 아닙니다. PHQ-9의 관행적 절단점인 10점은 상대적으로 유병률이 높은 인구집단에서 도출되었습니다. 다른 곳에 적용하면 다르게 작동합니다. 개인 참여자 수준의 메타분석에 따르면, 그 절단점에 대해 발표된 정확도 추정치는 최적화된 임계값을 선택적으로 보고함으로써 체계적으로 과대평가되었습니다.
일부 검사도구의 경우 의도적으로 전세계 공통 절단점이 전혀 존재하지 않습니다. 세계보건기구의 SRQ-20은 수십 개국에서 사용되며, 그 최적 임계값은 국가, 언어, 성별에 따라 상당히 달라지므로, 하나의 전세계 공통 수치를 발표하는 것은 지역별 타당화에 맡겨두는 것보다 더 해로울 것입니다.
진단은 다른 절차입니다
진단에는 임상가가 증상의 존재와 기간, 기능적 영향, 그리고 다른 가능한 설명(의학적 상태, 물질, 유사하게 나타나는 다른 장애들)의 배제를 확인하는 과정이 필요합니다. 이는 병력과 맥락을 고려합니다. 설문지는 이 중 어느 것도 하지 않습니다. 설문지는 특정 기간 동안의 자기보고된 증상 빈도를 집계할 뿐입니다.
총점이 여러 이질적인 증상을 하나의 숫자로 압축하기 때문에, 완전히 다른 임상 양상을 가진 두 사람이 동일한 점수를 낼 수 있습니다. 점수는 더 깊이 살펴보라는 신호일 뿐이며, 그 살펴보는 과정이 곧 진단입니다.
점수가 정당하게 사용되는 목적
계기. 높은 점수는 전문가와 이야기해 볼 이유가 됩니다. 이것이 의도된 용도이며 실제로 가치 있는 용도입니다.
변화 추적. 이것이 충분히 활용되지 않는 기능입니다. 치료 과정에서의 반복적인 측정은 무언가가 효과가 있는지를 보여주며, 이는 어떤 단일 점수보다 훨씬 더 많은 정보를 제공합니다. 측정 기반 치료는 바로 이 원리에 기반합니다.
집단 기술. 연구와 공공 보건에서 이러한 검사도구들은 집단 간 증상 부담을 추정하는 데 사용되며, 이것이 이 도구들이 가장 잘하는 일입니다.
자신의 결과 읽기
선별검사에서 임계값 이상의 점수를 받았다면, 올바른 해석은 이렇습니다: 이는 자격을 갖춘 사람과의 대화를 필요로 한다는 것입니다. 이렇게 해석해서는 안 됩니다: 나는 이 상태를 가지고 있다.
임계값 미만의 점수를 받았다면, 올바른 해석은 이렇습니다: 이 특정 선별검사는 아무것도 표시하지 않았다는 것입니다. 이렇게 해석해서는 안 됩니다: 나는 괜찮다. 선별검사는 사례를 놓치기도 하는데, 이것이 절충의 다른 절반이며, 몸 상태가 좋지 않다고 느끼는 사람에게 낮은 점수는 안심의 근거가 되지 않습니다.
NOESIS가 선별 검사도구를 발표하는 경우, 보고서는 발표된 임계값을 명시하고, 출처를 밝히며, 그 결과가 진단이 아님을 명확히 밝힙니다. 이러한 서술은 법적 형식이 아니라, 그 검사도구들 자체가 자신의 용도에 대해 말하는 내용입니다.
직접 검사해 보기
측정에 관한 글을 읽는 것과, 자신의 점수가 그 출처, 규준 표본, 한계와 함께 보고되는 것을 직접 확인하는 것은 다른 경험입니다. 무료로 응시할 수 있으며 가입도 필요하지 않습니다.
계속 읽기
- 심리측정학이란 무엇입니까?심리 측정이 좋은지 아닌지를 판단하는 학문 분야이며, 비슷한 질문을 하는 두 검사가 그 결과의 가치에서 크게 차이가 날 수 있는 이유입니다.
- 심리검사에서 신뢰도란 무엇입니까?신뢰도는 측정의 일관성이며, 정확성이 아닙니다. 검사는 신뢰도가 매우 높으면서도 여전히 잘못된 대상을 측정할 수 있습니다. 이것이 신뢰도가 가장 먼저 묻는 질문이지 결코 마지막 질문이 아닌 이유입니다.
- 심리검사에서 타당도란 무엇입니까?타당도는 검사가 지니고 있는 속성이 아닙니다. 특정 목적을 위한 특정 점수의 특정 해석이 정당화될 수 있는지에 관한 논증이며, 새로운 용도마다 다시 구축되어야 합니다.
- 구성 타당도란 무엇입니까?측정에서 가장 어려운 질문입니다. 귀하가 측정하는 대상이 귀하가 정의한 대로 실제로 존재하는지, 그리고 귀하의 도구가 그 대상에 도달하는지, 아니면 그와 유사한 다른 무언가에 도달하는지에 관한 질문입니다.
- 수렴 타당도와 판별 타당도거울처럼 대칭을 이루는 두 가지 요건이 있습니다. 측정치는 그것이 일치해야 하는 것과 일치해야 하며, 그것이 아니라고 주장하는 것과는 구별되어야 합니다. 대부분의 부실한 도구는 두 번째 요건을 충족하지 못합니다.
- 크론바흐 알파(Cronbach's alpha)란 무엇인가, 그리고 무엇이 아닌가심리 검사에서 가장 많이 보고되는 통계량이면서 가장 잘못 이해되는 통계량입니다. 알파 값은 척도가 단일 차원임을 알려주지 않으며, 높은 값은 흔히 장점이 아니라 증상입니다.
- 측정표준오차: 귀하의 점수가 어느 정도 오차를 가질 수 있는지모든 점수는 오차 범위를 지니며, 대부분의 심리 검사에서 이 범위는 사람들이 생각하는 것보다 넓습니다. 이 수치는 어떤 차이가 실제이고 어떤 차이가 잡음인지를 알려줍니다.
- 규준 및 백분위: 귀하의 점수를 비교하는 대상원점수는 그 자체로는 해석할 수 없습니다. 오직 준거 집단과 비교할 때에만 의미를 갖게 되며, 어떤 집단이 사용되었는지는 어떤 검사에서든 가장 중요하면서도 가장 잘 알려지지 않은 사실 중 하나입니다.
- 심리검사가 실제로 만들어지는 과정구성개념 정의부터 발표된 규준까지, 이 과정은 여러 해가 걸리며 그 안에 투입된 것의 대부분을 버립니다. 이 단계들을 알면 어떤 온라인 간이 퀴즈가 어떤 단계를 건너뛰었는지가 분명해집니다.
- 검사가 '타당화되었다'고 불리는 것은 무엇을 의미합니까?이 단어는 규제되지 않으며, 아무런 작업도 하지 않은 제품들이 자유롭게 사용합니다. 이 용어가 실제로 의미를 가질 때 무엇을 뜻하는지, 그리고 두 경우를 구분하는 네 가지 질문을 소개합니다.
- 인터넷상의 대부분의 성격 검사가 신뢰할 수 없는 이유이는 그들이 부정직해서가 아니라, 측정을 신뢰할 수 있게 만드는 단계들이 보이지 않고 비용이 많이 들며 건너뛰기 쉽기 때문입니다. 그리고 그 단계를 건너뛰어도 결과가 보이는 방식은 전혀 달라지지 않습니다.
- 자기보고가 측정할 수 있는 것과 측정할 수 없는 것설문지는 귀하에게 자기 자신을 관찰하는 역할을 요구하는데, 이 방식은 어떤 대상에는 더 잘 작동하고 어떤 대상에는 그렇지 않습니다. 이 방법이 어디에서 강력하고 어디에서 실패하는지 아는 것은 결과를 읽는 방식을 바꿉니다.
- 검사가 무엇인가를 예측한다는 것의 의미0.30의 상관관계는 성격 연구에서는 강력한 결과이지만, 한 개인에 대한 의사결정의 근거로는 약합니다. 두 진술 모두 참이며, 이 둘 사이의 간극이 검사 결과 오용의 대부분을 유발합니다.