측정표준오차: 귀하의 점수가 어느 정도 오차를 가질 수 있는지
모든 점수는 오차 범위를 지니며, 대부분의 심리 검사에서 이 범위는 사람들이 생각하는 것보다 넓습니다. 이 수치는 어떤 차이가 실제이고 어떤 차이가 잡음인지를 알려줍니다.
측정의 표준오차는 추상적인 신뢰도 계수를 구체적인 것, 즉 점수를 중심으로 한 플러스마이너스 범위로 전환합니다. 이는 대부분의 결과 화면이 답하지 않고 남겨두는 질문에 답합니다: 만약 다른 날 오후에 검사를 받았다면 이 숫자가 얼마나 달라질 수 있었을까 하는 질문입니다.
공식은 간단합니다. 척도의 표준편차에 1에서 신뢰도를 뺀 값의 제곱근을 곱하면 됩니다. 표준편차가 10이고 신뢰도가 0.85인 척도의 경우, 표준오차는 약 3.9점입니다.
이 범위가 실제로 의미하는 것
대략 3분의 2의 경우, 한 사람의 실제 위치는 관찰된 점수를 기준으로 표준오차 1개 범위 내에 있습니다. 약 95%의 신뢰수준을 원한다면 양쪽으로 표준오차 약 2개가 필요합니다.
위의 예를 들어보겠습니다. 어떤 사람이 62점을 받았다고 가정해 봅시다. 95% 구간은 약 54점에서 70점까지입니다. 이는 평균과 명확히 평균 이상 사이의 일반적인 차이가 10점 정도인 척도에서 16점에 달하는 범위입니다.
이는 특정 검사의 결함이 아닙니다. 0.85의 신뢰도는 훌륭한 수준입니다. 이는 심리 측정의 정상적인 정밀도이며, 신중한 보고서가 단일 점수보다 범위를 제시하는 이유입니다.
사람들이 놓치는 결과들
척도 간의 작은 차이는 대부분 의미가 없습니다. 귀하의 외향성이 58점이고 개방성이 54점이라면, 정직한 해석은 이 둘이 구별되지 않는다는 것입니다. 4점 차이로부터 이야기를 만들어내는 프로파일 해석은 잡음을 읽고 있는 것입니다.
시간에 따른 작은 변화 역시 대부분 의미가 없습니다. 검사를 다시 받았을 때 5점이 달라지는 것은 대부분의 검사에서 오차 범위 내에 있습니다. 실제 특성 변화는 수년에 걸쳐 일어나며, 매달 몇 점씩 달라지는 것이 아니라 오차 범위를 훨씬 벗어나는 움직임으로 나타납니다.
순위 서열은 이 문제를 증폭시킵니다. 원점수의 몇 점 차이가 분포의 밀집된 중앙 부분에서는 백분위를 10단계나 이동시킬 수 있습니다. 대부분의 사람들이 그곳에 위치하기 때문입니다. 백분위 순위는 정확해 보이지만 점수를 표현하는 가장 불안정한 방식입니다.
정밀도는 척도 전체에 걸쳐 균일하지 않습니다. 고전검사이론은 모든 점수에 대해 하나의 오차 값을 가정하는데, 이는 단순화된 접근입니다. 문항반응이론은 특성의 각 수준에서 오차를 별도로 모델링하며, 오차는 거의 항상 극단값에서 더 크게 나타납니다. 바로 가장 중대한 해석이 이루어지는 지점입니다. 매우 높거나 매우 낮은 점수는 일반적으로 중간 점수보다 정밀도가 더 낮지, 더 높지 않습니다.
정직한 보고가 덜 인상적으로 보이는 이유
신뢰구간을 보고하는 검사는 소수점 한 자리까지 단일 숫자를 보고하는 검사보다 모호해 보입니다. 모호해 보이는 쪽이 진실을 말하고 있습니다. 정확해 보이는 쪽은 동일한 근본적 오차를 갖고 있으면서 그것을 보여주지 않기로 선택한 것입니다.
이는 과학적으로 근거를 갖춘 검사와 귀하를 하나의 범주에 배정하는 상업적 제품을 비교할 때 기억해 둘 가치가 있습니다. 범주의 경계선은 특정 점수에 위치하며, 그 경계선보다 1점 낮은 사람과 1점 높은 사람은 통계적으로 동일한 사람입니다. 유형 라벨은 이러한 사실을 완전히 감춥니다. 이는 유형 기반 검사에 반대하는 더 심각한 논거 중 하나이며, 오차를 명시한 연속 점수가 연구에서 표준으로 사용되는 이유입니다.
직접 검사해 보기
측정에 관한 글을 읽는 것과, 자신의 점수가 그 출처, 규준 표본, 한계와 함께 보고되는 것을 직접 확인하는 것은 다른 경험입니다. 무료로 응시할 수 있으며 가입도 필요하지 않습니다.
계속 읽기
- 심리측정학이란 무엇입니까?심리 측정이 좋은지 아닌지를 판단하는 학문 분야이며, 비슷한 질문을 하는 두 검사가 그 결과의 가치에서 크게 차이가 날 수 있는 이유입니다.
- 심리검사에서 신뢰도란 무엇입니까?신뢰도는 측정의 일관성이며, 정확성이 아닙니다. 검사는 신뢰도가 매우 높으면서도 여전히 잘못된 대상을 측정할 수 있습니다. 이것이 신뢰도가 가장 먼저 묻는 질문이지 결코 마지막 질문이 아닌 이유입니다.
- 심리검사에서 타당도란 무엇입니까?타당도는 검사가 지니고 있는 속성이 아닙니다. 특정 목적을 위한 특정 점수의 특정 해석이 정당화될 수 있는지에 관한 논증이며, 새로운 용도마다 다시 구축되어야 합니다.
- 구성 타당도란 무엇입니까?측정에서 가장 어려운 질문입니다. 귀하가 측정하는 대상이 귀하가 정의한 대로 실제로 존재하는지, 그리고 귀하의 도구가 그 대상에 도달하는지, 아니면 그와 유사한 다른 무언가에 도달하는지에 관한 질문입니다.
- 수렴 타당도와 판별 타당도거울처럼 대칭을 이루는 두 가지 요건이 있습니다. 측정치는 그것이 일치해야 하는 것과 일치해야 하며, 그것이 아니라고 주장하는 것과는 구별되어야 합니다. 대부분의 부실한 도구는 두 번째 요건을 충족하지 못합니다.
- 크론바흐 알파(Cronbach's alpha)란 무엇인가, 그리고 무엇이 아닌가심리 검사에서 가장 많이 보고되는 통계량이면서 가장 잘못 이해되는 통계량입니다. 알파 값은 척도가 단일 차원임을 알려주지 않으며, 높은 값은 흔히 장점이 아니라 증상입니다.
- 규준 및 백분위: 귀하의 점수를 비교하는 대상원점수는 그 자체로는 해석할 수 없습니다. 오직 준거 집단과 비교할 때에만 의미를 갖게 되며, 어떤 집단이 사용되었는지는 어떤 검사에서든 가장 중요하면서도 가장 잘 알려지지 않은 사실 중 하나입니다.
- 심리검사가 실제로 만들어지는 과정구성개념 정의부터 발표된 규준까지, 이 과정은 여러 해가 걸리며 그 안에 투입된 것의 대부분을 버립니다. 이 단계들을 알면 어떤 온라인 간이 퀴즈가 어떤 단계를 건너뛰었는지가 분명해집니다.
- 검사가 '타당화되었다'고 불리는 것은 무엇을 의미합니까?이 단어는 규제되지 않으며, 아무런 작업도 하지 않은 제품들이 자유롭게 사용합니다. 이 용어가 실제로 의미를 가질 때 무엇을 뜻하는지, 그리고 두 경우를 구분하는 네 가지 질문을 소개합니다.
- 인터넷상의 대부분의 성격 검사가 신뢰할 수 없는 이유이는 그들이 부정직해서가 아니라, 측정을 신뢰할 수 있게 만드는 단계들이 보이지 않고 비용이 많이 들며 건너뛰기 쉽기 때문입니다. 그리고 그 단계를 건너뛰어도 결과가 보이는 방식은 전혀 달라지지 않습니다.
- 자기보고가 측정할 수 있는 것과 측정할 수 없는 것설문지는 귀하에게 자기 자신을 관찰하는 역할을 요구하는데, 이 방식은 어떤 대상에는 더 잘 작동하고 어떤 대상에는 그렇지 않습니다. 이 방법이 어디에서 강력하고 어디에서 실패하는지 아는 것은 결과를 읽는 방식을 바꿉니다.
- 검사가 무엇인가를 예측한다는 것의 의미0.30의 상관관계는 성격 연구에서는 강력한 결과이지만, 한 개인에 대한 의사결정의 근거로는 약합니다. 두 진술 모두 참이며, 이 둘 사이의 간극이 검사 결과 오용의 대부분을 유발합니다.
- 선별검사는 진단이 아닙니다선별용 설문지는 가능한 많은 사례를 포착하도록 설계되며, 그 대가로 높은 위양성률을 받아들입니다. 선별 점수를 진단으로 해석하는 것은 그것이 설계된 목적을 정반대로 뒤집는 일입니다.