심리검사가 실제로 만들어지는 과정
구성개념 정의부터 발표된 규준까지, 이 과정은 여러 해가 걸리며 그 안에 투입된 것의 대부분을 버립니다. 이 단계들을 알면 어떤 온라인 간이 퀴즈가 어떤 단계를 건너뛰었는지가 분명해집니다.
발표에 이르는 심리측정 도구는 대개 5, 6년의 작업을 거쳐 왔으며, 그 과정에서 작성된 내용의 대부분을 폐기하게 됩니다. 이 순서를 알아둘 필요가 있는데, 각 단계가 검사가 부적절해질 수 있는 방식과 하나씩 대응하기 때문입니다.
1. 구성개념 정의하기
문항을 작성하기 전에, 무엇이 그 범위 밖에 있는지 말할 수 있을 만큼 구성개념을 정확하게 규정해야 합니다. 이는 정의, 차원 구조에 대한 진술(단일 차원인지 다차원인지, 다차원이라면 그것들이 어떻게 관련되는지), 그리고 인접한 어떤 구성개념들과 구별되어야 하는지에 대한 명시적인 설명을 포함합니다.
이 단계를 건너뛰는 것이 대부분의 중복 도구가 생겨나는 원인입니다. 어떤 개념에 대한 직관적인 느낌으로 만들어진 척도는 결국 이미 확립된 특성을 새로운 이름으로 측정하는 결과로 끝나는 경우가 많습니다.
2. 문항 풀 생성하기
문항은 최종적으로 남을 수보다 훨씬 많이, 보통 최종 개수의 3배에서 5배 정도로 초안이 작성됩니다. 이 문항들은 이론, 기존 도구, 해당 경험을 겪은 사람들과의 인터뷰, 그리고 주제 전문가로부터 나옵니다.
이 단계에서 풀은 내용 범위(구성개념 전체를 포괄하는지 아니면 한 측면에 몰려 있는지), 읽기 난이도, 이중적 의미를 지닌 표현, 그리고 실제로는 다른 것을 묻고 있는 문항들에 대해 검토됩니다.
3. 예비조사 및 축소
풀은 첫 번째 표본으로 전달됩니다. 이 분석은 대체로 제거를 위한 것입니다.
분산이 거의 없는 문항은 제거됩니다. 모두가 같은 방식으로 대답하는 질문은 누구도 구별해내지 못합니다. 전체 점수와의 상관이 낮은 문항도 제거됩니다. 두 개 이상의 요인에 교차 적재되는 문항도 제거됩니다. 특성과 무관한 이유로 인구통계 집단 간에 다르게 작동하는 문항, 즉 차별기능문항(differential item functioning)도 제거되는데, 이 검증은 가장 흔히 생략되는 것 중 하나입니다.
남는 것은 대개 처음 작성된 것의 3분의 1 정도입니다.
4. 새로운 표본에서 구조 확인하기
이 단계가 신중한 도구와 그렇지 않은 것을 구분합니다. 개발 표본에 대한 요인분석은 설계된 구조를 그대로 복원하게 되는데, 이는 당연한 일입니다. 문항들이 바로 그 구조를 만들어내도록 선택되었기 때문입니다. 진정한 검증은 독립적인 표본에서 실시하는 확인적 요인분석입니다.
발표된 척도 중 상당수가 그것을 만드는 데 사용된 데이터에서만 의도된 구조를 복원합니다. 다른 누군가가 새로운 데이터를 수집하면, 그 요인들이 나타나지 않습니다. 이러한 실패는 흔하기 때문에, "그 구조가 독립적인 표본에서 확인되었는가?"는 어떤 도구에 대해서든 물어볼 수 있는 가장 효율적인 질문 중 하나입니다.
5. 타당도 증거 축적하기
동일한 구성개념을 측정하는 확립된 도구들과의 상관. 구별되어야 할 구성개념들과의 상관은 더 낮아야 합니다. 중요한 결과 변수들과의 관계. 기존에 존재하는 것에 대한 증분 타당도. 그 구성개념에 적합한 간격에 걸친 검사-재검사 안정성.
이 단계는 끝나지 않습니다. 그 도구가 사용되는 한 계속되며, 발표된 지 여러 해가 지난 후에도 도구가 부족하다고 판명되는 경우가 가장 많은 지점이 바로 여기입니다.
6. 규준 구축하기
대상 모집단에 대해 충분히 크고 대표성 있는 기준 표본을 구성하고, 특성이 연령이나 성별에 따라 다르게 나타나는 경우 이를 층화하며, 연도와 국가를 문서화합니다. 그리고 규준은 시간이 지나면서 변화하기 때문에 주기적으로 갱신됩니다.
7. 다른 지역에서 사용될 경우 번역하기
번역은 단순한 언어 작업이 아닙니다. 적절한 적응 과정은 순번역, 독립적인 역번역, 전문가 검토, 목표 언어 사용자와의 인지적 인터뷰, 그리고 새로운 언어에서 구조가 유지되는지, 문항들이 동등하게 작동하는지를 검증하기 위한 새로운 심리측정 연구를 포함합니다. 그러한 연구 없이 번역된 도구는, 원본에서 어떤 자격을 갖추고 있든, 그 언어에서는 검증되지 않은 도구입니다.
이것이 즉석 퀴즈에 대해 시사하는 바
오후 한나절 만에 작성된 검사는 2단계를 완료한 것입니다. 그럴듯해 보이는 결과, 백분위와 한 단락의 설명을 만들어낼 수도 있습니다. 건너뛴 단계들은 바로 그것이 실제로 어떤 의미가 있는지를 확립했을 단계들입니다.
직접 검사해 보기
측정에 관한 글을 읽는 것과, 자신의 점수가 그 출처, 규준 표본, 한계와 함께 보고되는 것을 직접 확인하는 것은 다른 경험입니다. 무료로 응시할 수 있으며 가입도 필요하지 않습니다.
계속 읽기
- 심리측정학이란 무엇입니까?심리 측정이 좋은지 아닌지를 판단하는 학문 분야이며, 비슷한 질문을 하는 두 검사가 그 결과의 가치에서 크게 차이가 날 수 있는 이유입니다.
- 심리검사에서 신뢰도란 무엇입니까?신뢰도는 측정의 일관성이며, 정확성이 아닙니다. 검사는 신뢰도가 매우 높으면서도 여전히 잘못된 대상을 측정할 수 있습니다. 이것이 신뢰도가 가장 먼저 묻는 질문이지 결코 마지막 질문이 아닌 이유입니다.
- 심리검사에서 타당도란 무엇입니까?타당도는 검사가 지니고 있는 속성이 아닙니다. 특정 목적을 위한 특정 점수의 특정 해석이 정당화될 수 있는지에 관한 논증이며, 새로운 용도마다 다시 구축되어야 합니다.
- 구성 타당도란 무엇입니까?측정에서 가장 어려운 질문입니다. 귀하가 측정하는 대상이 귀하가 정의한 대로 실제로 존재하는지, 그리고 귀하의 도구가 그 대상에 도달하는지, 아니면 그와 유사한 다른 무언가에 도달하는지에 관한 질문입니다.
- 수렴 타당도와 판별 타당도거울처럼 대칭을 이루는 두 가지 요건이 있습니다. 측정치는 그것이 일치해야 하는 것과 일치해야 하며, 그것이 아니라고 주장하는 것과는 구별되어야 합니다. 대부분의 부실한 도구는 두 번째 요건을 충족하지 못합니다.
- 크론바흐 알파(Cronbach's alpha)란 무엇인가, 그리고 무엇이 아닌가심리 검사에서 가장 많이 보고되는 통계량이면서 가장 잘못 이해되는 통계량입니다. 알파 값은 척도가 단일 차원임을 알려주지 않으며, 높은 값은 흔히 장점이 아니라 증상입니다.
- 측정표준오차: 귀하의 점수가 어느 정도 오차를 가질 수 있는지모든 점수는 오차 범위를 지니며, 대부분의 심리 검사에서 이 범위는 사람들이 생각하는 것보다 넓습니다. 이 수치는 어떤 차이가 실제이고 어떤 차이가 잡음인지를 알려줍니다.
- 규준 및 백분위: 귀하의 점수를 비교하는 대상원점수는 그 자체로는 해석할 수 없습니다. 오직 준거 집단과 비교할 때에만 의미를 갖게 되며, 어떤 집단이 사용되었는지는 어떤 검사에서든 가장 중요하면서도 가장 잘 알려지지 않은 사실 중 하나입니다.
- 검사가 '타당화되었다'고 불리는 것은 무엇을 의미합니까?이 단어는 규제되지 않으며, 아무런 작업도 하지 않은 제품들이 자유롭게 사용합니다. 이 용어가 실제로 의미를 가질 때 무엇을 뜻하는지, 그리고 두 경우를 구분하는 네 가지 질문을 소개합니다.
- 인터넷상의 대부분의 성격 검사가 신뢰할 수 없는 이유이는 그들이 부정직해서가 아니라, 측정을 신뢰할 수 있게 만드는 단계들이 보이지 않고 비용이 많이 들며 건너뛰기 쉽기 때문입니다. 그리고 그 단계를 건너뛰어도 결과가 보이는 방식은 전혀 달라지지 않습니다.
- 자기보고가 측정할 수 있는 것과 측정할 수 없는 것설문지는 귀하에게 자기 자신을 관찰하는 역할을 요구하는데, 이 방식은 어떤 대상에는 더 잘 작동하고 어떤 대상에는 그렇지 않습니다. 이 방법이 어디에서 강력하고 어디에서 실패하는지 아는 것은 결과를 읽는 방식을 바꿉니다.
- 검사가 무엇인가를 예측한다는 것의 의미0.30의 상관관계는 성격 연구에서는 강력한 결과이지만, 한 개인에 대한 의사결정의 근거로는 약합니다. 두 진술 모두 참이며, 이 둘 사이의 간극이 검사 결과 오용의 대부분을 유발합니다.
- 선별검사는 진단이 아닙니다선별용 설문지는 가능한 많은 사례를 포착하도록 설계되며, 그 대가로 높은 위양성률을 받아들입니다. 선별 점수를 진단으로 해석하는 것은 그것이 설계된 목적을 정반대로 뒤집는 일입니다.