구성 타당도란 무엇입니까?
측정에서 가장 어려운 질문입니다. 귀하가 측정하는 대상이 귀하가 정의한 대로 실제로 존재하는지, 그리고 귀하의 도구가 그 대상에 도달하는지, 아니면 그와 유사한 다른 무언가에 도달하는지에 관한 질문입니다.
구성타당도(construct validity)는 어떤 도구가 그것이 측정한다고 주장하는 이론적 구성개념을 실제로 측정하는지, 아니면 그것과 상관된 다른 무언가나 그보다 좁은 무언가, 혹은 아무런 일관성도 없는 무언가를 측정하는지를 묻는 것입니다. 이는 타당도 증거 중 가장 심층적인 형태이며, 하나의 연구가 아니라 수년에 걸쳐 확립되는 것입니다.
어려움은 구조적인 것입니다. 회복탄력성이나 정서지능과 같은 구성개념은 하나의 대상이 아니라 행동에서 제안된 규칙성입니다. 어떤 척도가 그것을 측정한다는 것을 보이려면, 그 구성개념이 기술된 대로 존재한다는 주장과 이 특정 문항들이 그것에 도달한다는 주장을 동시에 방어해야 합니다. 이 두 주장은 분리될 수 없으며, 이것이 바로 1955년 이 개념을 제시한 Cronbach와 Meehl이 이를 하나의 도구가 아니라 이론적 네트워크 전체를 검증하는 것으로 규정한 이유입니다.
논증은 어떻게 구축되는가
예측된 상관 패턴. 이론은 그 구성개념이 어떤 것들과 어느 정도 강하게 관련되어야 하는지를 말해줍니다. 자기자비(self-compassion)는 삶의 만족도와는 양의 상관을, 우울과는 음의 상관을 보여야 하며, 자존감과는 중간 정도의 상관만을 보여야 합니다. 만약 자존감과 0.9의 상관을 보인다면, 그것은 별개의 구성개념이 아닐 것입니다. 이러한 예측 하나하나가 검증 가능한 주장이며, 그중 하나가 실패하는 것도 정보로서의 가치가 있습니다.
예상되는 집단 차이. 만약 이론이 어떤 특성이 나이에 따라 발달한다거나 특정 임상 집단에서 높게 나타난다고 말한다면, 그 도구는 이를 보여주어야 합니다. 이론이 요구하는 차이를 발견하지 못하는 것은 그 도구나 이론, 혹은 둘 다에 반하는 증거입니다.
개입에 대한 반응. 만약 어떤 구성개념이 훈련 가능한 것으로 간주된다면, 점수는 훈련 후에 변화해야 하고 통제집단에서는 변화하지 않아야 합니다. 아무런 것에도 반응하지 않는 구성개념은 인위적 산물(artefact)과 구분하기 어렵습니다.
내적 구조. 요인 구조는 이론화된 구조와 일치해야 하며, 중요하게는 새로운 표본에서도 그러해야 합니다. 개발 데이터에 대한 탐색적 요인분석은 설계된 대로의 구조를 찾아낼 뿐이며, 새로운 데이터에 대한 확인적 분석에서야 그 주장이 실제로 검증됩니다.
다중특성-다중방법(multitrait-multimethod) 개념
Campbell과 Fiske가 1959년에 기여한 바는, 구성타당도가 동시에 두 가지를 요구한다고 주장한 것입니다. 즉, 서로 다른 방법으로 측정한 동일한 특성의 측정치들은 서로 일치해야 하고, 동일한 방법으로 측정한 서로 다른 특성의 측정치들은 일치하지 않아야 한다는 것입니다.
대부분의 도구가 어려움을 겪는 부분이 바로 이 두 번째 절반입니다. 만약 귀하의 자기보고 공감 점수가 자기보고 우호성 점수와는 0.7의 상관을, 관찰자 평정 공감 점수와는 0.2의 상관을 보인다면, 귀하의 질문지가 가장 강하게 측정하고 있는 것은 공감이 아니라 귀하가 질문지에서 자신을 기술하는 일반적인 방식입니다. 방법 분산(method variance)은 자기보고 연구에서 가장 지속적으로 나타나는 문제 중 하나이며, 이것이 바로 진지한 타당화 작업이 가능한 경우 질문지가 아닌 기준(criterion)을 찾으려 하는 이유입니다.
귀하의 결과를 읽을 때 이것이 중요한 이유
구성타당도는 점수와 그 해석 사이를 지탱하는 것입니다. 잘 타당화된 도구가 귀하가 어떤 특성에서 높은 점수를 받았다고 보고할 때, 그 진술 뒤에 있는 추론의 연쇄에는 그 특성이 일관된 양으로서 작동한다는 것, 이 문항들이 그것을 추적한다는 것, 그리고 그 점수가 검사를 받는 사람들 전반에 걸쳐 유사한 의미를 갖는다는 것을 확립한 수십 년에 걸친 발표된 연구들이 포함되어 있습니다.
구성타당도 검증이 전혀 없는 검사가 동일한 것을 보고할 때, 그 점수는 누구도 검증한 적 없는 알고리즘이 생성한 숫자일 뿐입니다. 결과 화면에서는 둘 다 동일하게 보입니다. 차이는 전적으로 문서화(documentation)에 있으며, 바로 그 때문에 문서화를 찾아보는 것이 가치 있는 일입니다.
직접 검사해 보기
측정에 관한 글을 읽는 것과, 자신의 점수가 그 출처, 규준 표본, 한계와 함께 보고되는 것을 직접 확인하는 것은 다른 경험입니다. 무료로 응시할 수 있으며 가입도 필요하지 않습니다.
계속 읽기
- 심리측정학이란 무엇입니까?심리 측정이 좋은지 아닌지를 판단하는 학문 분야이며, 비슷한 질문을 하는 두 검사가 그 결과의 가치에서 크게 차이가 날 수 있는 이유입니다.
- 심리검사에서 신뢰도란 무엇입니까?신뢰도는 측정의 일관성이며, 정확성이 아닙니다. 검사는 신뢰도가 매우 높으면서도 여전히 잘못된 대상을 측정할 수 있습니다. 이것이 신뢰도가 가장 먼저 묻는 질문이지 결코 마지막 질문이 아닌 이유입니다.
- 심리검사에서 타당도란 무엇입니까?타당도는 검사가 지니고 있는 속성이 아닙니다. 특정 목적을 위한 특정 점수의 특정 해석이 정당화될 수 있는지에 관한 논증이며, 새로운 용도마다 다시 구축되어야 합니다.
- 수렴 타당도와 판별 타당도거울처럼 대칭을 이루는 두 가지 요건이 있습니다. 측정치는 그것이 일치해야 하는 것과 일치해야 하며, 그것이 아니라고 주장하는 것과는 구별되어야 합니다. 대부분의 부실한 도구는 두 번째 요건을 충족하지 못합니다.
- 크론바흐 알파(Cronbach's alpha)란 무엇인가, 그리고 무엇이 아닌가심리 검사에서 가장 많이 보고되는 통계량이면서 가장 잘못 이해되는 통계량입니다. 알파 값은 척도가 단일 차원임을 알려주지 않으며, 높은 값은 흔히 장점이 아니라 증상입니다.
- 측정표준오차: 귀하의 점수가 어느 정도 오차를 가질 수 있는지모든 점수는 오차 범위를 지니며, 대부분의 심리 검사에서 이 범위는 사람들이 생각하는 것보다 넓습니다. 이 수치는 어떤 차이가 실제이고 어떤 차이가 잡음인지를 알려줍니다.
- 규준 및 백분위: 귀하의 점수를 비교하는 대상원점수는 그 자체로는 해석할 수 없습니다. 오직 준거 집단과 비교할 때에만 의미를 갖게 되며, 어떤 집단이 사용되었는지는 어떤 검사에서든 가장 중요하면서도 가장 잘 알려지지 않은 사실 중 하나입니다.
- 심리검사가 실제로 만들어지는 과정구성개념 정의부터 발표된 규준까지, 이 과정은 여러 해가 걸리며 그 안에 투입된 것의 대부분을 버립니다. 이 단계들을 알면 어떤 온라인 간이 퀴즈가 어떤 단계를 건너뛰었는지가 분명해집니다.
- 검사가 '타당화되었다'고 불리는 것은 무엇을 의미합니까?이 단어는 규제되지 않으며, 아무런 작업도 하지 않은 제품들이 자유롭게 사용합니다. 이 용어가 실제로 의미를 가질 때 무엇을 뜻하는지, 그리고 두 경우를 구분하는 네 가지 질문을 소개합니다.
- 인터넷상의 대부분의 성격 검사가 신뢰할 수 없는 이유이는 그들이 부정직해서가 아니라, 측정을 신뢰할 수 있게 만드는 단계들이 보이지 않고 비용이 많이 들며 건너뛰기 쉽기 때문입니다. 그리고 그 단계를 건너뛰어도 결과가 보이는 방식은 전혀 달라지지 않습니다.
- 자기보고가 측정할 수 있는 것과 측정할 수 없는 것설문지는 귀하에게 자기 자신을 관찰하는 역할을 요구하는데, 이 방식은 어떤 대상에는 더 잘 작동하고 어떤 대상에는 그렇지 않습니다. 이 방법이 어디에서 강력하고 어디에서 실패하는지 아는 것은 결과를 읽는 방식을 바꿉니다.
- 검사가 무엇인가를 예측한다는 것의 의미0.30의 상관관계는 성격 연구에서는 강력한 결과이지만, 한 개인에 대한 의사결정의 근거로는 약합니다. 두 진술 모두 참이며, 이 둘 사이의 간극이 검사 결과 오용의 대부분을 유발합니다.
- 선별검사는 진단이 아닙니다선별용 설문지는 가능한 많은 사례를 포착하도록 설계되며, 그 대가로 높은 위양성률을 받아들입니다. 선별 점수를 진단으로 해석하는 것은 그것이 설계된 목적을 정반대로 뒤집는 일입니다.