Apakah itu kesahan dalam ujian psikologi?
Kesahan bukanlah sifat yang dimiliki oleh sesuatu ujian. Ia ialah hujah tentang sama ada tafsiran tertentu terhadap skor tertentu, bagi tujuan tertentu, boleh dipertahankan; dan ia perlu dibina semula bagi setiap kegunaan baharu.
Kesahan bertanya sama ada sesuatu ujian mengukur apa yang didakwa diukurnya, dan sama ada kesimpulan yang dibuat oleh orang ramai daripada skornya adalah wajar. Ini merupakan persoalan utama dalam psikometrik dan persoalan yang paling kerap dijawab dengan dakwaan pemasaran dan bukannya bukti.
Kefahaman moden, yang telah diterima sejak kerja Messick pada tahun 1980-an, ialah kesahan bukan sifat tetap sesuatu instrumen. Kesahan ialah sifat bagi suatu tafsiran skor untuk suatu kegunaan tertentu. Soal selidik yang sama boleh disahkan dengan baik untuk menggambarkan persepsi kendiri seseorang tetapi langsung tidak disahkan untuk memutuskan sama ada mereka patut diambil bekerja. Menyatakan "ujian ini sah" tanpa menyatakan sah untuk apa bukanlah satu dakwaan; ia hanyalah slogan.
Jenis-jenis bukti
Kesahan dibina daripada pengumpulan bukti daripada beberapa jenis. Teks lama membentangkannya sebagai jenis kesahan yang berasingan; pandangan semasa menganggapnya sebagai hujah berbeza yang menyokong satu kes yang sama.
Bukti kandungan bertanya sama ada item meliputi konstruk dengan sewajarnya. Skala kemurungan yang hanya bertanya tentang tidur dan selera makan meliputi gejala somatik tetapi terlepas gejala suasana hati dan kognitif. Liputan kandungan biasanya dinilai oleh pakar bidang, dan inilah sebabnya skala yang sangat pendek sentiasa merupakan suatu kompromi.
Bukti struktur dalaman bertanya sama ada item berkumpul mengikut cara yang dinyatakan oleh teori. Jika sesuatu model mendakwa terdapat empat faset yang berbeza, analisis faktor sepatutnya menemukan empat faktor, dan yang paling penting, dalam sampel yang bebas, bukan hanya dalam sampel yang digunakan untuk membina skala tersebut. Banyak sekali instrumen menemukan struktur yang dimaksudkan dalam sampel pembangunan tetapi gagal berbuat demikian dalam sampel orang lain.
Hubungan dengan pemboleh ubah lain ialah bahagian di mana kebanyakan kerja dilakukan. Bukti konvergen menunjukkan skala berkorelasi dengan perkara yang sepatutnya ia berkorelasi. Bukti diskriminan menunjukkan skala tidak berkorelasi terlalu tinggi dengan perkara yang sepatutnya berbeza daripadanya; ini ialah keperluan yang sering diabaikan, dan keperluan inilah yang menenggelamkan banyak konstruk berjenama baharu. Bukti kriterium menunjukkan skor berkaitan dengan hasil yang penting, sama ada diukur pada masa yang sama atau diramalkan lebih awal.
Bukti konsekuensial bertanya apa yang berlaku apabila ujian digunakan. Jika sesuatu instrumen secara sistematik merugikan sesuatu kumpulan atas sebab yang tidak berkaitan dengan konstruk, itu ialah masalah kesahan, bukan sekadar masalah etika.
Persoalan yang mendedahkan kebanyakan dakwaan
Ujian paling tajam bagi sesuatu dakwaan kesahan ialah kesahan inkremental: adakah instrumen ini menambah apa-apa berbanding apa yang telah diberitahu oleh ukuran yang lebih murah, lebih lama dan sudah mantap?
Sejumlah besar konstruk berjenama gagal di sini. Konstruk tersebut berkorelasi 0.7 atau lebih tinggi dengan domain Big Five yang sedia ada, meramalkan hasil yang sama pada magnitud yang sama, dan tidak menambah apa-apa apabila ukuran lama dikawal secara statistik. Konstruknya baharu; pengukurannya tidak. Inilah sebabnya bahagian kritikan dalam dokumentasi instrumen yang serius begitu kerap berkisar pada pertindihan dan bukannya ketidaktepatan.
Apa yang perlu dicari
Apabila seseorang mendakwa sesuatu ujian telah disahkan, persoalan yang berguna adalah konkrit. Disahkan berbanding kriterium apa? Dalam populasi mana, dan berapa saiznya? Adakah struktur faktor disahkan dalam sampel yang bebas? Adakah terdapat bukti yang diterbitkan oleh penyelidik yang tidak mempunyai kepentingan komersial terhadap jawapannya? Adakah ia menambah apa-apa berbanding alternatif yang sudah mantap?
Instrumen yang mempunyai jawapan jujur kepada persoalan tersebut wajar diambil serius, termasuk batasannya. Instrumen yang pengesahannya hanya terdiri daripada halaman testimoni dan dakwaan bahawa berjuta-juta orang telah mengambilnya sebenarnya menjawab persoalan yang sama sekali berbeza: populariti bukan bukti, dan bilangan orang yang telah mengambil sesuatu ujian tidak menyatakan apa-apa tentang sama ada skornya bermakna.
Uji sendiri
Membaca tentang pengukuran adalah satu perkara. Melihat skor anda sendiri dilaporkan bersama sumbernya, sampel normanya dan batasannya adalah perkara lain. Percuma, tanpa perlu mendaftar.
Teruskan membaca
- Apakah itu psikometrik?Disiplin yang menentukan sama ada sesuatu pengukuran psikologi itu baik atau tidak, dan sebab dua ujian yang mengemukakan soalan serupa boleh berbeza dengan ketara dari segi nilai keputusannya.
- Apakah itu kebolehpercayaan dalam ujian psikologi?Kebolehpercayaan ialah ketekalan pengukuran, bukan ketepatan. Sesuatu ujian boleh mempunyai kebolehpercayaan yang tinggi tetapi masih mengukur perkara yang salah; itulah sebabnya ia merupakan soalan pertama yang ditanya dan tidak pernah yang terakhir.
- Apakah itu kesahan konstruk?Soalan paling sukar dalam pengukuran: sama ada perkara yang anda ukur benar-benar wujud seperti yang anda takrifkan, dan sama ada instrumen anda mencapainya dan bukan sesuatu yang berdekatan dengannya.
- Kesahan konvergen dan diskriminanDua keperluan yang saling bercermin: sesuatu ukuran mesti selari dengan apa yang sepatutnya selari dengannya, dan mesti kekal berbeza daripada apa yang didakwa bukan dirinya. Kebanyakan instrumen yang lemah gagal memenuhi keperluan yang kedua.
- Apakah itu alfa Cronbach, dan apakah yang bukanStatistik yang paling kerap dilaporkan dalam ujian psikologi, dan yang paling kerap disalah tafsir. Alfa tidak memberitahu anda bahawa sesuatu skala itu unidimensi, dan nilai yang tinggi sering kali merupakan simptom dan bukannya kelebihan.
- Ralat piawai pengukuran: sejauh mana skor anda mungkin tersasarSetiap skor membawa margin ralat, dan bagi kebanyakan ujian psikologi, margin ini lebih luas daripada yang disangka oleh orang ramai. Inilah nombor yang memberitahu anda bila sesuatu perbezaan itu benar dan bila ia hanya hingar.
- Norma dan persentil: apakah perbandingan bagi skor andaSkor mentah tidak dapat ditafsirkan dengan sendirinya. Ia hanya menjadi bermakna apabila dibandingkan dengan kumpulan rujukan, dan kumpulan yang digunakan merupakan salah satu fakta paling penting tetapi paling jarang dinyatakan tentang mana-mana ujian.
- Bagaimana ujian psikometrik sebenarnya dibinaDaripada definisi konstruk hingga norma yang diterbitkan, urutan ini mengambil masa bertahun-tahun dan membuang sebahagian besar daripada apa yang dimasukkan ke dalamnya. Dengan mengetahui langkah-langkahnya, jelaslah langkah mana yang dilangkau oleh kuiz dalam talian yang ringkas.
- Apakah maksudnya apabila sesuatu ujian dikatakan telah disahkan?Perkataan ini tidak dikawal selia dan digunakan sesuka hati oleh produk yang tidak melakukan sebarang usaha tersebut. Berikut ialah maksudnya apabila ia benar-benar bermakna, serta empat soalan yang membezakan kedua-dua keadaan itu.
- Mengapa kebanyakan ujian personaliti di internet tidak boleh dipercayaiBukan kerana mereka tidak jujur, tetapi kerana langkah-langkah yang menjadikan sesuatu pengukuran boleh dipercayai tidak kelihatan, mahal dan mudah diabaikan; dan mengabaikannya tidak mengubah apa-apa tentang rupa keputusan tersebut.
- Apa yang boleh dan tidak boleh diukur oleh laporan kendiriSoal selidik meminta anda menjadi pemerhati diri sendiri, dan cara ini lebih berkesan untuk sesetengah perkara berbanding yang lain. Mengetahui di mana kaedah ini kuat dan di mana ia gagal akan mengubah cara anda membaca sebarang keputusan.
- Apakah maksudnya apabila sesuatu ujian meramalkan sesuatuKorelasi 0.30 ialah dapatan yang kukuh dalam penyelidikan personaliti tetapi asas yang lemah untuk membuat keputusan tentang seseorang individu. Kedua-dua kenyataan ini benar, dan jurang antara keduanya menjadi punca kebanyakan penyalahgunaan keputusan ujian.
- Saringan bukan diagnosisSoal selidik saringan dibina untuk mengesan sebanyak mungkin kes yang berkemungkinan, dengan menerima kadar positif palsu yang tinggi sebagai harganya. Membaca skor saringan sebagai diagnosis adalah bertentangan dengan tujuan asal reka bentuknya.