Bagaimana ujian psikometrik sebenarnya dibina
Daripada definisi konstruk hingga norma yang diterbitkan, urutan ini mengambil masa bertahun-tahun dan membuang sebahagian besar daripada apa yang dimasukkan ke dalamnya. Dengan mengetahui langkah-langkahnya, jelaslah langkah mana yang dilangkau oleh kuiz dalam talian yang ringkas.
Sesuatu instrumen psikometrik yang sampai ke peringkat penerbitan biasanya telah melalui lima atau enam tahun kerja dan telah membuang sebahagian besar daripada apa yang ditulis untuknya. Urutan ini wajar diketahui, kerana setiap peringkatnya sepadan dengan satu cara sesuatu ujian boleh menjadi tidak memadai.
1. Takrifkan konstruk
Sebelum sebarang item ditulis, konstruk perlu dinyatakan dengan cukup tepat sehingga dapat ditentukan apa yang berada di luarnya. Ini bermakna satu takrifan, satu pernyataan tentang struktur dimensi (satu dimensi atau beberapa, dan jika beberapa, bagaimana dimensi-dimensi itu berkaitan) serta penjelasan yang nyata tentang konstruk berdekatan yang manakah ia sepatutnya berbeza daripadanya.
Melangkau peringkat ini merupakan punca kebanyakan instrumen yang berlebihan. Skala yang dibina berdasarkan pemahaman intuitif tentang sesuatu konsep biasanya akhirnya mengukur sifat yang sudah mantap dengan nama baharu.
2. Hasilkan kumpulan item
Item digubal jauh melebihi jumlah yang akan kekal, lazimnya tiga hingga lima kali ganda jumlah akhir. Item ini datang daripada teori, daripada instrumen sedia ada, daripada temu bual dengan orang yang mempunyai pengalaman yang digambarkan, dan daripada pakar bidang.
Pada peringkat ini, kumpulan item disemak dari segi liputan kandungan (adakah ia merangkumi keseluruhan konstruk atau tertumpu pada satu faset?), tahap bacaan, perkataan yang mengandungi dua soalan sekali gus, dan item yang sebenarnya bertanya tentang perkara lain.
3. Rintis dan potong
Kumpulan item diberikan kepada sampel pertama. Analisisnya kebanyakannya bersifat memusnahkan.
Item yang hampir tiada varians dibuang; soalan yang dijawab dengan cara yang sama oleh semua orang tidak membezakan sesiapa pun. Item yang berkorelasi lemah dengan skor keseluruhan dibuang. Item yang termuat silang pada lebih daripada satu faktor dibuang. Item yang berkelakuan berbeza merentas kumpulan demografi atas sebab yang tiada kaitan dengan sifat tersebut (kefungsian item pembeza) dibuang, dan semakan ini antara yang paling kerap dilangkau.
Yang kekal lazimnya hanya satu pertiga daripada apa yang ditulis.
4. Sahkan struktur dalam sampel baharu
Inilah langkah yang membezakan instrumen yang serius daripada yang lain. Analisis faktor pada sampel pembangunan akan memperoleh semula struktur yang telah direka; ia pasti begitu, kerana item telah dipilih untuk menghasilkannya. Ujian sebenar ialah analisis faktor pengesahan dalam sampel yang bebas.
Banyak skala yang diterbitkan hanya memperoleh semula struktur yang dimaksudkan dalam data yang digunakan untuk membinanya. Apabila orang lain mengumpul data baharu, faktor-faktor itu tidak muncul. Kegagalan ini cukup lazim sehingga "adakah struktur itu disahkan dalam sampel yang bebas?" merupakan antara soalan paling berkesan untuk ditanya tentang mana-mana instrumen.
5. Kumpulkan bukti kesahan
Korelasi dengan ukuran mantap bagi konstruk yang sama. Korelasi dengan konstruk yang sepatutnya berbeza daripadanya, yang sewajarnya lebih rendah. Hubungan dengan hasil yang penting. Kesahan tambahan berbanding apa yang sudah sedia ada. Kestabilan uji-ulang uji dalam selang masa yang sesuai dengan konstruk.
Peringkat ini tidak berakhir. Ia berterusan selagi instrumen itu digunakan, dan di sinilah instrumen paling kerap didapati tidak memadai bertahun-tahun selepas diterbitkan.
6. Bina norma
Sampel rujukan yang cukup besar dan cukup mewakili populasi sasaran, distratakan apabila sifat berbeza mengikut umur atau jantina, dan didokumentasikan dari segi tahun dan negara. Kemudian diulang secara berkala, kerana norma berubah dari semasa ke semasa.
7. Terjemahkan, jika ia akan digunakan di tempat lain
Terjemahan bukan sekadar latihan linguistik. Adaptasi yang betul bermakna terjemahan ke hadapan, terjemahan balik secara bebas, semakan pakar, temu bual kognitif dengan penutur bahasa sasaran, dan kemudian kajian psikometrik baharu dalam bahasa tersebut untuk menguji sama ada struktur itu kekal dan sama ada item berfungsi secara setara. Instrumen yang diterjemahkan tanpa kajian itu ialah instrumen yang belum diuji dalam bahasa tersebut, walau apa pun kelayakannya dalam bahasa asal.
Apa maksudnya bagi kuiz ringkas
Ujian yang ditulis dalam satu petang hanya telah melengkapkan langkah kedua. Ia mungkin menghasilkan keputusan yang kelihatan munasabah, satu persentil dan satu perenggan penerangan. Langkah-langkah yang dilangkaunya ialah langkah yang akan menentukan sama ada semua itu benar-benar bermakna.
Uji sendiri
Membaca tentang pengukuran adalah satu perkara. Melihat skor anda sendiri dilaporkan bersama sumbernya, sampel normanya dan batasannya adalah perkara lain. Percuma, tanpa perlu mendaftar.
Teruskan membaca
- Apakah itu psikometrik?Disiplin yang menentukan sama ada sesuatu pengukuran psikologi itu baik atau tidak, dan sebab dua ujian yang mengemukakan soalan serupa boleh berbeza dengan ketara dari segi nilai keputusannya.
- Apakah itu kebolehpercayaan dalam ujian psikologi?Kebolehpercayaan ialah ketekalan pengukuran, bukan ketepatan. Sesuatu ujian boleh mempunyai kebolehpercayaan yang tinggi tetapi masih mengukur perkara yang salah; itulah sebabnya ia merupakan soalan pertama yang ditanya dan tidak pernah yang terakhir.
- Apakah itu kesahan dalam ujian psikologi?Kesahan bukanlah sifat yang dimiliki oleh sesuatu ujian. Ia ialah hujah tentang sama ada tafsiran tertentu terhadap skor tertentu, bagi tujuan tertentu, boleh dipertahankan; dan ia perlu dibina semula bagi setiap kegunaan baharu.
- Apakah itu kesahan konstruk?Soalan paling sukar dalam pengukuran: sama ada perkara yang anda ukur benar-benar wujud seperti yang anda takrifkan, dan sama ada instrumen anda mencapainya dan bukan sesuatu yang berdekatan dengannya.
- Kesahan konvergen dan diskriminanDua keperluan yang saling bercermin: sesuatu ukuran mesti selari dengan apa yang sepatutnya selari dengannya, dan mesti kekal berbeza daripada apa yang didakwa bukan dirinya. Kebanyakan instrumen yang lemah gagal memenuhi keperluan yang kedua.
- Apakah itu alfa Cronbach, dan apakah yang bukanStatistik yang paling kerap dilaporkan dalam ujian psikologi, dan yang paling kerap disalah tafsir. Alfa tidak memberitahu anda bahawa sesuatu skala itu unidimensi, dan nilai yang tinggi sering kali merupakan simptom dan bukannya kelebihan.
- Ralat piawai pengukuran: sejauh mana skor anda mungkin tersasarSetiap skor membawa margin ralat, dan bagi kebanyakan ujian psikologi, margin ini lebih luas daripada yang disangka oleh orang ramai. Inilah nombor yang memberitahu anda bila sesuatu perbezaan itu benar dan bila ia hanya hingar.
- Norma dan persentil: apakah perbandingan bagi skor andaSkor mentah tidak dapat ditafsirkan dengan sendirinya. Ia hanya menjadi bermakna apabila dibandingkan dengan kumpulan rujukan, dan kumpulan yang digunakan merupakan salah satu fakta paling penting tetapi paling jarang dinyatakan tentang mana-mana ujian.
- Apakah maksudnya apabila sesuatu ujian dikatakan telah disahkan?Perkataan ini tidak dikawal selia dan digunakan sesuka hati oleh produk yang tidak melakukan sebarang usaha tersebut. Berikut ialah maksudnya apabila ia benar-benar bermakna, serta empat soalan yang membezakan kedua-dua keadaan itu.
- Mengapa kebanyakan ujian personaliti di internet tidak boleh dipercayaiBukan kerana mereka tidak jujur, tetapi kerana langkah-langkah yang menjadikan sesuatu pengukuran boleh dipercayai tidak kelihatan, mahal dan mudah diabaikan; dan mengabaikannya tidak mengubah apa-apa tentang rupa keputusan tersebut.
- Apa yang boleh dan tidak boleh diukur oleh laporan kendiriSoal selidik meminta anda menjadi pemerhati diri sendiri, dan cara ini lebih berkesan untuk sesetengah perkara berbanding yang lain. Mengetahui di mana kaedah ini kuat dan di mana ia gagal akan mengubah cara anda membaca sebarang keputusan.
- Apakah maksudnya apabila sesuatu ujian meramalkan sesuatuKorelasi 0.30 ialah dapatan yang kukuh dalam penyelidikan personaliti tetapi asas yang lemah untuk membuat keputusan tentang seseorang individu. Kedua-dua kenyataan ini benar, dan jurang antara keduanya menjadi punca kebanyakan penyalahgunaan keputusan ujian.
- Saringan bukan diagnosisSoal selidik saringan dibina untuk mengesan sebanyak mungkin kes yang berkemungkinan, dengan menerima kadar positif palsu yang tinggi sebagai harganya. Membaca skor saringan sebagai diagnosis adalah bertentangan dengan tujuan asal reka bentuknya.