Ralat piawai pengukuran: sejauh mana skor anda mungkin tersasar
Setiap skor membawa margin ralat, dan bagi kebanyakan ujian psikologi, margin ini lebih luas daripada yang disangka oleh orang ramai. Inilah nombor yang memberitahu anda bila sesuatu perbezaan itu benar dan bila ia hanya hingar.
Ralat piawai pengukuran menukar pekali kebolehpercayaan yang abstrak kepada sesuatu yang konkrit: satu jalur tambah-atau-tolak di sekeliling sesuatu skor. Ia menjawab soalan yang tidak dijawab oleh kebanyakan skrin keputusan: sejauh manakah nombor ini mungkin berbeza jika saya menduduki ujian ini pada petang yang lain?
Formulanya mudah. Darabkan sisihan piawai skala dengan punca kuasa dua bagi satu tolak kebolehpercayaannya. Bagi skala dengan sisihan piawai 10 dan kebolehpercayaan 0.85, ralat piawainya ialah kira-kira 3.9 mata.
Apakah yang sebenarnya diliputi oleh jalur itu
Kira-kira dua pertiga daripada masa, kedudukan sebenar seseorang terletak dalam lingkungan satu ralat piawai daripada skor yang diperhatikan. Untuk berkeyakinan kira-kira 95 peratus, anda memerlukan lebih kurang dua ralat piawai pada setiap sisi.
Ambil contoh di atas. Seseorang mendapat skor 62. Selang 95 peratus adalah dari kira-kira 54 hingga 70. Itu ialah julat enam belas mata pada skala yang jurang lazim antara purata dengan jelas di atas purata mungkin hanya sepuluh mata.
Ini bukan kecacatan ujian tersebut. Kebolehpercayaan 0.85 adalah wajar. Ia ialah ketepatan biasa bagi pengukuran psikologi, dan itulah sebabnya laporan yang teliti membentangkan jalur dan bukannya titik.
Akibat yang sering terlepas pandang
Perbezaan kecil antara skala biasanya tidak bermakna. Jika ekstraversi anda 58 dan keterbukaan anda 54, bacaan yang jujur ialah kedua-duanya tidak dapat dibezakan. Tafsiran profil yang membina naratif daripada jurang empat mata sebenarnya membaca hingar.
Perubahan kecil dari semasa ke semasa juga biasanya tidak bermakna. Menduduki semula ujian dan berganjak lima mata masih berada dalam lingkungan ralat bagi kebanyakan instrumen. Perubahan sifat yang sebenar berlaku dalam tempoh bertahun-tahun dan kelihatan sebagai pergerakan yang jauh melepasi jalur ralat, bukan sebagai beberapa mata dari bulan ke bulan.
Susunan kedudukan memburukkan masalah ini. Perbezaan beberapa skor mentah boleh mengalihkan seseorang sepuluh tempat persentil di bahagian tengah taburan yang padat, kerana di situlah kebanyakan orang berada. Pangkat persentil kelihatan tepat tetapi merupakan cara yang paling tidak stabil untuk menyatakan sesuatu skor.
Ketepatan tidak seragam di sepanjang skala. Teori ujian klasik menganggap satu nilai ralat bagi setiap skor, dan ini merupakan satu pemudahan. Teori respons item memodelkan ralat secara berasingan pada setiap tahap sifat, dan ralat itu hampir selalu lebih besar di hujung-hujung skala, iaitu tepat di tempat tafsiran yang paling penting dibuat. Skor yang sangat tinggi atau sangat rendah lazimnya kurang tepat berbanding skor sederhana, bukan lebih tepat.
Mengapa laporan yang jujur kelihatan kurang mengagumkan
Instrumen yang melaporkan jalur keyakinan kelihatan lebih kabur daripada instrumen yang melaporkan satu nombor hingga satu tempat perpuluhan. Yang lebih kabur itu bercakap benar. Yang kelihatan tepat mempunyai ralat asas yang sama tetapi memilih untuk tidak menunjukkannya.
Perkara ini wajar diingat apabila membandingkan ujian yang didokumenkan secara saintifik dengan produk komersial yang meletakkan anda dalam sesuatu kategori. Sempadan kategori terletak pada skor tertentu, dan seseorang yang satu mata di bawahnya serta seseorang yang satu mata di atasnya, dari segi statistik, ialah orang yang sama. Label jenis menyembunyikan hal ini sepenuhnya; ini merupakan salah satu hujah yang lebih serius terhadap instrumen berasaskan jenis, dan sebab skor berterusan dengan ralat yang dinyatakan menjadi standard dalam penyelidikan.
Uji sendiri
Membaca tentang pengukuran adalah satu perkara. Melihat skor anda sendiri dilaporkan bersama sumbernya, sampel normanya dan batasannya adalah perkara lain. Percuma, tanpa perlu mendaftar.
Teruskan membaca
- Apakah itu psikometrik?Disiplin yang menentukan sama ada sesuatu pengukuran psikologi itu baik atau tidak, dan sebab dua ujian yang mengemukakan soalan serupa boleh berbeza dengan ketara dari segi nilai keputusannya.
- Apakah itu kebolehpercayaan dalam ujian psikologi?Kebolehpercayaan ialah ketekalan pengukuran, bukan ketepatan. Sesuatu ujian boleh mempunyai kebolehpercayaan yang tinggi tetapi masih mengukur perkara yang salah; itulah sebabnya ia merupakan soalan pertama yang ditanya dan tidak pernah yang terakhir.
- Apakah itu kesahan dalam ujian psikologi?Kesahan bukanlah sifat yang dimiliki oleh sesuatu ujian. Ia ialah hujah tentang sama ada tafsiran tertentu terhadap skor tertentu, bagi tujuan tertentu, boleh dipertahankan; dan ia perlu dibina semula bagi setiap kegunaan baharu.
- Apakah itu kesahan konstruk?Soalan paling sukar dalam pengukuran: sama ada perkara yang anda ukur benar-benar wujud seperti yang anda takrifkan, dan sama ada instrumen anda mencapainya dan bukan sesuatu yang berdekatan dengannya.
- Kesahan konvergen dan diskriminanDua keperluan yang saling bercermin: sesuatu ukuran mesti selari dengan apa yang sepatutnya selari dengannya, dan mesti kekal berbeza daripada apa yang didakwa bukan dirinya. Kebanyakan instrumen yang lemah gagal memenuhi keperluan yang kedua.
- Apakah itu alfa Cronbach, dan apakah yang bukanStatistik yang paling kerap dilaporkan dalam ujian psikologi, dan yang paling kerap disalah tafsir. Alfa tidak memberitahu anda bahawa sesuatu skala itu unidimensi, dan nilai yang tinggi sering kali merupakan simptom dan bukannya kelebihan.
- Norma dan persentil: apakah perbandingan bagi skor andaSkor mentah tidak dapat ditafsirkan dengan sendirinya. Ia hanya menjadi bermakna apabila dibandingkan dengan kumpulan rujukan, dan kumpulan yang digunakan merupakan salah satu fakta paling penting tetapi paling jarang dinyatakan tentang mana-mana ujian.
- Bagaimana ujian psikometrik sebenarnya dibinaDaripada definisi konstruk hingga norma yang diterbitkan, urutan ini mengambil masa bertahun-tahun dan membuang sebahagian besar daripada apa yang dimasukkan ke dalamnya. Dengan mengetahui langkah-langkahnya, jelaslah langkah mana yang dilangkau oleh kuiz dalam talian yang ringkas.
- Apakah maksudnya apabila sesuatu ujian dikatakan telah disahkan?Perkataan ini tidak dikawal selia dan digunakan sesuka hati oleh produk yang tidak melakukan sebarang usaha tersebut. Berikut ialah maksudnya apabila ia benar-benar bermakna, serta empat soalan yang membezakan kedua-dua keadaan itu.
- Mengapa kebanyakan ujian personaliti di internet tidak boleh dipercayaiBukan kerana mereka tidak jujur, tetapi kerana langkah-langkah yang menjadikan sesuatu pengukuran boleh dipercayai tidak kelihatan, mahal dan mudah diabaikan; dan mengabaikannya tidak mengubah apa-apa tentang rupa keputusan tersebut.
- Apa yang boleh dan tidak boleh diukur oleh laporan kendiriSoal selidik meminta anda menjadi pemerhati diri sendiri, dan cara ini lebih berkesan untuk sesetengah perkara berbanding yang lain. Mengetahui di mana kaedah ini kuat dan di mana ia gagal akan mengubah cara anda membaca sebarang keputusan.
- Apakah maksudnya apabila sesuatu ujian meramalkan sesuatuKorelasi 0.30 ialah dapatan yang kukuh dalam penyelidikan personaliti tetapi asas yang lemah untuk membuat keputusan tentang seseorang individu. Kedua-dua kenyataan ini benar, dan jurang antara keduanya menjadi punca kebanyakan penyalahgunaan keputusan ujian.
- Saringan bukan diagnosisSoal selidik saringan dibina untuk mengesan sebanyak mungkin kes yang berkemungkinan, dengan menerima kadar positif palsu yang tinggi sebagai harganya. Membaca skor saringan sebagai diagnosis adalah bertentangan dengan tujuan asal reka bentuknya.