Apakah itu alfa Cronbach, dan apakah yang bukan
Statistik yang paling kerap dilaporkan dalam ujian psikologi, dan yang paling kerap disalah tafsir. Alfa tidak memberitahu anda bahawa sesuatu skala itu unidimensi, dan nilai yang tinggi sering kali merupakan simptom dan bukannya kelebihan.
Alfa Cronbach ialah pekali ketekalan dalaman, iaitu sejauh mana item dalam sesuatu skala berkorelasi antara satu sama lain. Diterbitkan pada tahun 1951, ia merupakan statistik psikometrik yang paling kerap dilaporkan, dan kelazimannya telah melangkaui kegunaannya.
Alfa berjulat dari 0 hingga 1 dan dipengaruhi oleh dua perkara: purata korelasi antara item, dan bilangan item. Kebergantungan kedua inilah punca kebanyakan salah faham.
Apa yang tidak dimaksudkan oleh alfa yang tinggi
Ia tidak bermaksud skala mengukur satu perkara sahaja. Ini kesilapan yang paling lazim. Alfa boleh tinggi bagi skala yang mempunyai dua atau tiga faktor berbeza, asalkan item-itemnya cukup berkorelasi secara keseluruhan. Keunidimensian perlu dibuktikan melalui analisis faktor; alfa tidak dapat membuktikannya dan memang tidak pernah bertujuan untuk berbuat demikian.
Ia tidak bermaksud skala itu sah. Alfa tidak menyatakan apa-apa tentang apa yang diukur oleh item. Dua puluh soalan tentang saiz kasut akan mempunyai ketekalan dalaman yang cemerlang dan kesahan sifar sebagai ukuran apa-apa aspek psikologi.
Ia tidak bermaksud skala itu baik. Oleh sebab alfa meningkat seiring bilangan item, skala panjang yang terdiri daripada item biasa-biasa akan mendapat skor lebih tinggi daripada skala pendek yang terdiri daripada item cemerlang. Skala empat puluh item dengan purata korelasi antara item 0.2 mencapai nilai melebihi 0.90.
Alfa yang sangat tinggi sering menjadi amaran. Melebihi kira-kira 0.95, item-itemnya biasanya hampir merupakan parafrasa antara satu sama lain. Ini memberikan ketekalan dengan mengorbankan liputan konstruk: skala mengukur satu faset sempit dengan sangat tepat dan terlepas bahagian lain konstruk tersebut. Ini dinamakan paradoks atenuasi, dan inilah sebabnya ketekalan yang lebih tinggi tidak semestinya lebih baik secara monotonik.
Apa yang diandaikannya
Alfa ialah had bawah bagi kebolehpercayaan di bawah satu andaian khusus, iaitu kesetaraan tau, yang bermaksud setiap item menyumbang secara sama rata kepada sifat asas. Skala sebenar hampir tidak pernah memenuhi andaian ini. Item berbeza dari segi kekuatan muatannya pada faktor, dan apabila ini berlaku, alfa menganggarkan kebolehpercayaan lebih rendah daripada yang sebenar.
Omega McDonald menggugurkan andaian sumbangan sama rata dan menganggarkan kebolehpercayaan daripada muatan faktor yang sebenar. Ahli metodologi telah mengesyorkannya berbanding alfa selama dua dekad. Amalan pelaporan lambat mengikutinya, sebahagian besarnya kerana alfa hanya satu baris dalam setiap pakej statistik manakala omega tidak.
Membacanya dalam amalan
Konvensi kasar: 0.70 ke atas boleh diterima untuk penyelidikan yang membandingkan kumpulan, 0.80 ke atas untuk kegunaan gunaan, dan 0.90 ke atas apabila skor mempengaruhi keputusan tentang seseorang individu. Anggap nilai ini sebagai panduan, bukan ambang; tahap yang diperlukan bergantung pada kepentingan keputusan yang dimaklumkan oleh skor tersebut.
Angka yang lebih bermaklumat biasanya terdapat di bahagian lain dalam kertas yang sama. Purata korelasi antara item (0.15 hingga 0.50 ialah julat yang sihat) memberitahu anda sama ada alfa yang tinggi datang daripada kualiti item atau kuantiti item. Bilangan item memberitahu perkara yang sama dari arah yang bertentangan. Kebolehpercayaan uji-ulang uji memberitahu sesuatu yang secara struktur tidak dapat diberitahu oleh alfa: sama ada skor stabil bagi orang yang sama dari semasa ke semasa.
Skala yang melaporkan alfa sahaja telah melaporkan angka kebolehpercayaan yang paling mudah diperoleh, dan yang paling tidak menuntut untuk dilepasi.
Uji sendiri
Membaca tentang pengukuran adalah satu perkara. Melihat skor anda sendiri dilaporkan bersama sumbernya, sampel normanya dan batasannya adalah perkara lain. Percuma, tanpa perlu mendaftar.
Teruskan membaca
- Apakah itu psikometrik?Disiplin yang menentukan sama ada sesuatu pengukuran psikologi itu baik atau tidak, dan sebab dua ujian yang mengemukakan soalan serupa boleh berbeza dengan ketara dari segi nilai keputusannya.
- Apakah itu kebolehpercayaan dalam ujian psikologi?Kebolehpercayaan ialah ketekalan pengukuran, bukan ketepatan. Sesuatu ujian boleh mempunyai kebolehpercayaan yang tinggi tetapi masih mengukur perkara yang salah; itulah sebabnya ia merupakan soalan pertama yang ditanya dan tidak pernah yang terakhir.
- Apakah itu kesahan dalam ujian psikologi?Kesahan bukanlah sifat yang dimiliki oleh sesuatu ujian. Ia ialah hujah tentang sama ada tafsiran tertentu terhadap skor tertentu, bagi tujuan tertentu, boleh dipertahankan; dan ia perlu dibina semula bagi setiap kegunaan baharu.
- Apakah itu kesahan konstruk?Soalan paling sukar dalam pengukuran: sama ada perkara yang anda ukur benar-benar wujud seperti yang anda takrifkan, dan sama ada instrumen anda mencapainya dan bukan sesuatu yang berdekatan dengannya.
- Kesahan konvergen dan diskriminanDua keperluan yang saling bercermin: sesuatu ukuran mesti selari dengan apa yang sepatutnya selari dengannya, dan mesti kekal berbeza daripada apa yang didakwa bukan dirinya. Kebanyakan instrumen yang lemah gagal memenuhi keperluan yang kedua.
- Ralat piawai pengukuran: sejauh mana skor anda mungkin tersasarSetiap skor membawa margin ralat, dan bagi kebanyakan ujian psikologi, margin ini lebih luas daripada yang disangka oleh orang ramai. Inilah nombor yang memberitahu anda bila sesuatu perbezaan itu benar dan bila ia hanya hingar.
- Norma dan persentil: apakah perbandingan bagi skor andaSkor mentah tidak dapat ditafsirkan dengan sendirinya. Ia hanya menjadi bermakna apabila dibandingkan dengan kumpulan rujukan, dan kumpulan yang digunakan merupakan salah satu fakta paling penting tetapi paling jarang dinyatakan tentang mana-mana ujian.
- Bagaimana ujian psikometrik sebenarnya dibinaDaripada definisi konstruk hingga norma yang diterbitkan, urutan ini mengambil masa bertahun-tahun dan membuang sebahagian besar daripada apa yang dimasukkan ke dalamnya. Dengan mengetahui langkah-langkahnya, jelaslah langkah mana yang dilangkau oleh kuiz dalam talian yang ringkas.
- Apakah maksudnya apabila sesuatu ujian dikatakan telah disahkan?Perkataan ini tidak dikawal selia dan digunakan sesuka hati oleh produk yang tidak melakukan sebarang usaha tersebut. Berikut ialah maksudnya apabila ia benar-benar bermakna, serta empat soalan yang membezakan kedua-dua keadaan itu.
- Mengapa kebanyakan ujian personaliti di internet tidak boleh dipercayaiBukan kerana mereka tidak jujur, tetapi kerana langkah-langkah yang menjadikan sesuatu pengukuran boleh dipercayai tidak kelihatan, mahal dan mudah diabaikan; dan mengabaikannya tidak mengubah apa-apa tentang rupa keputusan tersebut.
- Apa yang boleh dan tidak boleh diukur oleh laporan kendiriSoal selidik meminta anda menjadi pemerhati diri sendiri, dan cara ini lebih berkesan untuk sesetengah perkara berbanding yang lain. Mengetahui di mana kaedah ini kuat dan di mana ia gagal akan mengubah cara anda membaca sebarang keputusan.
- Apakah maksudnya apabila sesuatu ujian meramalkan sesuatuKorelasi 0.30 ialah dapatan yang kukuh dalam penyelidikan personaliti tetapi asas yang lemah untuk membuat keputusan tentang seseorang individu. Kedua-dua kenyataan ini benar, dan jurang antara keduanya menjadi punca kebanyakan penyalahgunaan keputusan ujian.
- Saringan bukan diagnosisSoal selidik saringan dibina untuk mengesan sebanyak mungkin kes yang berkemungkinan, dengan menerima kadar positif palsu yang tinggi sebagai harganya. Membaca skor saringan sebagai diagnosis adalah bertentangan dengan tujuan asal reka bentuknya.