Mengapa kebanyakan ujian personaliti di internet tidak boleh dipercayai
Bukan kerana mereka tidak jujur, tetapi kerana langkah-langkah yang menjadikan sesuatu pengukuran boleh dipercayai tidak kelihatan, mahal dan mudah diabaikan; dan mengabaikannya tidak mengubah apa-apa tentang rupa keputusan tersebut.
Ujian personaliti percuma dalam talian dan instrumen psikometrik yang telah disahkan menghasilkan output yang kelihatan sama: satu skor, satu persentil, satu perenggan yang menerangkan diri anda. Perbezaannya terletak sepenuhnya pada kerja yang tidak dapat anda lihat daripada skrin keputusan.
Perkara ini wajar dihuraikan dengan tepat, kerana tanggapan biasa, iaitu bahawa ujian di internet adalah penipuan, kebanyakannya salah dan tidak begitu berguna. Kebanyakannya dibuat oleh orang yang tidak berniat untuk menipu. Ujian tersebut tidak boleh dipercayai atas sebab struktur.
Perkara yang biasanya diabaikan
Analisis item. Dalam skala yang dibina dengan betul, kebanyakan item yang didrafkan akan dibuang selepas kajian rintis: item yang jawapannya tidak berbeza antara responden, item yang berkorelasi lemah dengan jumlah keseluruhan, item yang bermuatan pada lebih daripada satu faktor, dan item yang berkelakuan berbeza merentas kumpulan umur atau bahasa. Ujian yang ditulis dan diterbitkan tanpa kajian rintis telah mengekalkan semuanya, termasuk item yang tidak berfungsi.
Pengesahan struktur secara bebas. Analisis faktor ke atas data yang digunakan untuk membina skala akan memperoleh semula struktur yang anda reka. Mengesahkannya dalam sampel baharu merupakan kajian yang berasingan, dan inilah langkah di mana sebahagian besar skala gagal.
Norma. Persentil mesti datang dari suatu sumber. Jika laman web tersebut tidak menyatakan populasi rujukannya, angka itu diperoleh sama ada daripada pelawat terdahulu, iaitu kumpulan yang memilih diri sendiri dengan komposisi yang tidak diketahui, ataupun tidak daripada apa-apa sumber yang khusus.
Data uji-ulang uji. Untuk membuktikan bahawa seseorang memperoleh skor yang sama pada bulan berikutnya, mereka perlu ditemui semula. Hampir tiada sesiapa yang melakukan perkara ini, yang bermakna kestabilan yang tersirat dalam perkataan "sifat" belum dibuktikan.
Insentif reka bentuk bergerak ke arah yang salah
Ujian yang dibina untuk penglibatan dioptimumkan bagi hasil yang berbeza daripada ujian yang dibina untuk ketepatan, dan kedua-duanya menyimpang dengan cara yang boleh dijangka.
Keputusan yang menyanjung berprestasi lebih baik. Keputusan yang memberitahu anda sesuatu yang tidak menyenangkan kurang dikongsi, jadi keputusan cenderung beralih kepada gambaran yang dikenali oleh semua orang dalam diri mereka. Inilah kesan Barnum, yang telah dibuktikan pada tahun 1940-an dan dihasilkan semula secara konsisten sejak itu: orang menilai penerangan personaliti yang umum sebagai sangat tepat tentang diri mereka secara khusus.
Jenis berprestasi lebih baik daripada dimensi. "Anda seorang Arkitek" lebih mudah dikongsi berbanding "anda berada pada persentil ke-68 bagi keterbukaan dengan selang keyakinan yang luas". Jenis juga menyembunyikan ralat pengukuran, kerana seseorang yang berada satu mata di kiri atau kanan sempadan sesuatu kategori menerima label yang sama sekali berbeza.
Pendek berprestasi lebih baik daripada memadai. Setiap soalan tambahan menyebabkan kehilangan responden, jadi ujian dipendekkan kepada panjang yang memaksimumkan kadar penyiapan, bukannya panjang yang merangkumi konstruk tersebut.
Tiada satu pun daripada ini merupakan pembohongan. Semuanya ialah pengoptimuman untuk metrik selain ketepatan.
Cara mengenal pasti dalam masa kira-kira tiga puluh saat
Cari instrumen sumber yang dinamakan berserta pengarang dan tahunnya. Cari kenyataan tentang populasi asal norma tersebut. Cari sebarang pengakuan tentang batasan atau ralat pengukuran. Lihat sama ada keputusannya ialah skor berterusan atau satu kategori. Lihat sama ada halaman yang sama turut menjanjikan untuk mengenal pasti kerjaya, pasangan atau tujuan hidup ideal anda daripada dua puluh soalan.
Ujian yang menamakan instrumennya, memetik sumbernya, menyatakan normanya dan menyatakan perkara yang tidak dapat diberitahunya kepada anda telah melakukan kerja tersebut. Ujian yang tidak melakukan semua itu mungkin masih merupakan cara yang menyeronokkan untuk menghabiskan lima minit, tetapi angka yang dihasilkannya hanyalah hiasan.
Setiap instrumen dalam katalog NOESIS menyatakan ujian terbitan yang dilaksanakannya, siapa yang menulisnya, pada tahun berapa, bagaimana ia diskor, dan perkara yang tidak dapat dibuktikan oleh keputusannya. Bahagian terakhir itulah yang wajar dibandingkan.
Uji sendiri
Membaca tentang pengukuran adalah satu perkara. Melihat skor anda sendiri dilaporkan bersama sumbernya, sampel normanya dan batasannya adalah perkara lain. Percuma, tanpa perlu mendaftar.
Teruskan membaca
- Apakah itu psikometrik?Disiplin yang menentukan sama ada sesuatu pengukuran psikologi itu baik atau tidak, dan sebab dua ujian yang mengemukakan soalan serupa boleh berbeza dengan ketara dari segi nilai keputusannya.
- Apakah itu kebolehpercayaan dalam ujian psikologi?Kebolehpercayaan ialah ketekalan pengukuran, bukan ketepatan. Sesuatu ujian boleh mempunyai kebolehpercayaan yang tinggi tetapi masih mengukur perkara yang salah; itulah sebabnya ia merupakan soalan pertama yang ditanya dan tidak pernah yang terakhir.
- Apakah itu kesahan dalam ujian psikologi?Kesahan bukanlah sifat yang dimiliki oleh sesuatu ujian. Ia ialah hujah tentang sama ada tafsiran tertentu terhadap skor tertentu, bagi tujuan tertentu, boleh dipertahankan; dan ia perlu dibina semula bagi setiap kegunaan baharu.
- Apakah itu kesahan konstruk?Soalan paling sukar dalam pengukuran: sama ada perkara yang anda ukur benar-benar wujud seperti yang anda takrifkan, dan sama ada instrumen anda mencapainya dan bukan sesuatu yang berdekatan dengannya.
- Kesahan konvergen dan diskriminanDua keperluan yang saling bercermin: sesuatu ukuran mesti selari dengan apa yang sepatutnya selari dengannya, dan mesti kekal berbeza daripada apa yang didakwa bukan dirinya. Kebanyakan instrumen yang lemah gagal memenuhi keperluan yang kedua.
- Apakah itu alfa Cronbach, dan apakah yang bukanStatistik yang paling kerap dilaporkan dalam ujian psikologi, dan yang paling kerap disalah tafsir. Alfa tidak memberitahu anda bahawa sesuatu skala itu unidimensi, dan nilai yang tinggi sering kali merupakan simptom dan bukannya kelebihan.
- Ralat piawai pengukuran: sejauh mana skor anda mungkin tersasarSetiap skor membawa margin ralat, dan bagi kebanyakan ujian psikologi, margin ini lebih luas daripada yang disangka oleh orang ramai. Inilah nombor yang memberitahu anda bila sesuatu perbezaan itu benar dan bila ia hanya hingar.
- Norma dan persentil: apakah perbandingan bagi skor andaSkor mentah tidak dapat ditafsirkan dengan sendirinya. Ia hanya menjadi bermakna apabila dibandingkan dengan kumpulan rujukan, dan kumpulan yang digunakan merupakan salah satu fakta paling penting tetapi paling jarang dinyatakan tentang mana-mana ujian.
- Bagaimana ujian psikometrik sebenarnya dibinaDaripada definisi konstruk hingga norma yang diterbitkan, urutan ini mengambil masa bertahun-tahun dan membuang sebahagian besar daripada apa yang dimasukkan ke dalamnya. Dengan mengetahui langkah-langkahnya, jelaslah langkah mana yang dilangkau oleh kuiz dalam talian yang ringkas.
- Apakah maksudnya apabila sesuatu ujian dikatakan telah disahkan?Perkataan ini tidak dikawal selia dan digunakan sesuka hati oleh produk yang tidak melakukan sebarang usaha tersebut. Berikut ialah maksudnya apabila ia benar-benar bermakna, serta empat soalan yang membezakan kedua-dua keadaan itu.
- Apa yang boleh dan tidak boleh diukur oleh laporan kendiriSoal selidik meminta anda menjadi pemerhati diri sendiri, dan cara ini lebih berkesan untuk sesetengah perkara berbanding yang lain. Mengetahui di mana kaedah ini kuat dan di mana ia gagal akan mengubah cara anda membaca sebarang keputusan.
- Apakah maksudnya apabila sesuatu ujian meramalkan sesuatuKorelasi 0.30 ialah dapatan yang kukuh dalam penyelidikan personaliti tetapi asas yang lemah untuk membuat keputusan tentang seseorang individu. Kedua-dua kenyataan ini benar, dan jurang antara keduanya menjadi punca kebanyakan penyalahgunaan keputusan ujian.
- Saringan bukan diagnosisSoal selidik saringan dibina untuk mengesan sebanyak mungkin kes yang berkemungkinan, dengan menerima kadar positif palsu yang tinggi sebagai harganya. Membaca skor saringan sebagai diagnosis adalah bertentangan dengan tujuan asal reka bentuknya.