Mengapa sebagian besar tes personalitas di internet tidak andal
Bukan karena mereka tidak jujur, melainkan karena langkah-langkah yang membuat sebuah pengukuran dapat dipercaya bersifat tidak terlihat, mahal, dan mudah dilewati, dan melewatinya tidak mengubah apa pun dari tampilan hasilnya.
Tes kepribadian gratis daring dan instrumen psikometrik yang tervalidasi menghasilkan keluaran yang tampak identik: sebuah skor, sebuah persentil, sebuah paragraf yang menggambarkan diri Anda. Perbedaannya sepenuhnya terletak pada pekerjaan yang tidak dapat Anda lihat dari layar hasil.
Hal ini layak diperjelas, sebab kerangka umum, bahwa tes internet adalah penipuan, sebagian besar keliru dan kurang berguna. Sebagian besar dibuat oleh orang-orang tanpa niat menipu. Tes-tes ini tidak andal karena alasan struktural.
Apa yang biasanya dilewatkan
Analisis butir. Dalam skala yang dibangun dengan tepat, sebagian besar butir yang disusun dibuang setelah uji coba: butir yang tidak menunjukkan variasi pada siapa pun, butir yang berkorelasi rendah dengan skor total, butir yang bermuatan pada lebih dari satu faktor, butir yang berperilaku berbeda antar kelompok usia atau bahasa. Sebuah tes yang ditulis dan dipublikasikan tanpa uji coba tetap mempertahankan semuanya, termasuk butir-butir yang tidak berfungsi.
Konfirmasi struktural independen. Analisis faktor pada data yang digunakan untuk membangun skala akan memunculkan kembali struktur yang telah Anda rancang. Mengonfirmasinya pada sampel baru merupakan studi tersendiri, dan inilah tahap di mana sebagian besar skala gagal.
Norma. Persentil harus berasal dari suatu sumber. Jika situs tidak menyatakan populasi acuannya, angka tersebut diturunkan baik dari pengunjung sebelumnya, yaitu kelompok yang memilih sendiri dengan komposisi yang tidak diketahui, atau tidak berasal dari mana pun yang jelas.
Data tes ulang. Untuk memastikan bahwa orang memperoleh skor yang sama bulan berikutnya, mereka harus ditemukan kembali. Hampir tidak ada yang melakukan hal ini, yang berarti stabilitas yang tersirat dalam kata "sifat" belum terbukti.
Insentif desain berjalan ke arah yang salah
Tes yang dibangun untuk keterlibatan dioptimalkan untuk hasil yang berbeda dari tes yang dibangun untuk keakuratan, dan keduanya berpisah dengan cara yang dapat diprediksi.
Hasil yang menyenangkan berkinerja lebih baik. Hasil yang menyampaikan sesuatu yang tidak menyenangkan lebih jarang dibagikan, sehingga hasil cenderung bergeser ke arah deskripsi yang dikenali semua orang pada dirinya sendiri. Ini adalah efek Barnum, yang dibuktikan pada tahun 1940-an dan terus direproduksi secara konsisten sejak itu: orang menilai deskripsi kepribadian yang umum sebagai sangat akurat tentang diri mereka secara khusus.
Tipe berkinerja lebih baik daripada dimensi. "Anda adalah seorang Arsitek" lebih mudah dibagikan daripada "Anda berada di persentil ke-68 pada keterbukaan dengan interval kepercayaan yang lebar". Tipe juga menyembunyikan kesalahan pengukuran, karena seseorang yang berada satu poin di kedua sisi batas kategori menerima label yang sepenuhnya berbeda.
Yang singkat berkinerja lebih baik daripada yang memadai. Setiap pertanyaan tambahan kehilangan responden, sehingga tes dipotong hingga panjang yang memaksimalkan penyelesaian, bukan yang mencakup konstruk secara memadai.
Tidak satu pun dari ini adalah kebohongan. Semuanya adalah optimasi untuk metrik selain keakuratan.
Cara mengenalinya dalam waktu sekitar tiga puluh detik
Carilah instrumen sumber yang disebutkan namanya, lengkap dengan penulis dan tahun. Carilah pernyataan tentang populasi mana yang menjadi dasar norma tersebut. Carilah pengakuan apa pun mengenai keterbatasan atau kesalahan pengukuran. Perhatikan apakah hasilnya berupa skor kontinu atau kategori. Perhatikan apakah halaman yang sama juga menjanjikan untuk mengidentifikasi karier, pasangan, atau tujuan hidup ideal Anda hanya dari dua puluh pertanyaan.
Tes yang menyebutkan nama instrumennya, mengutip sumbernya, menyatakan normanya, dan menjelaskan apa yang tidak dapat diungkapkannya telah melakukan pekerjaan tersebut dengan benar. Tes yang tidak melakukan hal-hal itu mungkin tetap menjadi cara yang menyenangkan untuk menghabiskan waktu lima menit, tetapi angka yang dihasilkannya hanyalah hiasan.
Setiap instrumen dalam katalog NOESIS menyatakan tes terbit mana yang diterapkannya, siapa penulisnya, pada tahun berapa, bagaimana cara penilaiannya, dan apa yang tidak dapat dibuktikan oleh hasilnya. Bagian terakhir itulah yang layak dibandingkan.
Ujilah sendiri
Membaca tentang pengukuran adalah satu hal. Melihat skor Anda sendiri dilaporkan lengkap dengan sumbernya, sampel normanya, dan batasannya adalah hal lain. Gratis untuk diikuti, tanpa perlu mendaftar.
Lanjutkan membaca
- Apa itu psikometri?Disiplin ilmu yang menentukan apakah sebuah pengukuran psikologis benar-benar baik, dan alasan mengapa dua tes yang menanyakan pertanyaan serupa dapat sangat berbeda dalam nilai hasilnya.
- Apa itu reliabilitas dalam pengujian psikologis?Reliabilitas adalah konsistensi pengukuran, bukan kebenaran. Sebuah tes bisa sangat reliabel namun tetap mengukur hal yang salah, itulah sebabnya reliabilitas menjadi pertanyaan pertama yang diajukan dan tidak pernah menjadi yang terakhir.
- Apa itu validitas dalam tes psikologi?Validitas bukanlah suatu properti yang dimiliki sebuah tes. Validitas adalah argumen tentang apakah interpretasi tertentu terhadap skor tertentu, untuk tujuan tertentu, dapat dipertahankan, dan argumen ini harus dibangun kembali untuk setiap penggunaan baru.
- Apa itu validitas konstruk?Pertanyaan tersulit dalam pengukuran: apakah hal yang Anda ukur benar-benar ada sebagaimana Anda definisikan, dan apakah instrumen Anda menjangkau hal itu, bukan sesuatu yang berdekatan dengannya.
- Validitas konvergen dan diskriminanDua persyaratan yang saling berlawanan: sebuah alat ukur harus sesuai dengan apa yang seharusnya sesuai, dan harus tetap berbeda dari apa yang diklaimnya bukan. Sebagian besar instrumen yang lemah gagal pada persyaratan kedua.
- Apa itu alpha Cronbach, dan apa yang bukanStatistik yang paling sering dilaporkan dalam pengujian psikologis, dan yang paling sering disalahpahami. Alpha tidak memberi tahu Anda bahwa sebuah skala bersifat unidimensional, dan nilai yang tinggi seringkali merupakan gejala, bukan kelebihan.
- Kesalahan standar pengukuran: seberapa besar skor Anda dapat melesetSetiap skor membawa margin kesalahan, dan untuk sebagian besar tes psikologis margin ini lebih lebar dari yang diperkirakan orang. Inilah angka yang memberi tahu Anda kapan sebuah perbedaan itu nyata dan kapan hanya berupa noise.
- Norma dan persentil: pembanding untuk skor AndaSkor mentah tidak dapat diinterpretasikan dengan sendirinya. Skor tersebut menjadi bermakna hanya jika dibandingkan dengan kelompok acuan, dan kelompok mana yang digunakan merupakan salah satu fakta paling berpengaruh sekaligus paling jarang diungkapkan tentang sebuah tes.
- Bagaimana tes psikometri sebenarnya dibangunDari definisi konstruk hingga norma yang dipublikasikan, urutan ini memakan waktu bertahun-tahun dan membuang sebagian besar dari apa yang dimasukkan ke dalamnya. Mengetahui langkah-langkahnya membuat jelas mana saja yang dilewati oleh sebuah kuis daring cepat.
- Apa artinya ketika suatu tes disebut tervalidasi?Istilah ini tidak diatur dan digunakan secara bebas oleh produk-produk yang belum melakukan pekerjaan apa pun untuk itu. Berikut adalah artinya ketika istilah ini benar-benar bermakna, dan empat pertanyaan yang membedakan kedua kasus tersebut.
- Apa yang dapat dan tidak dapat diukur oleh laporan diriKuesioner meminta Anda menjadi pengamat bagi diri Anda sendiri, yang bekerja lebih baik untuk sebagian hal dibandingkan hal lainnya. Mengetahui di mana metode ini kuat dan di mana ia gagal mengubah cara Anda membaca hasil apa pun.
- Apa artinya ketika sebuah tes memprediksi sesuatuKorelasi sebesar 0,30 merupakan temuan yang kuat dalam penelitian kepribadian, tetapi merupakan dasar yang lemah untuk mengambil keputusan tentang satu orang. Kedua pernyataan ini benar, dan celah di antara keduanya menjadi penyebab sebagian besar penyalahgunaan hasil tes.
- Penyaringan bukanlah diagnosisKuesioner penyaringan dibuat untuk menangkap sebanyak mungkin kemungkinan kasus, dengan menerima tingkat positif palsu yang tinggi sebagai konsekuensinya. Membaca skor penyaringan sebagai diagnosis membalikkan tujuan awal alat tersebut.