noesisnoesis
Bagaimana pengukuran bekerja

Kesalahan standar pengukuran: seberapa besar skor Anda dapat meleset

Setiap skor membawa margin kesalahan, dan untuk sebagian besar tes psikologis margin ini lebih lebar dari yang diperkirakan orang. Inilah angka yang memberi tahu Anda kapan sebuah perbedaan itu nyata dan kapan hanya berupa noise.

Standar kesalahan pengukuran (standard error of measurement) mengubah koefisien reliabilitas yang abstrak menjadi sesuatu yang konkret: rentang plus-minus di sekitar sebuah skor. Ia menjawab pertanyaan yang paling sering tidak terjawab pada layar hasil tes, yaitu seberapa besar angka ini bisa berbeda seandainya Anda mengikuti tes tersebut pada sore hari yang lain?

Rumusnya sederhana. Kalikan simpangan baku skala dengan akar kuadrat dari satu dikurangi reliabilitasnya. Untuk skala dengan simpangan baku 10 dan reliabilitas 0,85, standar kesalahannya sekitar 3,9 poin.

Apa sebenarnya yang dicakup rentang tersebut

Kurang lebih dua pertiga dari waktu, posisi sesungguhnya seseorang berada dalam rentang satu standar kesalahan dari skor yang diamati. Untuk memperoleh keyakinan sekitar 95 persen, Anda memerlukan kurang lebih dua standar kesalahan di kedua sisi.

Ambil contoh di atas. Seseorang memperoleh skor 62. Interval 95 persen berkisar dari sekitar 54 hingga 70. Itu adalah rentang enam belas poin pada skala yang selisih khasnya antara rata-rata dan jelas-di-atas-rata-rata mungkin hanya sepuluh poin.

Ini bukan cacat dari tes tertentu tersebut. Reliabilitas 0,85 sudah cukup baik. Ini adalah presisi normal dalam pengukuran psikologis, dan itulah sebabnya laporan yang cermat menyajikan rentang, bukan titik tunggal.

Konsekuensi yang sering terlewat

Perbedaan kecil antarskala biasanya tidak bermakna. Jika skor ekstraversi Anda 58 dan keterbukaan Anda 54, pembacaan yang jujur adalah bahwa keduanya tidak dapat dibedakan. Interpretasi profil yang membangun narasi dari selisih empat poin sesungguhnya sedang membaca derau (noise).

Perubahan kecil dari waktu ke waktu juga biasanya tidak bermakna. Mengulang tes dan bergeser lima poin masih berada dalam batas kesalahan untuk sebagian besar instrumen. Perubahan sifat yang nyata terjadi selama bertahun-tahun dan muncul sebagai pergeseran yang jauh melampaui rentang kesalahan, bukan sebagai selisih beberapa poin dari bulan ke bulan.

Urutan peringkat memperbesar masalah ini. Perbedaan beberapa poin mentah dapat menggeser seseorang sepuluh peringkat persentil di bagian tengah distribusi yang padat, karena di situlah sebagian besar orang berada. Peringkat persentil tampak presisi padahal justru cara paling tidak stabil untuk menyatakan sebuah skor.

Presisi tidak seragam di sepanjang skala. Teori tes klasik mengasumsikan satu nilai kesalahan untuk setiap skor, yang merupakan penyederhanaan. Teori respons butir (item response theory) memodelkan kesalahan secara terpisah pada setiap tingkat sifat, dan kesalahan ini hampir selalu lebih besar pada nilai-nilai ekstrem, yaitu justru di titik-titik tempat interpretasi paling berdampak dibuat. Skor yang sangat tinggi atau sangat rendah biasanya kurang presisi dibandingkan skor menengah, bukan sebaliknya.

Mengapa pelaporan yang jujur tampak kurang mengesankan

Instrumen yang melaporkan rentang keyakinan tampak lebih kabur dibandingkan instrumen yang melaporkan satu angka tunggal hingga satu desimal. Yang tampak kabur itulah yang menyampaikan kebenaran. Yang tampak presisi memiliki kesalahan mendasar yang sama, hanya saja memilih untuk tidak menampilkannya.

Hal ini penting diingat ketika membandingkan tes yang terdokumentasi secara ilmiah dengan produk komersial yang menempatkan Anda ke dalam sebuah kategori. Batas kategori berada pada skor tertentu, dan seseorang yang satu poin di bawahnya dengan seseorang yang satu poin di atasnya, secara statistik, adalah orang yang sama. Label tipe menyembunyikan hal ini sepenuhnya, dan inilah salah satu argumen paling serius terhadap instrumen berbasis tipe, serta alasan mengapa skor kontinu dengan kesalahan yang dinyatakan secara eksplisit menjadi standar dalam penelitian.

Ujilah sendiri

Membaca tentang pengukuran adalah satu hal. Melihat skor Anda sendiri dilaporkan lengkap dengan sumbernya, sampel normanya, dan batasannya adalah hal lain. Gratis untuk diikuti, tanpa perlu mendaftar.

Lanjutkan membaca

Kesalahan standar pengukuran: seberapa besar skor Anda dapat meleset | NOESIS