noesisnoesis
اندازه‌گیری چگونه کار می‌کند

خطای استاندارد اندازه‌گیری: میزان خطای احتمالی نمره شما

هر نمره‌ای با یک حاشیهٔ خطا همراه است و در بیشتر آزمون‌های روان‌شناختی این حاشیه از آنچه افراد تصور می‌کنند وسیع‌تر است. این همان عددی است که به شما می‌گوید یک تفاوت واقعی است یا فقط نوفه.

خطای استاندارد اندازه‌گیری، ضریب پایایی انتزاعی را به چیزی ملموس تبدیل می‌کند: یک بازهٔ بالا و پایین در اطراف نمره. این شاخص به پرسشی پاسخ می‌دهد که بیشتر صفحه‌های نتایج بی‌پاسخ می‌گذارند: اگر همین آزمون را بعدازظهر روز دیگری داده بودم، این عدد چقدر می‌توانست متفاوت باشد؟

فرمول ساده است. انحراف معیار مقیاس را در جذر یک منهای پایایی آن ضرب کنید. برای مقیاسی با انحراف معیار 10 و پایایی 0.85، خطای استاندارد حدود 3.9 نمره است.

این بازه واقعاً چه چیزی را پوشش می‌دهد

تقریباً در دو سوم موارد، جایگاه واقعی فرد در فاصلهٔ یک خطای استاندارد از نمرهٔ مشاهده‌شده‌اش قرار دارد. برای اطمینان حدود 95 درصد، به تقریباً دو خطای استاندارد در دو سو نیاز دارید.

مثال بالا را در نظر بگیرید. فردی نمرهٔ 62 می‌گیرد. بازهٔ اطمینان 95 درصدی تقریباً از 54 تا 70 است. این بازه‌ای شانزده‌نمره‌ای است، در مقیاسی که فاصلهٔ معمول میان «متوسط» و «به‌روشنی بالاتر از متوسط» ممکن است ده نمره باشد.

این نقصِ آن آزمون خاص نیست. پایایی 0.85 قابل‌قبول است. این همان دقت عادی اندازه‌گیری روان‌شناختی است و دلیل آن است که گزارش‌های دقیق، به‌جای یک نقطه، یک بازه ارائه می‌کنند.

پیامدهایی که مردم از آن‌ها غافل می‌شوند

تفاوت‌های کوچک میان مقیاس‌ها معمولاً بی‌معنی‌اند. اگر برون‌گرایی شما 58 و گشودگی شما 54 باشد، برداشت صادقانه این است که این دو از هم قابل تشخیص نیستند. تفسیرهای نیم‌رخی که از شکاف‌های چهارنمره‌ای روایتی می‌سازند، نوفه را می‌خوانند.

تغییرهای کوچک در طول زمان نیز معمولاً بی‌معنی‌اند. اگر آزمون را دوباره بدهید و پنج نمره جابه‌جا شوید، برای بیشتر ابزارها این تغییر در محدودهٔ خطاست. تغییر واقعی صفت در طول سال‌ها رخ می‌دهد و به‌صورت جابه‌جایی‌ای بسیار فراتر از بازهٔ خطا دیده می‌شود، نه چند نمره در هر ماه.

رتبه‌بندی‌ها مشکل را تشدید می‌کنند. تفاوت چند نمرهٔ خام می‌تواند فرد را در بخش متراکم میانی توزیع ده صدک جابه‌جا کند، چون بیشتر افراد همان‌جا قرار دارند. رتبه‌های درصدی دقیق به نظر می‌رسند، اما کم‌پایدارترین شیوه برای بیان یک نمره‌اند.

دقت در سراسر مقیاس یکنواخت نیست. نظریهٔ کلاسیک آزمون یک مقدار خطا را برای همهٔ نمره‌ها فرض می‌کند، که یک ساده‌سازی است. نظریهٔ پاسخ به گویه خطا را در هر سطح از صفت جداگانه مدل می‌کند، و این خطا تقریباً همیشه در دو سر طیف بزرگ‌تر است، یعنی دقیقاً همان‌جا که پرپیامدترین تفسیرها انجام می‌شود. نمرهٔ بسیار بالا یا بسیار پایین معمولاً کم‌دقت‌تر از نمرهٔ میانی است، نه دقیق‌تر.

چرا گزارش صادقانه کم‌جلوه‌تر به نظر می‌رسد

ابزاری که بازه‌های اطمینان گزارش می‌کند، مبهم‌تر از ابزاری به نظر می‌رسد که یک عدد را تا یک رقم اعشار اعلام می‌کند. ابزار مبهم‌تر حقیقت را می‌گوید. ابزار دقیق‌نما همان خطای زیربنایی را دارد و فقط تصمیم گرفته آن را نشان ندهد.

هنگام مقایسهٔ یک آزمون دارای مستندات علمی با یک محصول تجاری که شما را در یک دسته قرار می‌دهد، این نکته ارزش به یاد داشتن دارد. مرز دسته در یک نمرهٔ مشخص قرار دارد، و فردی که یک نمره پایین‌تر از آن است و فردی که یک نمره بالاتر از آن است، از نظر آماری همان یک نفرند. برچسب نوع این واقعیت را کاملاً پنهان می‌کند. این یکی از جدی‌ترین دلایل مخالفت با ابزارهای مبتنی بر نوع است، و دلیل آنکه نمره‌های پیوسته همراه با خطای اعلام‌شده در پژوهش معیار هستند.

خودتان را بیازمایید

خواندن دربارهٔ سنجش یک چیز است و دیدن نمرهٔ خودتان همراه با منبع، نمونهٔ هنجار و محدودیت‌هایش چیز دیگری. شرکت در آزمون رایگان است و نیازی به ثبت‌نام نیست.

ادامه مطالعه