ما هو معامل ألفا لكرونباخ: وما لا يمثله
الإحصائية الأكثر ذكراً في الاختبارات النفسية، والأكثر سوء فهم. معامل ألفا لا يُخبرك بأن المقياس أحادي البُعد، والقيمة المرتفعة غالباً ما تكون عرَضاً وليست ميزة.
معامل ألفا لكرونباخ هو معامل للاتساق الداخلي: درجة ارتباط بنود المقياس ببعضها البعض. نُشر عام 1951، وهو أكثر إحصائية سيكومترية يُستشهد بها على الإطلاق، وقد تجاوز انتشاره فائدته الفعلية.
تتراوح قيمة ألفا بين 0 و1، وتتحدد بعاملين: متوسط الارتباط بين البنود، وعدد البنود. وهذا الاعتماد الثاني هو مصدر معظم سوء الفهم.
ما لا تعنيه الدرجة المرتفعة لألفا
لا تعني أن المقياس يقيس شيئاً واحداً. هذا هو الخطأ الأكثر شيوعاً. يمكن أن تكون قيمة ألفا مرتفعة لمقياس يحتوي على عاملين أو ثلاثة عوامل متمايزة، شرط أن ترتبط البنود ببعضها بدرجة كافية بشكل عام. يجب إثبات أحادية البُعد عن طريق التحليل العاملي؛ فألفا لا يمكنها إثبات ذلك ولم تُصمَّم لهذا الغرض أصلاً.
لا تعني أن المقياس صادق. لا تخبرك ألفا بأي شيء عما تقيسه البنود فعلياً. فعشرون سؤالاً عن مقاس الحذاء قد تحقق اتساقاً داخلياً ممتازاً وصدقاً صفرياً كمقياس لأي شيء نفسي.
لا تعني أن المقياس جيد. ولأن قيمة ألفا ترتفع مع زيادة عدد البنود، فإن مقياساً طويلاً ببنود متواضعة قد يتفوق في درجته على مقياس قصير ببنود ممتازة. فمقياس من أربعين بنداً بمتوسط ارتباط بيني قدره 0.2 يصل إلى ما فوق 0.90.
القيمة المرتفعة جداً لألفا غالباً ما تكون علامة تحذير. فوق نحو 0.95، تكون البنود عادة إعادة صياغة متقاربة لبعضها. وهذا يحقق الاتساق على حساب تغطية البِنية: يقيس المقياس جانباً ضيقاً واحداً بدقة عالية ويفوّت باقي البِنية. يسمى هذا مفارقة التخافت (attenuation paradox)، وهو السبب في أن زيادة الاتساق ليست دائماً أفضل.
ما تفترضه
ألفا هي حد أدنى للثبات في ظل افتراض محدد، وهو التكافؤ التاوي (tau-equivalence)، أي أن كل بند يساهم بالتساوي في السمة الكامنة. ونادراً ما تحقق المقاييس الحقيقية هذا الافتراض. فالبنود تختلف في قوة تحميلها على العامل، وعندما يحدث ذلك، تُقلّل ألفا من تقدير الثبات الحقيقي.
يتخلى معامل أوميغا لماكدونالد عن افتراض المساهمة المتساوية ويُقدّر الثبات من تحميلات العامل الفعلية. وقد أوصى المتخصصون المنهجيون به بدلاً من ألفا منذ عقدين. لكن ممارسة إعداد التقارير كانت بطيئة في اتباع ذلك، ويرجع ذلك أساساً إلى أن ألفا سطر واحد في كل برنامج إحصائي بينما أوميغا ليست كذلك.
قراءتها في الممارسة العملية
قواعد تقريبية: 0.70 فما فوق مقبولة للأبحاث التي تقارن بين مجموعات، و0.80 فما فوق للاستخدام التطبيقي، و0.90 فما فوق حيث تؤثر الدرجة في قرار فردي. عامل هذه الأرقام كإطار توجيهي لا كحدود صارمة؛ فالمستوى المطلوب يتوقف على حجم المخاطر المرتبطة بالقرار الذي تستند إليه الدرجة.
غالباً ما تكون الأرقام الأكثر دلالة موجودة في مكان آخر من نفس الورقة البحثية. فمتوسط الارتباط البيني بين البنود (النطاق الصحي بين 0.15 و0.50) يخبرك ما إذا كانت قيمة ألفا المرتفعة نتيجة جودة البنود أو كثرتها. وعدد البنود يخبرك بالشيء نفسه من الجهة المعاكسة. وثبات إعادة الاختبار يخبرك بشيء لا تستطيع ألفا معرفته بِبنيتها: هل الدرجة مستقرة عند نفس الشخص مع مرور الوقت.
المقياس الذي يُقدِّم درجة ألفا فقط قد قدّم أسهل أرقام الثبات في الحصول عليها، وأقلها تطلباً في تجاوزها.
جرّب الأمر بنفسك
القراءة عن القياس شيء، ورؤية درجتك الخاصة موضّحة بمصدرها وعيّنتها المعيارية وحدودها شيء آخر. مجاني تماماً، دون حاجة إلى تسجيل.
استمر في القراءة
- ما هو علم القياس النفسي؟التخصص الذي يحدد ما إذا كان قياس نفسي جيداً أم لا، والسبب في أن اختبارين يطرحان أسئلة متشابهة قد يختلفان اختلافاً كبيراً في قيمة نتائجهما.
- ما هو الثبات في الاختبارات النفسية؟الثبات هو اتساق القياس، لا صحته. يمكن أن يكون الاختبار عالي الثبات ومع ذلك يقيس الشيء الخاطئ؛ وهذا هو السبب في أنه أول سؤال يُطرح وليس الأخير أبداً.
- ما هو الصدق في الاختبارات النفسية؟الصدق ليس خاصية يمتلكها الاختبار. إنه حجة حول ما إذا كان تفسير معين لدرجة معينة، لغرض معين، قابلاً للدفاع عنه؛ ويجب إعادة بنائه مع كل استخدام جديد.
- ما هو صدق البناء؟السؤال الأصعب في القياس: هل الشيء الذي تقيسه موجود كما عرّفته، وهل تصل أداتك إليه بدلاً من شيء مجاور له.
- الصدق التقاربي والصدق التمييزيشرطان متقابلان: يجب أن يتوافق المقياس مع ما ينبغي أن يتوافق معه، ويجب أن يبقى متمايزاً عما يزعم أنه ليسه. معظم الأدوات الضعيفة تفشل في الشرط الثاني.
- الخطأ المعياري للقياس: مقدار الانحراف المحتمل في درجتكتحمل كل درجة هامش خطأ، وفي معظم الاختبارات النفسية يكون هذا الهامش أوسع مما يفترضه الناس. هذا هو الرقم الذي يُخبرك متى يكون الفرق حقيقياً ومتى يكون مجرد تشويش.
- المعايير والمئينات: ما تُقارَن به درجتكلا يمكن تفسير الدرجة الخام بمفردها. فهي لا تصبح ذات معنى إلا بالمقارنة مع مجموعة مرجعية؛ وأي مجموعة استُخدمت هي من أهم الحقائق وأقلها إعلاناً بشأن أي اختبار.
- كيف يُبنى الاختبار السيكومتري في الواقعمن تعريف البِنية إلى نشر المعايير، تستغرق هذه السلسلة سنوات وتتخلص من معظم ما يدخل فيها. معرفة هذه الخطوات تجعل من الواضح أيها تجاوزه اختبار سريع على الإنترنت.
- ما المقصود بأن يكون الاختبار موثوق الصدق؟هذا المصطلح غير منظّم ويُستخدم بحرية من منتجات لم تقم بأي من العمل اللازم. هذا هو معناه عندما يكون له معنى، والأسئلة الأربعة التي تفصل بين الحالتين.
- لماذا لا تُعد معظم اختبارات الشخصية على الإنترنت موثوقةليس لأنها غير أمينة، بل لأن الخطوات التي تجعل القياس موثوقاً غير مرئية ومكلفة وسهلة التجاوز، وتجاوزها لا يغيّر شيئاً في شكل النتيجة الظاهر.
- ما يمكن للتقرير الذاتي قياسه وما لا يمكنه قياسهتطلب منك الاستبيانات أن تكون المراقب لنفسك، وهذا ينجح في بعض الأمور أكثر من غيرها. معرفة أين تكون هذه الطريقة قوية وأين تفشل تغيّر طريقة قراءتك لأي نتيجة.
- ماذا يعني أن يتنبأ اختبار بشيء مايُعد الارتباط بمقدار 0.30 نتيجة قوية في أبحاث الشخصية، وأساساً ضعيفاً لاتخاذ قرار بشأن شخص واحد. كلا القولين صحيح، والفجوة بينهما هي سبب معظم حالات سوء استخدام نتائج الاختبارات.
- الفحص المسحي ليس تشخيصًايُبنى استبيان الفحص لرصد أكبر عدد ممكن من الحالات المحتملة، متقبلاً معدل إيجابيات كاذبة مرتفعاً كثمن لذلك. قراءة درجة الفحص كتشخيص تعكس ما صُمم من أجله أصلاً.