كيف يُبنى الاختبار السيكومتري في الواقع
من تعريف البِنية إلى نشر المعايير، تستغرق هذه السلسلة سنوات وتتخلص من معظم ما يدخل فيها. معرفة هذه الخطوات تجعل من الواضح أيها تجاوزه اختبار سريع على الإنترنت.
إن الأداة السيكومترية التي تصل إلى مرحلة النشر تكون قد مرت عادةً بخمس أو ست سنوات من العمل، وطُرح معظم ما كُتب من أجلها. وهذا التسلسل يستحق أن يُعرف، لأن كل مرحلة منه تقابل طريقة يمكن أن يكون الاختبار فيها قاصرًا.
1. تعريف السمة المقاسة
قبل كتابة أي بند، يجب تحديد السمة المقاسة بدقة تكفي لتحديد ما يقع خارج نطاقها. وهذا يعني وضع تعريف، وبيان للبنية البُعدية (بُعد واحد أو عدة أبعاد، وإذا تعددت فكيف تترابط)، وتوضيح صريح للسمات المجاورة التي يُقصد أن يتميز عنها.
وتخطي هذه المرحلة هو أصل معظم الأدوات المكررة. فالمقياس المبني على حس بديهي لمفهوم ما ينتهي غالبًا بقياس سمة راسخة تحت اسم جديد.
2. توليد مجموعة من البنود
تُصاغ البنود بعدد يفوق كثيرًا ما سيبقى منها، عادةً بمعدل ثلاثة إلى خمسة أضعاف العدد النهائي. وتُستمد من النظرية، ومن أدوات قائمة، ومن مقابلات مع أشخاص لديهم الخبرة الموصوفة، ومن خبراء في الموضوع.
وفي هذه المرحلة تُراجَع المجموعة من حيث تغطية المحتوى (هل تشمل السمة بأكملها أم تتركز على جانب واحد؟)، ومستوى القراءة، والصياغة المزدوجة المعنى، والبنود التي تسأل في الحقيقة عن شيء آخر.
3. التجربة الاستطلاعية والحذف
تُطبَّق المجموعة على عينة أولى. ويكون التحليل في معظمه إجراءً حذفيًا.
تُحذف البنود التي تكاد لا تُظهر أي تباين، لأن السؤال الذي يجيب عنه الجميع بالطريقة نفسها لا يميز أحدًا. وتُحذف البنود التي ترتبط ضعيفًا بالدرجة الكلية. وتُحذف البنود التي تتحمل على أكثر من عامل واحد. وتُحذف البنود التي تسلك سلوكًا مختلفًا بين الفئات السكانية لأسباب لا صلة لها بالسمة، وهو ما يُعرف بالأداء التفاضلي للبند، وهذا الفحص من أكثر الفحوص التي يتم تخطيها.
وما يبقى عادةً هو ثلث ما كُتب.
4. تأكيد البنية في عينة جديدة
هذه هي الخطوة التي تفصل الأدوات الجادة عن غيرها. فالتحليل العاملي على عينة التطوير سيستخرج البنية التي صُممت أصلًا، لأن البنود اختيرت لتحقيقها. والاختبار الحقيقي هو التحليل العاملي التوكيدي في عينة مستقلة.
إن عددًا كبيرًا من المقاييس المنشورة لا تستعيد بنيتها المقصودة إلا في البيانات التي استُخدمت لبنائها. فإذا جمع شخص آخر بيانات جديدة، لا تظهر العوامل. وهذا الفشل شائع بقدر يكفي لجعل سؤال «هل تم تأكيد البنية في عينة مستقلة؟» من أكثر الأسئلة كفاءة التي تُطرح حول أي أداة.
5. تجميع شواهد الصدق
الارتباطات بمقاييس راسخة لنفس السمة المقاسة. والارتباطات بسمات ينبغي أن يتميز عنها، والتي من الأفضل أن تكون أضعف. والعلاقات مع نتائج ذات أهمية. والصدق التزايدي على ما هو موجود أصلًا. وثبات الاختبار وإعادة الاختبار على مدى فترة زمنية مناسبة للسمة المقاسة.
ولا تنتهي هذه المرحلة أبدًا. فهي تستمر طوال فترة استخدام الأداة، وفيها غالبًا ما يتضح قصور الأدوات بعد سنوات من نشرها.
6. بناء المعايير
عينة مرجعية كبيرة بما يكفي وممثلة بما يكفي للفئة المستهدفة، مصنفة حيث تتفاوت السمة بحسب العمر أو الجنس، وموثقة من حيث سنة الجمع والبلد. ثم تُعاد بشكل دوري، لأن المعايير تتغير مع الزمن.
7. الترجمة، إن كان سيُستخدم الاختبار في مكان آخر
الترجمة ليست تمرينًا لغويًا. فالتكييف السليم يعني ترجمة أمامية، وترجمة عكسية مستقلة، ومراجعة من خبراء، ومقابلات معرفية مع متحدثي اللغة الهدف، ثم دراسة سيكومترية جديدة باللغة الجديدة لاختبار ما إذا كانت البنية تصمد وما إذا كانت البنود تعمل بشكل متكافئ. والأداة المترجَمة دون هذه الدراسة هي أداة غير مختبرة في تلك اللغة، بصرف النظر عن مصداقيتها في الأصل.
ما يترتب على ذلك بخصوص الاختبار السريع
الاختبار المكتوب في فترة بعد ظهر واحدة أكمل الخطوة الثانية فقط. وقد يُنتج فعلًا نتيجة تبدو معقولة، ومئينًا وفقرة من الوصف. لكن الخطوات التي تخطاها هي بالضبط ما كان سيثبت هل لأي من ذلك معنى فعلًا.
جرّب الأمر بنفسك
القراءة عن القياس شيء، ورؤية درجتك الخاصة موضّحة بمصدرها وعيّنتها المعيارية وحدودها شيء آخر. مجاني تماماً، دون حاجة إلى تسجيل.
استمر في القراءة
- ما هو علم القياس النفسي؟التخصص الذي يحدد ما إذا كان قياس نفسي جيداً أم لا، والسبب في أن اختبارين يطرحان أسئلة متشابهة قد يختلفان اختلافاً كبيراً في قيمة نتائجهما.
- ما هو الثبات في الاختبارات النفسية؟الثبات هو اتساق القياس، لا صحته. يمكن أن يكون الاختبار عالي الثبات ومع ذلك يقيس الشيء الخاطئ؛ وهذا هو السبب في أنه أول سؤال يُطرح وليس الأخير أبداً.
- ما هو الصدق في الاختبارات النفسية؟الصدق ليس خاصية يمتلكها الاختبار. إنه حجة حول ما إذا كان تفسير معين لدرجة معينة، لغرض معين، قابلاً للدفاع عنه؛ ويجب إعادة بنائه مع كل استخدام جديد.
- ما هو صدق البناء؟السؤال الأصعب في القياس: هل الشيء الذي تقيسه موجود كما عرّفته، وهل تصل أداتك إليه بدلاً من شيء مجاور له.
- الصدق التقاربي والصدق التمييزيشرطان متقابلان: يجب أن يتوافق المقياس مع ما ينبغي أن يتوافق معه، ويجب أن يبقى متمايزاً عما يزعم أنه ليسه. معظم الأدوات الضعيفة تفشل في الشرط الثاني.
- ما هو معامل ألفا لكرونباخ: وما لا يمثلهالإحصائية الأكثر ذكراً في الاختبارات النفسية، والأكثر سوء فهم. معامل ألفا لا يُخبرك بأن المقياس أحادي البُعد، والقيمة المرتفعة غالباً ما تكون عرَضاً وليست ميزة.
- الخطأ المعياري للقياس: مقدار الانحراف المحتمل في درجتكتحمل كل درجة هامش خطأ، وفي معظم الاختبارات النفسية يكون هذا الهامش أوسع مما يفترضه الناس. هذا هو الرقم الذي يُخبرك متى يكون الفرق حقيقياً ومتى يكون مجرد تشويش.
- المعايير والمئينات: ما تُقارَن به درجتكلا يمكن تفسير الدرجة الخام بمفردها. فهي لا تصبح ذات معنى إلا بالمقارنة مع مجموعة مرجعية؛ وأي مجموعة استُخدمت هي من أهم الحقائق وأقلها إعلاناً بشأن أي اختبار.
- ما المقصود بأن يكون الاختبار موثوق الصدق؟هذا المصطلح غير منظّم ويُستخدم بحرية من منتجات لم تقم بأي من العمل اللازم. هذا هو معناه عندما يكون له معنى، والأسئلة الأربعة التي تفصل بين الحالتين.
- لماذا لا تُعد معظم اختبارات الشخصية على الإنترنت موثوقةليس لأنها غير أمينة، بل لأن الخطوات التي تجعل القياس موثوقاً غير مرئية ومكلفة وسهلة التجاوز، وتجاوزها لا يغيّر شيئاً في شكل النتيجة الظاهر.
- ما يمكن للتقرير الذاتي قياسه وما لا يمكنه قياسهتطلب منك الاستبيانات أن تكون المراقب لنفسك، وهذا ينجح في بعض الأمور أكثر من غيرها. معرفة أين تكون هذه الطريقة قوية وأين تفشل تغيّر طريقة قراءتك لأي نتيجة.
- ماذا يعني أن يتنبأ اختبار بشيء مايُعد الارتباط بمقدار 0.30 نتيجة قوية في أبحاث الشخصية، وأساساً ضعيفاً لاتخاذ قرار بشأن شخص واحد. كلا القولين صحيح، والفجوة بينهما هي سبب معظم حالات سوء استخدام نتائج الاختبارات.
- الفحص المسحي ليس تشخيصًايُبنى استبيان الفحص لرصد أكبر عدد ممكن من الحالات المحتملة، متقبلاً معدل إيجابيات كاذبة مرتفعاً كثمن لذلك. قراءة درجة الفحص كتشخيص تعكس ما صُمم من أجله أصلاً.