মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?
নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
নির্ভরযোগ্যতা হলো একটি পরিমাপ কতটা পুনরাবৃত্তিযোগ্য, অর্থাৎ তা কতটা আসল ফলাফল এবং কতটা নিছক গোলমাল (নয়েজ)। এক মিনিটে তিনবার নিজের ওজন মেপে যদি 71, 78 ও 66 কিলোগ্রাম পান, তাহলে স্কেলটি নির্ভরযোগ্য নয়, আর তা থেকে আপনার প্রকৃত ওজন জানার কোনো উপায় থাকে না। মনস্তাত্ত্বিক পরিমাপও একই সমস্যার মুখোমুখি হয়, তবে তার যন্ত্র অনেক কম নিখুঁত।
নির্ভরযোগ্যতা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ বিষয় হলো, এটি কী দাবি করে না। যে বাথরুম স্কেল প্রতিবারই আট কিলোগ্রাম বেশি দেখায়, সেটি পুরোপুরি নির্ভরযোগ্য, অথচ সম্পূর্ণ ভুল। নির্ভরযোগ্যতা মানে সামঞ্জস্য; সংখ্যাটি সঠিক জিনিস বোঝাচ্ছে কি না, সেটি আলাদা প্রশ্ন, যাকে বলা হয় বৈধতা। বৈধতার জন্য নির্ভরযোগ্যতা অপরিহার্য, কিন্তু তা মোটেও যথেষ্ট নয়।
এর বিভিন্ন রূপ
অভ্যন্তরীণ সামঞ্জস্য জানতে চায়, একটি স্কেলের আইটেমগুলো পরস্পরের সঙ্গে মেলে কি না। দশটি প্রশ্নই যদি একই অন্তর্নিহিত বৈশিষ্ট্য মাপার কথা হয়, তাহলে যাঁরা একটিতে উচ্চ উত্তর দেন, তাঁদের বাকিগুলোতেও উচ্চ উত্তর দেওয়ার প্রবণতা থাকার কথা। এটি সাধারণত Cronbach's alpha, বা আরও ভালো হলে McDonald's omega হিসেবে জানানো হয়।
টেস্ট-রিটেস্ট নির্ভরযোগ্যতা জানতে চায়, একই ব্যক্তি দুটি ভিন্ন সময়ে একই রকম স্কোর করেন কি না। বৈশিষ্ট্যের ক্ষেত্রে এটিই সবচেয়ে গুরুত্বপূর্ণ, কারণ সংজ্ঞা অনুযায়ী বৈশিষ্ট্য স্থিতিশীল হওয়ার কথা। অথচ এটিই সবচেয়ে বেশি অপ্রকাশিত থাকে, কারণ কয়েক সপ্তাহ পরে একই অংশগ্রহণকারীদের খুঁজে বের করতে হয়।
আন্তঃমূল্যায়নকারী নির্ভরযোগ্যতা প্রযোজ্য হয় যখন মানুষ নিজে পরিমাপক স্কোর করেন, যেমন ক্লিনিক্যাল সাক্ষাৎকার, প্রজেক্টিভ কৌশল ও আচরণ পর্যবেক্ষণে। এটি জানতে চায়, একই উপাদান দেখে দুজন প্রশিক্ষিত মূল্যায়নকারী একই সিদ্ধান্তে পৌঁছান কি না।
সমান্তরাল ফর্মের নির্ভরযোগ্যতা জানতে চায়, একই পরীক্ষার সমতুল্য হিসেবে তৈরি দুটি ভিন্ন সংস্করণ একই স্কোর দেয় কি না। যেখানে একটি পরীক্ষা একাধিকবার নেওয়া হয় এবং আইটেম আগে থেকে জানা হয়ে যাওয়ার আশঙ্কা থাকে, সেখানে এটি গুরুত্বপূর্ণ।
সংখ্যাগুলো পড়ার উপায়
নির্ভরযোগ্যতার সহগ 0 থেকে 1 পর্যন্ত হয়। প্রচলিত মানদণ্ডগুলো মোটামুটি এবং প্রায়ই ভুলভাবে ব্যবহৃত হয়, তবে মোটামুটি এ রকম: কোনো স্কোর একজন ব্যক্তির জীবনে প্রভাব ফেললে 0.90-এর বেশি প্রয়োজন, বেশিরভাগ ব্যবহারিক কাজে 0.80 থেকে 0.90 ভালো, গবেষণা ও গোষ্ঠীগত তুলনার জন্য 0.70 থেকে 0.80 গ্রহণযোগ্য, আর 0.70-এর নিচে মানে স্কোরে এত বেশি গোলমাল থাকে যে বেশিরভাগ সিদ্ধান্তই টেকে না।
এই সীমারেখা নিয়ে দুটি সতর্কতা। প্রথমত, এগুলো প্রথা, আইন নয়; গ্রহণযোগ্য মাত্রা সম্পূর্ণ নির্ভর করে স্কোরটি কী কাজে ব্যবহৃত হবে তার ওপর। দ্বিতীয়ত, ছোট স্কেলে খুব উচ্চ alpha সাধারণত বোঝায় যে আইটেমগুলো প্রায় একই কথার ভিন্ন রূপ। এতে সামঞ্জস্য পাওয়া যায়, কিন্তু কনস্ট্রাক্টের পরিধি কমে যায়। দশটি প্রশ্নই যদি সামান্য ভিন্ন শব্দে কেবল জিজ্ঞেস করে "আপনি কি গোছানো?", তাহলে অভ্যন্তরীণ সামঞ্জস্য চমৎকার হবে, কিন্তু বিবেকবোধের চিত্র হবে সংকীর্ণ।
আপনার নিজের স্কোরের জন্য এর অর্থ
নির্ভরযোগ্যতা সরাসরি নির্ধারণ করে, একটি সংখ্যার ওপর কতটা আস্থা রাখা যায়। 0.85 নির্ভরযোগ্যতার একটি পরীক্ষায় পরিমাপের ত্রুটি এতটা থাকে যে দুজন ব্যক্তির মধ্যে, বা আজকের ও গত মাসের স্কোরের মধ্যে কয়েক পয়েন্টের পার্থক্য সম্ভবত গোলমালই, কোনো প্রকৃত সংকেত নয়।
ব্যবহারিক পরিণতি হলো: একটি ভালো পরিমাপক তার নির্ভরযোগ্যতা জানিয়ে দেয়, যাতে আপনি বুঝতে পারেন আপনার স্কোরের চারপাশে অনিশ্চয়তা কতটা। এই অনিশ্চয়তার প্রযুক্তিগত প্রকাশ হলো পরিমাপের প্রমিত ত্রুটি, যা নির্ভরযোগ্যতার সহগকে স্কোরের চারপাশে একটি প্লাস-মাইনাস পরিসরে রূপান্তর করে।
যে পরিমাপক নির্ভরযোগ্যতার কোনো সংখ্যাই জানায় না, সে তাই বেশি নিখুঁত হয়ে যায় না। সে কেবল জানাতে অস্বীকার করেছে যে সে কতটা অনিখুঁত।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- অভিসারী ও পৃথকীকারী বৈধতাদুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
- Cronbach's alpha কী, এবং এটি কী নয়মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
- পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারেপ্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
- নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
- ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।