মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?
বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
বৈধতা প্রশ্ন করে, একটি পরীক্ষা যা পরিমাপ করার দাবি করে তা সত্যিই পরিমাপ করে কি না, এবং এর স্কোর থেকে মানুষ যে সিদ্ধান্তে পৌঁছায় তা যথার্থ কি না। এটি সাইকোমেট্রিক্সের কেন্দ্রীয় প্রশ্ন, অথচ প্রায়ই এর উত্তর দেওয়া হয় প্রমাণ দিয়ে নয়, বিপণনের দাবি দিয়ে।
১৯৮০-র দশকে Messick-এর কাজের পর থেকে আধুনিক ধারণা হলো, বৈধতা কোনো পরিমাপকের স্থির বৈশিষ্ট্য নয়। এটি নির্দিষ্ট ব্যবহারের জন্য স্কোরের একটি ব্যাখ্যার বৈশিষ্ট্য। একই প্রশ্নাবলি কারও আত্ম-উপলব্ধি বর্ণনার জন্য ভালোভাবে বৈধ প্রমাণিত হতে পারে, আবার তাকে নিয়োগ দেওয়া হবে কি না তা ঠিক করার জন্য সম্পূর্ণ অপ্রমাণিত হতে পারে। কীসের জন্য বৈধ তা না বলে "এই পরীক্ষা বৈধ" বলা কোনো দাবি নয়; এটি একটি স্লোগান মাত্র।
প্রমাণের ধরন
বৈধতা গড়ে ওঠে কয়েক ধরনের জমা হওয়া প্রমাণ থেকে। পুরোনো পাঠ্যবইয়ে এগুলোকে বৈধতার আলাদা আলাদা প্রজাতি হিসেবে উপস্থাপন করা হতো; বর্তমান দৃষ্টিভঙ্গিতে এগুলোকে একটিমাত্র মামলার পক্ষে ভিন্ন ভিন্ন যুক্তি হিসেবে দেখা হয়।
বিষয়বস্তুর প্রমাণ প্রশ্ন করে, আইটেমগুলো কনস্ট্রাক্টটিকে যথাযথভাবে ঢেকেছে কি না। যে বিষণ্নতার স্কেল শুধু ঘুম ও ক্ষুধা নিয়ে প্রশ্ন করে, সেটি শারীরিক লক্ষণগুলো ধরে কিন্তু মেজাজ ও জ্ঞানীয় লক্ষণগুলো বাদ দেয়। বিষয়বস্তুর পরিধি সাধারণত বিষয়-বিশেষজ্ঞরা বিচার করেন, আর এ কারণেই খুব ছোট স্কেল সবসময়ই একটি আপস।
অভ্যন্তরীণ কাঠামোর প্রমাণ প্রশ্ন করে, তত্ত্ব যেভাবে বলে আইটেমগুলো সেভাবে গোষ্ঠীবদ্ধ হয় কি না। কোনো মডেল যদি চারটি স্বতন্ত্র দিক দাবি করে, তাহলে ফ্যাক্টর বিশ্লেষণে চারটি ফ্যাক্টর পাওয়া উচিত। আর গুরুত্বপূর্ণ কথা হলো, তা পাওয়া উচিত একটি স্বতন্ত্র নমুনায়, শুধু যে নমুনায় স্কেলটি তৈরি হয়েছিল সেখানে নয়। বহু পরিমাপক উন্নয়ন-নমুনায় তাদের কাঙ্ক্ষিত কাঠামো পুনরুদ্ধার করে, কিন্তু অন্য কারও নমুনায় তা করতে ব্যর্থ হয়।
অন্যান্য চলকের সঙ্গে সম্পর্ক হলো সেই জায়গা যেখানে বেশিরভাগ কাজ হয়। অভিসারী প্রমাণ দেখায় যে স্কেলটি যেসব বিষয়ের সঙ্গে সম্পর্কিত হওয়ার কথা সেগুলোর সঙ্গে সম্পর্কিত। পার্থক্যমূলক প্রমাণ দেখায় যে যেসব বিষয় থেকে এটি আলাদা হওয়ার কথা, সেগুলোর সঙ্গে এর সম্পর্ক খুব বেশি নয়। এই শর্তটি দীর্ঘদিন ধরে অবহেলিত, অথচ নতুন ব্র্যান্ডের বহু কনস্ট্রাক্ট এখানেই ডুবে যায়। মানদণ্ডভিত্তিক প্রমাণ দেখায় যে স্কোরটি এমন একটি ফলাফলের সঙ্গে সম্পর্কিত যা গুরুত্বপূর্ণ, সেটি একই সময়ে পরিমাপ করা হোক বা আগে থেকে পূর্বাভাস দেওয়া হোক।
পরিণতিমূলক প্রমাণ প্রশ্ন করে, পরীক্ষাটি ব্যবহার করলে কী ঘটে। কোনো পরিমাপক যদি কনস্ট্রাক্টের সঙ্গে অসম্পর্কিত কারণে পদ্ধতিগতভাবে কোনো গোষ্ঠীকে অসুবিধায় ফেলে, তাহলে সেটি কেবল নৈতিক নয়, বৈধতারও সমস্যা।
যে প্রশ্ন বেশিরভাগ দাবির স্বরূপ ফাঁস করে
বৈধতার দাবি যাচাইয়ের সবচেয়ে ধারালো পরীক্ষা হলো বর্ধিত বৈধতা: সস্তা, পুরোনো ও প্রতিষ্ঠিত কোনো পরিমাপ আপনাকে যা আগে থেকেই বলে দেয়, তার ওপর এই পরিমাপক কি নতুন কিছু যোগ করে?
উল্লেখযোগ্য সংখ্যক ব্র্যান্ডেড কনস্ট্রাক্ট এখানে ব্যর্থ হয়। সেগুলো বিদ্যমান কোনো Big Five ডোমেইনের সঙ্গে 0.7 বা তার বেশি সহসম্পর্ক দেখায়, একই মাত্রায় একই ফলাফলের পূর্বাভাস দেয়, এবং পুরোনো পরিমাপটি পরিসংখ্যানগতভাবে নিয়ন্ত্রণ করলে আর কিছুই যোগ করে না। কনস্ট্রাক্টটি নতুন, কিন্তু পরিমাপটি নতুন নয়। এ কারণেই গুরুত্বপূর্ণ পরিমাপক-নথির সমালোচনা অংশগুলো প্রায়ই অশুদ্ধতার চেয়ে পুনরাবৃত্তি নিয়েই কথা বলে।
যা খেয়াল রাখবেন
কেউ যখন দাবি করে যে একটি পরীক্ষা বৈধতা-যাচাইকৃত, তখন কার্যকর প্রশ্নগুলো হয় সুনির্দিষ্ট। কোন মানদণ্ডের বিপরীতে যাচাই করা হয়েছে? কোন জনগোষ্ঠীতে, কত বড় নমুনায়? ফ্যাক্টর কাঠামো কি স্বতন্ত্র নমুনায় নিশ্চিত হয়েছে? উত্তরে বাণিজ্যিক স্বার্থ নেই এমন গবেষকদের প্রকাশিত প্রমাণ আছে কি? প্রতিষ্ঠিত কোনো বিকল্পের ওপর এটি কি কিছু যোগ করে?
যে পরিমাপক এই প্রশ্নগুলোর সৎ উত্তর দিতে পারে, সীমাবদ্ধতাসহ সেটিকে গুরুত্ব দিয়ে বিবেচনা করা যায়। আর যে পরিমাপকের বৈধতা যাচাই বলতে আছে কেবল একটি প্রশংসাপত্রের পাতা এবং লক্ষ লক্ষ মানুষ এটি দিয়েছে এমন দাবি, সে আসলে সম্পূর্ণ ভিন্ন একটি প্রশ্নের উত্তর দিয়েছে। জনপ্রিয়তা প্রমাণ নয়, আর কতজন মানুষ একটি পরীক্ষা দিয়েছে তা থেকে বোঝা যায় না যে এর স্কোরের কোনো অর্থ আছে কি না।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- অভিসারী ও পৃথকীকারী বৈধতাদুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
- Cronbach's alpha কী, এবং এটি কী নয়মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
- পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারেপ্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
- নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
- ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।