অভিসারী ও পৃথকীকারী বৈধতা
দুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
অভিসারী ও পৃথকীকরণ বৈধতা একই চাহিদার দুটি অংশ। একটি পরিমাপককে তাত্ত্বিকভাবে যেসবের সঙ্গে সম্পর্কিত হওয়ার কথা তার সঙ্গে সম্পর্কিত হতে হবে, আবার যেসব থেকে আলাদা হওয়ার কথা তার সঙ্গে খুব বেশি সম্পর্কিত হওয়া চলবে না। একটি পূরণ করে অন্যটি না করা আংশিক সাফল্য নয়; এটি সাধারণত ইঙ্গিত দেয় যে কনস্ট্রাক্টটি যা বলে দাবি করা হচ্ছে, তা আসলে তা নয়।
অভিসারী বৈধতা
অভিসারী প্রমাণ দেখায় যে একটি পরিমাপক একই বিষয়ের অন্যান্য নির্দেশকের সঙ্গে মেলে। একটি নতুন উদ্বেগ স্কেলের স্বীকৃত উদ্বেগ স্কেলগুলোর সঙ্গে, চিকিৎসকের মূল্যায়নের সঙ্গে এবং আদর্শভাবে প্রশ্নাবলি নয় এমন কিছুর সঙ্গে, যেমন শারীরবৃত্তীয় পরিমাপ বা পর্যবেক্ষিত পরিহার আচরণের সঙ্গে, উল্লেখযোগ্য সম্পর্ক থাকা উচিত।
এখানে সম্পর্ক সাধারণত 0.50 এর ওপরে আশা করা হয়, আর তুলনামূলক পরিমাপকটি একই কনস্ট্রাক্টের জন্য সুপ্রতিষ্ঠিত পরিমাপক হলে প্রায়ই 0.70 এর ওপরে। এর নিচে হলে হয় নতুন স্কেল, নয়তো তুলনামূলক পরিমাপকটি অন্য কিছু মাপছে।
একটি ফাঁদ আছে। বিদ্যমান স্কেলের সঙ্গে 0.95 সম্পর্ক কোনো জয় নয়; এর অর্থ নতুন পরিমাপকটি আসলে পুনঃমোড়কজাত রূপ, এবং তখন সৎ প্রশ্ন হয়ে দাঁড়ায় এটি নতুন কী যোগ করে। অভিসারী বৈধতা একটি ন্যূনতম সীমা, সর্বোচ্চ করার লক্ষ্য নয়।
পৃথকীকরণ বৈধতা
পৃথকীকরণ প্রমাণ দেখায় যে পরিমাপকটি এমন কনস্ট্রাক্ট থেকে আলাদা থাকে যেগুলো থেকে ভিন্ন বলে সে দাবি করে। আকর্ষণীয় ব্যর্থতাগুলো এখানেই ঘটে।
গবেষণা সাহিত্যে এই ধরন বারবার দেখা যায়। গ্রিট ও বিবেকবোধের মধ্যে সম্পর্ক প্রায় 0.84, যা এত কাছাকাছি যে মেটা-বিশ্লেষণে দেখা গেছে, বিবেকবোধ নিয়ন্ত্রণ করলে গ্রিট একাডেমিক পূর্বাভাসে প্রায় কিছুই যোগ করে না। স্ব-প্রতিবেদন ভিত্তিক আবেগীয় বুদ্ধিমত্তা আবেগীয় স্থিতিশীলতা, বহির্মুখিতা ও বিবেকবোধের সম্মিলিত রূপের সঙ্গে ব্যাপকভাবে মিলে যায়। HEXACO মডেলের সততা-বিনয় বিবেচনায় নিলে ডার্ক ট্রায়াডের মধ্যকার অভিন্ন ভেদাংশের বেশিরভাগই মিলিয়ে যায়। প্রতিটি ক্ষেত্রেই কনস্ট্রাক্টটিকে নতুন ভূখণ্ড হিসেবে উপস্থাপন করা হয়েছিল, অথচ দেখা গেল সেটি বিদ্যমান মানচিত্রের একটি নতুন নামের অঞ্চল।
পৃথকীকরণ বৈধতার ক্ষেত্রেই পদ্ধতিগত প্রভাবও সামনে আসে। কোনো গবেষণায় স্ব-প্রতিবেদিত প্রতিটি কনস্ট্রাক্ট যদি অন্য প্রতিটির সঙ্গে 0.4 সম্পর্কিত হয়, তাহলে অভিন্ন উপাদানটি সম্ভবত কোনো ভাগ করা মনস্তত্ত্ব নয়, বরং উত্তরদাতার উত্তর দেওয়ার ধরন।
যে পরীক্ষা বিষয়টি নিষ্পত্তি করে
নিষ্পত্তিমূলক পদ্ধতি হলো বর্ধিষ্ণু বৈধতা: প্রথমে প্রতিষ্ঠিত পরিমাপকটি, তারপর নতুনটি রিগ্রেশনে ঢুকিয়ে দেখুন নতুনটি ফলাফলে কোনো অতিরিক্ত ভেদাংশ ব্যাখ্যা করে কি না। না করলে কনস্ট্রাক্টটি তাত্ত্বিকভাবে আকর্ষণীয় থাকতে পারে, কিন্তু পরিমাপকটি এমন কিছু মাপছে না যা এই ক্ষেত্রের আগে থেকে জানা ছিল না।
এটি একটি কঠিন মানদণ্ড, এবং প্রকাশিত বহু স্কেলকে কখনো এর মধ্য দিয়ে যেতে হয়নি। যখন যায়, ফলাফল প্রায়ই ওপরে বলা অপ্রয়োজনীয়তার সিদ্ধান্ত হয়ে দাঁড়ায়। এটি কোনো কেলেঙ্কারি নয়; এটি স্বাভাবিক বৈজ্ঞানিক ছাঁটাই। তবে এর অর্থ হলো, কোনো কনস্ট্রাক্ট কতটা জনপ্রিয় তা থেকে বোঝা যায় না সেটি এই পরীক্ষায় টিকবে কি না।
পাঠকের জন্য এর তাৎপর্য
কোনো পরীক্ষা একাধিক স্কোর দিলে কাজের প্রশ্ন হলো সেই স্কোরগুলো আসলেই আলাদা কি না। পরস্পরের সঙ্গে 0.8 সম্পর্কিত চারটি মাত্রা আসলে চারটি নামের একটিই মাত্রা, এবং তা থেকে তৈরি প্রোফাইল ভিন্নতাপূর্ণ দেখালেও প্রায় কোনো স্বতন্ত্র তথ্য বহন করে না।
যেসব পরিমাপক স্কেলগুলোর পারস্পরিক সম্পর্ক প্রকাশ করে, আপনি নিজেই তা যাচাই করে দেখতে পারেন। যেসব পরিমাপক চার-চতুর্ভাগের একটি ধরন উপস্থাপন করে কিন্তু চতুর্ভাগগুলোর মধ্যে সম্পর্ক কখনো দেখায় না, তারা এই যাচাই অসম্ভব করে তুলেছে, আর সাধারণত সেটাই উদ্দেশ্য।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
- মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- Cronbach's alpha কী, এবং এটি কী নয়মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
- পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারেপ্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
- নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
- ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।