কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?
শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
"বৈজ্ঞানিকভাবে বৈধ" কোনো সুরক্ষিত পরিভাষা নয়। কেউ এর সনদ দেয় না, কোনো সংস্থা এটি নিরীক্ষা করে না, আর এমন পণ্যেও এটি লেখা থাকে যার একমাত্র প্রমাণ হলো অনেক মানুষ সেটি ব্যবহার করেছেন। শব্দটি যথাযথভাবে ব্যবহার করা হলে এর অর্থ কী, তা জেনে রাখা কাজের।
সংক্ষেপে
বৈধ পরিমাপকের একটি প্রকাশিত নথি থাকে, যা দেখায় সেটি কী পরিমাপ করে, কতটা নিখুঁতভাবে, কোন জনগোষ্ঠীতে, এবং এর স্কোর ন্যায্যভাবে কীসের জন্য ব্যবহার করা যায়। বৈধতা কোনো সনদ নয়। এটি প্রমাণের একটি সমষ্টি, যা সাধারণত বহু বছর ধরে গড়ে ওঠে এবং যাতে সাধারণত এমন ফলাফল থাকে যা পরিমাপকের ব্যবহারকে সীমাবদ্ধ করে, প্রশংসা করে না।
সীমাবদ্ধতার নথিভুক্ত উল্লেখ থাকা ভালো লক্ষণগুলোর একটি। প্রকৃত বৈধতা-সাহিত্য এমন কথায় ভরা: এই স্কেল কিশোরদের ক্ষেত্রে দুর্বলভাবে কাজ করে, ওই দিকটি পুনরাবৃত্ত হয় না, কাটঅফ জনগোষ্ঠীর ওপর নির্ভরশীল। যে পণ্য শুধু শক্তির কথা জানায়, সে তার বৈধতা প্রকাশ করেনি; সে তার বিপণন প্রকাশ করেছে।
চারটি প্রশ্ন, যেগুলো আসল কাজ করে
মূল প্রকাশনা কোনটি? বৈধ পরিমাপকের একটি মূল গবেষণাপত্র থাকে, যা পিয়ার-রিভিউড জার্নালে প্রকাশিত, যাতে লেখক, সাল এবং সাধারণত একটি DOI থাকে। সেই গবেষণাপত্রে জানানো হয় আইটেমগুলো কীভাবে তৈরি হয়েছিল এবং প্রাথমিক সাইকোমেট্রিক বৈশিষ্ট্য কী ছিল। কেউ যদি গবেষণাপত্রটির নাম বলতে না পারে, তাহলে আলোচনা করার মতো কোনো বৈধতা নেই।
কাঠামোটি কি অন্য কেউ নিশ্চিত করেছেন? উন্নয়নকারী দল নিজেদের নকশা করা কাঠামোই খুঁজে পাবে। আসল প্রশ্ন হলো, কোনো স্বাধীন গোষ্ঠী স্বাধীন ডেটা নিয়ে একই ফল পেয়েছে কি না। এটিই সবচেয়ে তথ্যবহুল প্রশ্ন, আর এটিরই উত্তর সবচেয়ে বেশি অনুচ্চারিত থেকে যায়।
নর্ম কোন জনগোষ্ঠীর ওপর এবং কবে তৈরি হয়েছে? স্কোর হলো একটি রেফারেন্স বণ্টনের মধ্যে অবস্থান। যে পরিমাপক কোন জনগোষ্ঠীকে বোঝানো হচ্ছে তা না জানিয়ে পার্সেন্টাইল দেয়, সে আপনাকে হর ছাড়া একটি সংখ্যা দিয়েছে।
এটি নতুন কী যোগ করে? অর্থাৎ প্রতিষ্ঠিত কোনো পরিমাপের ওপর বাড়তি বৈধতা। ব্র্যান্ডযুক্ত বহু কনস্ট্রাক্ট এখানে ব্যর্থ হয়; সেগুলো কোনো বিদ্যমান বৈশিষ্ট্যের সঙ্গে এত বেশি সহসম্পর্কিত যে অন্য কিছুর ক্ষেত্রেই অতিরিক্ত ভেদাঙ্ক ব্যাখ্যা করে না। বৈজ্ঞানিক যাচাইয়ে এটি স্বাভাবিক ফল, তবে কেউ পরীক্ষাটি না চালালে তা চোখে পড়ে না।
অনুবাদ যেখানে বিষয়টি জটিল করে
ইংরেজিতে বৈধ প্রমাণিত পরিমাপক তাই বলে জার্মান ভাষায় বৈধ নয়। যথাযথ আন্তঃসাংস্কৃতিক অভিযোজনে প্রয়োজন সম্মুখ ও পশ্চাৎ অনুবাদ, বিশেষজ্ঞ পর্যালোচনা, জ্ঞানীয় সাক্ষাৎকার, এবং তারপর নতুন ভাষায় একটি নতুন সাইকোমেট্রিক গবেষণা, যা যাচাই করে ফ্যাক্টর কাঠামো টিকে আছে কি না এবং বিভিন্ন গোষ্ঠীতে আলাদা আলাদা আইটেম সমতুল্যভাবে কাজ করছে কি না।
এই ধাপ বাদ দেওয়া পরিমাপক প্রচুর আছে। যে প্রশ্নাবলির মূল বৈধতা নিখুঁত, তা এমন ভাষায় ভিন্নভাবে আচরণ করতে পারে যেখানে একটি মূল আইটেমের অর্থের আভাস আলাদা, এবং গবেষণা ছাড়া তা জানার উপায় নেই। কোনো পরীক্ষা দশটি ভাষায় দেওয়া হলে কাজের প্রশ্ন হলো, সেটি কি দশটি ভাষায় বৈধ প্রমাণিত, নাকি একটিতে বৈধ প্রমাণিত হয়ে বাকি নয়টিতে অনূদিত।
বৈধতা যা এনে দেয় না
এটি স্কোরকে নিশ্চিত করে না। বৈধ পরিমাপকেও পরিমাপের ত্রুটি থাকে, সেটি তখনও ব্যক্তির নিয়তি নয়, জনগোষ্ঠীস্তরের একটি নিয়মিততা বর্ণনা করে, এবং তার আইটেমগুলো যতদূর পৌঁছায় ততটুকুই পরিমাপ করে।
বৈধতা যা এনে দেয় তা হলো জানা সীমা। কতটা ত্রুটি, কোন জনগোষ্ঠীতে, কোন উদ্দেশ্যে, তা আপনি খুঁজে নিতে পারেন। "এই পরীক্ষা আপনি আসলে কে তা প্রকাশ করে" দাবির চেয়ে এটি অনেক ছোট দাবি, এবং এটিই একমাত্র দাবি যা টেকে।
নথিপত্র থাকলে সেটি কেমন দেখায় তা দেখতে চাইলে, NOESIS তালিকার প্রতিটি পরীক্ষায় উল্লেখ আছে সেটি কোন পরিমাপক প্রয়োগ করে, তার লেখক ও সাল, স্কোরিং পদ্ধতি এবং তার পেছনের প্রমাণ, এমনকি যেখানে সেই প্রমাণ নিয়ে বিতর্ক আছে সেখানেও।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
- মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- অভিসারী ও পৃথকীকারী বৈধতাদুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
- Cronbach's alpha কী, এবং এটি কী নয়মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
- পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারেপ্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
- নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।