ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়
তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
অনলাইনের একটি বিনামূল্যের ব্যক্তিত্বের পরীক্ষা আর যাচাইকৃত একটি সাইকোমেট্রিক পরিমাপকের ফলাফল দেখতে একই রকম: একটি স্কোর, একটি পার্সেন্টাইল, আপনাকে নিয়ে একটি অনুচ্ছেদ। পার্থক্যটা পুরোপুরি এমন কাজে, যা ফলাফলের পর্দা থেকে দেখা যায় না।
বিষয়টি নিয়ে সুনির্দিষ্ট হওয়া জরুরি, কারণ প্রচলিত ধারণা, অর্থাৎ ইন্টারনেটের পরীক্ষা মানেই প্রতারণা, বেশিরভাগ ক্ষেত্রে ভুল এবং খুব একটা কাজেরও নয়। বেশিরভাগ পরীক্ষা এমন মানুষ বানান, যাঁদের ঠকানোর কোনো উদ্দেশ্য নেই। এগুলো নির্ভরযোগ্য নয় কাঠামোগত কারণে।
সাধারণত কী বাদ পড়ে
আইটেম বিশ্লেষণ। সঠিকভাবে তৈরি স্কেলে খসড়া করা বেশিরভাগ আইটেম পাইলটের পর বাদ দেওয়া হয়: যেসব আইটেমে কারও উত্তরে পার্থক্য হয় না, যেগুলো মোট স্কোরের সঙ্গে দুর্বলভাবে সম্পর্কিত, যেগুলো একাধিক ফ্যাক্টরে যুক্ত হয়, এবং যেগুলো বয়স বা ভাষার গোষ্ঠীভেদে ভিন্নভাবে আচরণ করে। পাইলট ছাড়া লিখে প্রকাশ করা পরীক্ষা সবকিছুই রেখে দিয়েছে, যেসব আইটেম কাজ করে না সেগুলোও।
স্বতন্ত্র কাঠামোগত নিশ্চিতকরণ। যে ডেটা দিয়ে স্কেল বানানো হয়েছে, তার ওপর ফ্যাক্টর বিশ্লেষণ করলে আপনার নকশা করা কাঠামোই ফিরে আসবে। নতুন নমুনায় সেটি নিশ্চিত করা একটি আলাদা গবেষণা, আর অনেক স্কেল ঠিক এই ধাপেই ব্যর্থ হয়।
নর্ম। পার্সেন্টাইল কোথাও থেকে আসতে হবে। সাইট যদি তার রেফারেন্স জনগোষ্ঠী উল্লেখ না করে, তাহলে সংখ্যাটি আসে আগের দর্শকদের থেকে, যাঁরা নিজে থেকে অংশ নেওয়া এমন একটি গোষ্ঠী যার গঠন অজানা, অথবা বিশেষ কিছু থেকেই নয়।
পুনঃপরীক্ষার ডেটা। মানুষ আগামী মাসেও একই স্কোর করে কি না তা প্রতিষ্ঠিত করতে তাঁদের আবার খুঁজে বের করতে হয়। প্রায় কেউই এটি করে না, অর্থাৎ "বৈশিষ্ট্য" শব্দটি যে স্থিতিশীলতা বোঝায়, তা প্রমাণিত হয়নি।
নকশার প্রণোদনা উল্টো দিকে চলে
যে পরীক্ষা বানানো হয় অংশগ্রহণ বাড়ানোর জন্য, তার অপ্টিমাইজেশনের লক্ষ্য সেই পরীক্ষার থেকে আলাদা, যেটি বানানো হয় নির্ভুলতার জন্য, আর দুটি লক্ষ্য অনুমেয় উপায়ে বিপরীত দিকে টানে।
তোষামোদি ফলাফল ভালো চলে। অপ্রিয় কিছু বললে ফলাফল কম শেয়ার হয়, তাই ফলাফল ধীরে ধীরে এমন বর্ণনার দিকে সরে যায় যা সবাই নিজের মধ্যে চিনতে পারে। এটিই বার্নাম প্রভাব, যা 1940-এর দশকে প্রদর্শিত হয়েছিল এবং তারপর নির্ভরযোগ্যভাবে বারবার পাওয়া গেছে: মানুষ সাধারণ ব্যক্তিত্বের বর্ণনাকে নিজের সম্পর্কে অত্যন্ত সঠিক বলে মূল্যায়ন করে।
মাত্রার চেয়ে ধরন ভালো চলে। "আপনি একজন স্থপতি" কথাটি "উন্মুক্ততায় আপনি 68তম পার্সেন্টাইলে, আস্থা ব্যবধান প্রশস্ত" কথাটির চেয়ে বেশি শেয়ারযোগ্য। ধরন পরিমাপের ত্রুটিও আড়াল করে, কারণ বিভাগের সীমারেখার এক পয়েন্ট এপাশে বা ওপাশে থাকা কেউ সম্পূর্ণ ভিন্ন লেবেল পান।
পর্যাপ্তের চেয়ে সংক্ষিপ্ত ভালো চলে। প্রতিটি অতিরিক্ত প্রশ্নে উত্তরদাতা কমে যায়, তাই পরীক্ষা এমন দৈর্ঘ্যে কেটে ফেলা হয় যা সম্পূর্ণ করার হার সর্বোচ্চ করে, কনস্ট্রাক্টটি কতটা কভার করা হলো তা নয়।
এগুলোর কোনোটিই মিথ্যা নয়। এগুলো নির্ভুলতা ছাড়া অন্য একটি মাপকাঠির জন্য অপ্টিমাইজেশন।
প্রায় ত্রিশ সেকেন্ডে কীভাবে বুঝবেন
লেখক ও বছরসহ একটি নামকরা উৎস পরিমাপক আছে কি না দেখুন। নর্ম কোন জনগোষ্ঠী থেকে এসেছে তার উল্লেখ আছে কি না দেখুন। সীমাবদ্ধতা বা পরিমাপের ত্রুটির কোনো স্বীকৃতি আছে কি না দেখুন। ফলাফল একটি অবিচ্ছিন্ন স্কোর, না একটি বিভাগ, তা দেখুন। একই পাতায় কুড়িটি প্রশ্ন থেকে আপনার আদর্শ পেশা, সঙ্গী বা জীবনের উদ্দেশ্য চিহ্নিত করার প্রতিশ্রুতি আছে কি না, তাও দেখুন।
যে পরীক্ষা তার পরিমাপকের নাম বলে, উৎস উল্লেখ করে, নর্ম জানায় এবং কোন বিষয় সে বলতে পারে না তা-ও জানায়, সে কাজটি করেছে। যে পরীক্ষা এর কিছুই করে না, সেটি হয়তো পাঁচ মিনিট কাটানোর একটি মনোরম উপায় হতে পারে, কিন্তু তার দেওয়া সংখ্যাটি শুধুই সাজসজ্জা।
NOESIS তালিকার প্রতিটি পরিমাপক জানায় সেটি কোন প্রকাশিত পরীক্ষা বাস্তবায়ন করে, কে লিখেছেন, কোন বছরে, কীভাবে স্কোর করা হয়, এবং এর ফলাফল কী প্রতিষ্ঠিত করে না। শেষ অংশটিই তুলনা করার মতো।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
- মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- অভিসারী ও পৃথকীকারী বৈধতাদুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
- Cronbach's alpha কী, এবং এটি কী নয়মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
- পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারেপ্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
- নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।