নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়
একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
আপনি একটি বিবেকবোধ স্কেলে 34 স্কোর করেছেন। এটি কি উচ্চ?
তুলনা ছাড়া এই প্রশ্নের কোনো উত্তর নেই। সর্বোচ্চ কত থেকে 34, কার তুলনায়, কখন পরিমাপ করা? নর্ম হলো সেই রেফারেন্স ডেটা, যা একটি কাঁচা স্কোরকে ব্যাখ্যাযোগ্য অবস্থানে রূপান্তর করে, আর নর্ম বেছে নেওয়া পরীক্ষা তৈরির অন্যতম গুরুত্বপূর্ণ সিদ্ধান্ত।
রূপান্তর যেভাবে কাজ করে
নর্ম নমুনা হলো এমন একদল মানুষ, যাঁরা মানসম্মত পরিস্থিতিতে পরিমাপকটি দিয়েছেন এবং যাঁদের স্কোরের বণ্টন মানদণ্ড হিসেবে কাজ করে। এরপর কাঁচা স্কোরকে সেই বণ্টনের মধ্যে একটি অবস্থান হিসেবে প্রকাশ করা হয়।
পার্সেন্টাইল র্যাঙ্ক জানায় নর্ম নমুনার কত অংশ আপনার সমান বা আপনার চেয়ে কম স্কোর করেছে। 70তম পার্সেন্টাইল মানে সেই রেফারেন্স গোষ্ঠীর 70 শতাংশ কম স্কোর করেছে। পার্সেন্টাইল সহজবোধ্য, কিন্তু এর একটি অবহেলিত ত্রুটি আছে: এটি বণ্টনের ঘনবসতিপূর্ণ মাঝের অংশে পার্থক্যকে বাড়িয়ে দেখায় এবং দুই প্রান্তে সংকুচিত করে। গড়ের কাছাকাছি কয়েকটি কাঁচা পয়েন্ট আপনাকে অনেক পার্সেন্টাইল ধাপ সরিয়ে দিতে পারে; শীর্ষের কাছাকাছি একই কয়েক পয়েন্ট প্রায় কিছুই সরায় না।
স্ট্যান্ডার্ড স্কোর, অর্থাৎ z-স্কোর, T-স্কোর, স্ট্যানাইন এবং IQ-ধাঁচের স্কেল, গড় থেকে দূরত্বকে স্ট্যান্ডার্ড ডেভিয়েশনের এককে প্রকাশ করে। এগুলো স্কোরগুলোর মধ্যকার প্রকৃত ব্যবধান বজায় রাখে, তাই ফলাফলের ওপর যেকোনো গাণিতিক হিসাবের জন্য এগুলোই বেশি পছন্দের।
কেন রেফারেন্স গোষ্ঠীই আসল বিষয়
নর্ম নমুনার ওপর নির্ভর করে একই কাঁচা স্কোর সম্পূর্ণ ভিন্ন পার্সেন্টাইলে পড়তে পারে। সাধারণ প্রাপ্তবয়স্ক জনগোষ্ঠীর বিপরীতে এবং পেশাদার হিসাবরক্ষকদের একটি নমুনার বিপরীতে বিবেকবোধ স্কোর করলে একই পার্সেন্টাইল আসবে না, আর কোনো সংখ্যাই ভুল নয়, কারণ দুটি ভিন্ন প্রশ্নের উত্তর দেয়।
তাই নর্ম নমুনার কয়েকটি বৈশিষ্ট্য জানা জরুরি।
এতে কারা ছিলেন। মনোবিজ্ঞানের স্নাতক শিক্ষার্থীদের সুবিধাজনক নমুনা এখনও প্রচলিত, অথচ এটি মানবজাতির একটি সংকীর্ণ অংশ: তরুণ, শিক্ষিত এবং অনুপাতে বেশি ধনী পশ্চিমা দেশগুলো থেকে আসা। এমন নমুনার ওপর তৈরি নর্ম অন্যত্র ভালোভাবে প্রযোজ্য হয় না।
এটি কত বড় ছিল। প্রান্তীয় অংশে স্থিতিশীল পার্সেন্টাইল অনুমানের জন্য বড় নমুনা দরকার। কয়েকশ মানুষের নমুনা 95তম পার্সেন্টাইল কেমন দেখায় তার একটি অনির্ভরযোগ্য চিত্র দেয়।
এটি কখন সংগ্রহ করা হয়েছিল। নর্ম সময়ের সঙ্গে সরে যায়। বিভিন্ন মনস্তাত্ত্বিক পরিমাপে জনগোষ্ঠীর গড় কয়েক দশকে লক্ষণীয়ভাবে বদলেছে, আর 1995 সালের নর্ম নমুনা 2026 সালে পরীক্ষা দেওয়া জনগোষ্ঠীকে আর বর্ণনা করে না।
এটি স্তরবিন্যস্ত কি না। অনেক বৈশিষ্ট্য বয়স ও লিঙ্গ অনুযায়ী নিয়মিতভাবে ভিন্ন হয়। উত্তেজনা-অন্বেষণ বয়সের সঙ্গে তীব্রভাবে কমে; ক্রোনোটাইপ জীবনকাল জুড়ে বদলায়। 55 বছর বয়সী কাউকে সব বয়সের নর্মের সঙ্গে তুলনা করলে দুই দিক থেকেই বিভ্রান্তিকর অবস্থান পাওয়া যায়।
কী খুঁজবেন, এবং এর অনুপস্থিতির অর্থ কী
সুনথিভুক্ত একটি পরিমাপক তার নর্ম নমুনার আকার, গঠন, দেশ ও বছর উল্লেখ করে এবং জানায় নর্ম স্তরবিন্যস্ত কি না। গুরুত্বপূর্ণ পরীক্ষার ম্যানুয়ালে এর জন্য আলাদা অধ্যায় থাকে।
বেশিরভাগ বিনামূল্যের অনলাইন পরীক্ষা এর কিছুই জানায় না। তারা কোনো জনগোষ্ঠীর কথা না বলেই আপনাকে একটি পার্সেন্টাইল দেখায়। সেই পার্সেন্টাইল হয় একটি অনুল্লেখিত সুবিধাজনক নমুনা থেকে আসে, নয়তো ভিন্ন জনগোষ্ঠীর ওপর সংগৃহীত কোনো প্রকাশিত নর্ম থেকে ধার করা, নয়তো ওই ওয়েবসাইটের পরীক্ষা আগে যাঁরা দিয়েছেন তাঁদের থেকে তৈরি, যা একটি স্বনির্বাচিত গোষ্ঠী, যার গঠন সাইটের পরিচালকও জানেন না।
পার্সেন্টাইলটি তবু পর্দায় দেখা যায় এবং আসল পার্সেন্টাইলের মতোই দেখতে লাগে। দুটির মধ্যে পার্থক্য করে কেবল সঙ্গের নথিপত্র, আর কিছুই নয়।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
- মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- অভিসারী ও পৃথকীকারী বৈধতাদুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
- Cronbach's alpha কী, এবং এটি কী নয়মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
- পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারেপ্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
- ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।