পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারে
প্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
পরিমাপের স্ট্যান্ডার্ড এরর একটি বিমূর্ত নির্ভরযোগ্যতা সহগকে বাস্তব কিছুতে রূপান্তর করে: একটি স্কোরের চারপাশে বাড়তি-কমতির একটি পরিসর। বেশিরভাগ ফলাফল পর্দা যে প্রশ্নের উত্তর দেয় না, এটি সেই প্রশ্নের উত্তর দেয়: আমি যদি অন্য কোনো বিকেলে পরীক্ষাটি দিতাম, তাহলে এই সংখ্যাটি কতটা আলাদা হতে পারত?
সূত্রটি সহজ। স্কেলের স্ট্যান্ডার্ড ডেভিয়েশনকে এক বিয়োগ তার নির্ভরযোগ্যতার বর্গমূল দিয়ে গুণ করুন। যে স্কেলের স্ট্যান্ডার্ড ডেভিয়েশন 10 এবং নির্ভরযোগ্যতা 0.85, সেখানে স্ট্যান্ডার্ড এরর প্রায় 3.9 পয়েন্ট।
এই পরিসর আসলে কী কভার করে
প্রায় দুই-তৃতীয়াংশ ক্ষেত্রে একজন ব্যক্তির প্রকৃত অবস্থান তাঁর পর্যবেক্ষিত স্কোরের এক স্ট্যান্ডার্ড এররের মধ্যে থাকে। প্রায় 95 শতাংশ নিশ্চিত হতে হলে দুই পাশে প্রায় দুই স্ট্যান্ডার্ড এরর ধরতে হয়।
উপরের উদাহরণটি নিন। কেউ স্কোর পেলেন 62। 95 শতাংশ ব্যবধান প্রায় 54 থেকে 70 পর্যন্ত। এটি ষোলো পয়েন্টের একটি পরিসর, অথচ যে স্কেলে গড় এবং স্পষ্টভাবে গড়ের উপরের মধ্যে সাধারণ ব্যবধান হয়তো দশ পয়েন্ট।
এটি ওই নির্দিষ্ট পরীক্ষার ত্রুটি নয়। 0.85 নির্ভরযোগ্যতা সম্মানজনক। এটি মনস্তাত্ত্বিক পরিমাপের স্বাভাবিক নির্ভুলতা, আর এ কারণেই যত্নশীল প্রতিবেদনগুলো একটি বিন্দুর বদলে পরিসর উপস্থাপন করে।
যে পরিণতিগুলো মানুষ এড়িয়ে যায়
স্কেলগুলোর মধ্যে ছোট পার্থক্য সাধারণত অর্থহীন। আপনার বহির্মুখিতা যদি 58 এবং উন্মুক্ততা 54 হয়, সৎ পাঠ হলো এ দুটিকে আলাদা করা যায় না। চার পয়েন্টের ব্যবধান থেকে আখ্যান গড়ে তোলা প্রোফাইল ব্যাখ্যা আসলে নয়েজ পড়ছে।
সময়ের সাথে ছোট পরিবর্তনও সাধারণত অর্থহীন। আবার পরীক্ষা দিয়ে পাঁচ পয়েন্ট সরে যাওয়া বেশিরভাগ পরিমাপকের ক্ষেত্রে ত্রুটির সীমার মধ্যেই পড়ে। প্রকৃত বৈশিষ্ট্যের পরিবর্তন ঘটে বছরের পর বছর ধরে, এবং তা দেখা যায় ত্রুটির পরিসরের বেশ বাইরে সরে যাওয়া হিসেবে, মাসে মাসে কয়েক পয়েন্টের হেরফের হিসেবে নয়।
র্যাঙ্ক অনুযায়ী সাজানো সমস্যাটিকে বাড়িয়ে দেয়। বিন্যাসের ঘন মাঝের অংশে কয়েক কাঁচা পয়েন্টের পার্থক্য কাউকে দশ পার্সেন্টাইল ধাপ সরিয়ে দিতে পারে, কারণ বেশিরভাগ মানুষ সেখানেই থাকে। পার্সেন্টাইল র্যাঙ্ক নিখুঁত দেখায়, অথচ স্কোর প্রকাশের সবচেয়ে অস্থিতিশীল উপায় সেটিই।
স্কেলজুড়ে নির্ভুলতা সমান নয়। ক্লাসিক্যাল টেস্ট থিওরি ধরে নেয় প্রতিটি স্কোরের জন্য একটিই ত্রুটির মান, যা একটি সরলীকরণ। আইটেম রেসপন্স থিওরি বৈশিষ্ট্যের প্রতিটি স্তরে আলাদাভাবে ত্রুটি মডেল করে, এবং তা প্রায় সবসময় প্রান্তের দিকে বড় হয়, ঠিক যেখানে সবচেয়ে গুরুত্বপূর্ণ ব্যাখ্যাগুলো করা হয়। খুব উচ্চ বা খুব নিম্ন স্কোর সাধারণত মাঝারি স্কোরের চেয়ে কম নির্ভুল, বেশি নয়।
সৎ প্রতিবেদন কেন কম চমকপ্রদ দেখায়
যে পরিমাপক আস্থার পরিসর দেয়, সেটি এক দশমিক স্থান পর্যন্ত একটি মাত্র সংখ্যা দেওয়া পরিমাপকের চেয়ে অস্পষ্ট দেখায়। অস্পষ্টটি সত্য কথা বলছে। নিখুঁত-দেখতে পরিমাপকটির অন্তর্নিহিত ত্রুটি একই, শুধু সেটি তা দেখাতে চায়নি।
বৈজ্ঞানিকভাবে নথিভুক্ত একটি পরীক্ষা এবং আপনাকে একটি শ্রেণিতে ফেলে দেওয়া বাণিজ্যিক পণ্যের তুলনা করার সময় এ কথা মনে রাখা উচিত। শ্রেণির সীমারেখা একটি নির্দিষ্ট স্কোরে অবস্থিত, আর তার এক পয়েন্ট নিচের একজন এবং এক পয়েন্ট ওপরের একজন পরিসংখ্যানগতভাবে একই ব্যক্তি। টাইপ লেবেল এটি পুরোপুরি আড়াল করে রাখে। টাইপভিত্তিক পরিমাপকের বিরুদ্ধে এটি অন্যতম গুরুতর যুক্তি, এবং এ কারণেই গবেষণায় উল্লিখিত ত্রুটিসহ অবিচ্ছিন্ন স্কোরই মানদণ্ড।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
- মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- অভিসারী ও পৃথকীকারী বৈধতাদুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
- Cronbach's alpha কী, এবং এটি কী নয়মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
- নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
- ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।