Cronbach's alpha কী, এবং এটি কী নয়
মনস্তাত্ত্বিক পরীক্ষায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, এবং সবচেয়ে বেশি ভুল বোঝা। আলফা থেকে জানা যায় না যে একটি স্কেল এক-মাত্রিক, আর উচ্চ মান প্রায়ই গুণ নয়, বরং একটি লক্ষণ।
ক্রনবাখের আলফা (Cronbach's alpha) হলো অভ্যন্তরীণ সামঞ্জস্যের একটি সহগ: একটি স্কেলের আইটেমগুলো একে অপরের সাথে কতটা সম্পর্কিত, তার মাত্রা। 1951 সালে প্রকাশিত এই পরিসংখ্যান সাইকোমেট্রিক গবেষণায় সবচেয়ে বেশি উল্লেখ করা পরিসংখ্যান, কিন্তু এর ব্যাপক ব্যবহার এর উপযোগিতাকে ছাড়িয়ে গেছে।
আলফার মান 0 থেকে 1 পর্যন্ত হয় এবং এটি দুটি বিষয়ের ওপর নির্ভর করে: আইটেমগুলোর মধ্যে গড় সহসম্পর্ক এবং আইটেমের সংখ্যা। দ্বিতীয় নির্ভরতাটিই বেশির ভাগ ভুল বোঝাবুঝির উৎস।
উচ্চ আলফা যা বোঝায় না
এর মানে এই নয় যে স্কেলটি একটিমাত্র বিষয় পরিমাপ করে। এটি সবচেয়ে প্রচলিত ভুল। দুই বা তিনটি আলাদা ফ্যাক্টরযুক্ত স্কেলেও আলফা উচ্চ হতে পারে, যদি আইটেমগুলো সামগ্রিকভাবে যথেষ্ট সহসম্পর্কিত হয়। একমাত্রিকতা প্রতিষ্ঠা করতে হয় ফ্যাক্টর বিশ্লেষণ দিয়ে; আলফা তা প্রতিষ্ঠা করতে পারে না, আর সেই উদ্দেশ্যে এটি তৈরিও হয়নি।
এর মানে এই নয় যে স্কেলটি বৈধ। আইটেমগুলো কী পরিমাপ করে, সে সম্পর্কে আলফা কিছুই বলে না। জুতার মাপ নিয়ে কুড়িটি প্রশ্নের অভ্যন্তরীণ সামঞ্জস্য চমৎকার হবে, কিন্তু মনস্তাত্ত্বিক কিছু পরিমাপের ক্ষেত্রে তার বৈধতা শূন্য।
এর মানে এই নয় যে স্কেলটি ভালো। আইটেমের সংখ্যা বাড়লে আলফা বাড়ে, তাই মাঝারি মানের আইটেম দিয়ে তৈরি একটি দীর্ঘ স্কেল চমৎকার আইটেমের একটি সংক্ষিপ্ত স্কেলকে ছাড়িয়ে যেতে পারে। আইটেমগুলোর মধ্যে গড় সহসম্পর্ক 0.2 হলেও চল্লিশ আইটেমের একটি স্কেলের আলফা 0.90-এর ওপরে পৌঁছে যায়।
অতি উচ্চ আলফা প্রায়ই একটি সতর্কসংকেত। মোটামুটি 0.95-এর ওপরে গেলে আইটেমগুলো সাধারণত প্রায় একই কথার পুনরাবৃত্তি হয়। এতে সামঞ্জস্য বাড়ে, কিন্তু কনস্ট্রাক্টের পরিধি হারিয়ে যায়: স্কেলটি একটি সংকীর্ণ দিককে অত্যন্ত নির্ভুলভাবে পরিমাপ করে এবং কনস্ট্রাক্টের বাকি অংশ বাদ পড়ে। একে অ্যাটেনুয়েশন প্যারাডক্স বলা হয়, আর এ কারণেই বেশি সামঞ্জস্য মানেই সবসময় ভালো নয়।
এটি কী ধরে নেয়
আলফা একটি নির্দিষ্ট অনুমানের অধীনে নির্ভরযোগ্যতার নিম্নসীমা: টাউ-সমতুল্যতা, অর্থাৎ প্রতিটি আইটেম অন্তর্নিহিত বৈশিষ্ট্যে সমান অবদান রাখে। বাস্তবের স্কেল প্রায় কখনোই এই শর্ত পূরণ করে না। আইটেমগুলো ফ্যাক্টরে কতটা জোরালোভাবে লোড হয় তা ভিন্ন ভিন্ন হয়, আর তখন আলফা নির্ভরযোগ্যতাকে কম করে অনুমান করে।
ম্যাকডোনাল্ডের ওমেগা সমান অবদানের অনুমান বাদ দেয় এবং প্রকৃত ফ্যাক্টর লোডিং থেকে নির্ভরযোগ্যতা অনুমান করে। পদ্ধতিবিদরা দুই দশক ধরে আলফার চেয়ে এটিকে ব্যবহারের সুপারিশ করে আসছেন। প্রতিবেদনের চর্চা এ ক্ষেত্রে ধীরে এগিয়েছে, মূলত কারণ প্রতিটি পরিসংখ্যান প্যাকেজে আলফা মাত্র এক লাইনের ব্যাপার, ওমেগা তা নয়।
বাস্তবে কীভাবে পড়বেন
মোটামুটি প্রচলিত ধারণা: গোষ্ঠীর মধ্যে তুলনার গবেষণায় 0.70 ও তার বেশি গ্রহণযোগ্য, প্রয়োগমূলক ব্যবহারে 0.80 ও তার বেশি, আর যেখানে স্কোর কোনো ব্যক্তির সিদ্ধান্তকে প্রভাবিত করে সেখানে 0.90 ও তার বেশি। এগুলোকে কঠোর সীমা নয়, দিকনির্দেশনা হিসেবে দেখুন; প্রয়োজনীয় মান নির্ভর করে স্কোরটি যে সিদ্ধান্তে ব্যবহৃত হবে তার গুরুত্বের ওপর।
বেশি তথ্যবহুল সংখ্যাগুলো সাধারণত একই গবেষণাপত্রের অন্য জায়গায় থাকে। আইটেমগুলোর মধ্যে গড় সহসম্পর্ক (0.15 থেকে 0.50 সুস্থ পরিসর) বলে দেয় উচ্চ আলফা এসেছে আইটেমের মান থেকে, নাকি আইটেমের সংখ্যা থেকে। আইটেমের সংখ্যাও অন্য দিক থেকে একই কথা জানায়। পুনঃপরীক্ষার নির্ভরযোগ্যতা এমন কিছু জানায় যা আলফা কাঠামোগতভাবে জানাতে পারে না: একই ব্যক্তির স্কোর সময়ের সাথে স্থিতিশীল কি না।
যে স্কেল শুধু আলফা জানায়, সে নির্ভরযোগ্যতার সংখ্যাগুলোর মধ্যে সবচেয়ে সহজে পাওয়া সংখ্যাটিই জানিয়েছে, এবং যেটি পাস করা সবচেয়ে কম কঠিন।
নিজেই যাচাই করুন
পরিমাপ নিয়ে পড়া এক কথা। আপনার নিজের স্কোর তার উৎস, নর্ম নমুনা ও সীমাবদ্ধতাসহ দেখা আরেক কথা। বিনামূল্যে দেওয়া যায়, সাইনআপ লাগে না।
পড়তে থাকুন
- সাইকোমেট্রিক্স কী?যে শাখা বিচার করে একটি মনস্তাত্ত্বিক পরিমাপ আদৌ ভালো কি না; আর যে কারণে একই ধরনের প্রশ্ন করা দুটি পরীক্ষার ফলাফলের মূল্য বিপুলভাবে আলাদা হতে পারে।
- মনস্তাত্ত্বিক পরীক্ষায় নির্ভরযোগ্যতা কী?নির্ভরযোগ্যতা হলো পরিমাপের ধারাবাহিকতা, সঠিকতা নয়। একটি পরীক্ষা অত্যন্ত নির্ভরযোগ্য হয়েও ভুল জিনিস পরিমাপ করতে পারে। এ কারণেই এটি সবার আগে জিজ্ঞাসা করা প্রশ্ন, কিন্তু কখনোই শেষ প্রশ্ন নয়।
- মনস্তাত্ত্বিক পরীক্ষায় বৈধতা কী?বৈধতা কোনো পরীক্ষার নিজস্ব বৈশিষ্ট্য নয়। এটি একটি যুক্তি: কোনো নির্দিষ্ট উদ্দেশ্যে, কোনো নির্দিষ্ট স্কোরের একটি নির্দিষ্ট ব্যাখ্যা গ্রহণযোগ্য কি না, সেই প্রশ্নের যুক্তি। আর প্রতিটি নতুন ব্যবহারের জন্য এটি নতুন করে গড়ে তুলতে হয়।
- কনস্ট্রাক্ট বৈধতা কী?পরিমাপের সবচেয়ে কঠিন প্রশ্ন: আপনি যা পরিমাপ করছেন তা আপনার সংজ্ঞায়িত রূপে সত্যিই আছে কি না, এবং আপনার পরিমাপক সেটিকে ধরছে, নাকি তার কাছাকাছি অন্য কিছুকে।
- অভিসারী ও পৃথকীকারী বৈধতাদুটি পরস্পর-প্রতিবিম্ব শর্ত: একটি পরিমাপকে তার সঙ্গে মিলতে হবে যার সঙ্গে মেলা উচিত, আবার যা সে নয় বলে দাবি করে তার থেকে আলাদাও থাকতে হবে। বেশিরভাগ দুর্বল পরিমাপক দ্বিতীয় শর্তে ব্যর্থ হয়।
- পরিমাপের পরিমাণগত ত্রুটি (Standard error of measurement): আপনার স্কোরে কতটা তারতম্য থাকতে পারেপ্রতিটি স্কোরের সঙ্গে একটি ত্রুটির সীমা থাকে, এবং বেশিরভাগ মনস্তাত্ত্বিক পরীক্ষায় তা মানুষের ধারণার চেয়ে বড়। এই সংখ্যাটিই আপনাকে বলে দেয় কখন একটি পার্থক্য সত্যিকারের, আর কখন তা নিছক বিচ্যুতি।
- নর্ম ও পার্সেন্টাইল: আপনার স্কোর কীসের সঙ্গে তুলনা করা হয়একটি কাঁচা স্কোর নিজে থেকে ব্যাখ্যা করা যায় না। এটি অর্থবহ হয় কেবল একটি রেফারেন্স গোষ্ঠীর সঙ্গে তুলনা করলে; আর কোন গোষ্ঠী ব্যবহার করা হয়েছে, সেটি যেকোনো পরীক্ষা সম্পর্কে সবচেয়ে গুরুত্বপূর্ণ অথচ সবচেয়ে কম প্রচারিত তথ্যগুলোর একটি।
- একটি সাইকোমেট্রিক পরীক্ষা আসলে কীভাবে তৈরি হয়কনস্ট্রাক্টের সংজ্ঞা নির্ধারণ থেকে শুরু করে প্রকাশিত নর্ম পর্যন্ত, এই ধাপগুলো সম্পন্ন করতে বছরের পর বছর লাগে এবং শুরুর উপকরণের বেশিরভাগই বাদ পড়ে যায়। ধাপগুলো জানলে সহজেই বোঝা যায়, দ্রুত বানানো অনলাইন কুইজ কোনগুলো এড়িয়ে গেছে।
- কোনো পরীক্ষাকে যখন যাচাইকৃত বলা হয়, তখন তার অর্থ কী?শব্দটি নিয়ন্ত্রিত নয়, আর যেসব পণ্য এর জন্য কোনো কাজই করেনি, তারাও এটি অবাধে ব্যবহার করে। শব্দটি যখন সত্যিই কিছু বোঝায়, তখন এর অর্থ কী, আর দুই ক্ষেত্রকে আলাদা করার চারটি প্রশ্ন এখানে দেওয়া হলো।
- ইন্টারনেটের বেশিরভাগ ব্যক্তিত্বের পরীক্ষা কেন নির্ভরযোগ্য নয়তারা অসৎ বলে নয়, বরং যে ধাপগুলো একটি পরিমাপকে নির্ভরযোগ্য করে তোলে সেগুলো চোখে পড়ে না, ব্যয়বহুল এবং এড়িয়ে যাওয়া সহজ; আর সেগুলো এড়িয়ে গেলেও ফলাফল দেখতে একটুও বদলায় না।
- স্ব-প্রতিবেদন কী পরিমাপ করতে পারে এবং কী পারে নাপ্রশ্নাবলি আপনাকে নিজের পর্যবেক্ষক হতে বলে, যা কিছু বিষয়ে অন্যগুলোর চেয়ে ভালো কাজ করে। পদ্ধতিটি কোথায় শক্তিশালী আর কোথায় ব্যর্থ হয়, তা জানলে যেকোনো ফলাফল পড়ার দৃষ্টিভঙ্গি বদলে যায়।
- কোনো পরীক্ষা কিছু পূর্বাভাস দেয় বলতে কী বোঝায়ব্যক্তিত্ব গবেষণায় 0.30 সহসম্বন্ধ একটি শক্তিশালী ফলাফল, অথচ একজন ব্যক্তির সম্পর্কে সিদ্ধান্ত নেওয়ার জন্য এটি দুর্বল ভিত্তি। দুটি কথাই সত্য, আর এই দুইয়ের ফারাকই পরীক্ষার ফলাফলের বেশিরভাগ অপব্যবহারের কারণ।
- স্ক্রিনিং মানে রোগ নির্ণয় নয়একটি স্ক্রিনিং প্রশ্নাবলি তৈরি করা হয় যতগুলো সম্ভব ক্ষেত্র শনাক্ত করার জন্য, এর মূল্য হিসেবে উচ্চ ফলস-পজিটিভ হার মেনে নেওয়া হয়। স্ক্রিনিং স্কোরকে রোগনির্ণয় হিসেবে পড়লে এর নকশার উদ্দেশ্যই উল্টে যায়।