De ce majoritatea testelor de personalitate de pe internet nu sunt fidele
Nu pentru că sunt necinstite, ci pentru că pașii care fac o măsurare demnă de încredere sunt invizibili, costisitori și ușor de omis, iar omiterea lor nu schimbă cu nimic modul în care apare rezultatul.
Un test de personalitate gratuit online și un instrument psihometric validat produc un rezultat care pare identic: un scor, o percentilă, un paragraf care te descrie. Diferența se află în întregime în munca pe care nu o poți vedea pe ecranul cu rezultate.
Merită să fim preciși în privința asta, pentru că formularea obișnuită, aceea că testele de pe internet sunt escrocherii, este în cea mai mare parte greșită și nu foarte utilă. Majoritatea sunt create de oameni fără intenția de a înșela. Sunt nefiabile din motive structurale.
Ce se omite de obicei
Analiza itemilor. Într-o scală construită corect, majoritatea itemilor redactați inițial sunt eliminați după testarea pilot: itemi la care nimeni nu variază, itemi care se corelează slab cu totalul, itemi care încarcă mai mult de un factor, itemi care se comportă diferit în funcție de vârstă sau limbă. Un test scris și publicat fără o testare pilot a păstrat tot, inclusiv itemii care nu funcționează.
Confirmarea structurală independentă. Analiza factorială pe datele din care ai construit scala va reconfirma structura pe care ai proiectat-o. Confirmarea acesteia pe un eșantion nou este un studiu separat, și este etapa la care o mare parte dintre scale nu trec testul.
Normele. Percentila trebuie să provină de undeva. Dacă site-ul nu specifică populația sa de referință, numărul provine fie de la vizitatorii anteriori, un grup autoselectat de compoziție necunoscută, fie de nicăieri în special.
Datele test-retest. Stabilirea faptului că oamenii obțin același scor luna următoare necesită identificarea lor din nou. Aproape nimeni nu face asta, ceea ce înseamnă că stabilitatea implicată de cuvântul "trăsătură" nu a fost demonstrată.
Stimulentele de proiectare merg în direcția greșită
Un test construit pentru implicare este optimizat pentru un rezultat diferit de un test construit pentru acuratețe, iar cele două se îndepărtează în moduri previzibile.
Rezultatele lingușitoare performează mai bine. Un rezultat care îți spune ceva neplăcut este partajat mai puțin, astfel că rezultatele se îndreaptă spre descrieri pe care toată lumea le recunoaște la sine. Acesta este efectul Barnum, demonstrat în anii 1940 și reprodus constant de atunci: oamenii evaluează descrierile generice de personalitate ca fiind extrem de exacte în privința lor personală.
Tipurile performează mai bine decât dimensiunile. "Ești un Arhitect" este mai ușor de partajat decât "te situezi la percentila 68 pe deschidere, cu un interval de încredere larg". Tipurile ascund, de asemenea, eroarea de măsurare, întrucât cineva situat cu un punct de o parte sau alta a unei limite de categorie primește etichete complet diferite.
Scurt performează mai bine decât adecvat. Fiecare întrebare adițională pierde respondenți, astfel că testele sunt reduse la o lungime care maximizează finalizarea, nu una care acoperă construitul.
Niciuna dintre acestea nu este o minciună. Sunt optimizări pentru un alt indicator decât acuratețea.
Cum îți dai seama în aproximativ treizeci de secunde
Caută un instrument sursă numit, cu autori și an. Caută o declarație privind populația din care provin normele. Caută orice recunoaștere a limitărilor sau a erorii de măsurare. Caută dacă rezultatul este un scor continuu sau o categorie. Caută dacă aceeași pagină promite și să îți identifice cariera ideală, partenerul sau scopul în viață din douăzeci de întrebări.
Un test care își numește instrumentul, își citează sursa, își declară normele și spune ce nu poate să îți spună a făcut munca necesară. Unul care nu face nimic din toate acestea poate fi totuși un mod plăcut de a-ți petrece cinci minute, dar numărul pe care îl produce este decorativ.
Fiecare instrument din catalogul NOESIS specifică ce test publicat implementează, cine l-a scris, în ce an, cum este scorat și ce nu stabilesc rezultatele sale. Acea ultimă parte este cea care merită comparată.
Testează-te
A citi despre măsurare este un lucru. A-ți vedea propriul scor raportat împreună cu sursa lui, eșantionul de normare și limitele sale este altceva. Gratuit, fără înregistrare.
Continuă lectura
- Ce este psihometria?Disciplina care stabilește dacă o măsurare psihologică este de valoare, și motivul pentru care două teste care pun întrebări similare pot diferi enorm în privința valorii rezultatelor lor.
- Ce este fidelitatea în testarea psihologică?Fidelitatea este consecvența măsurării, nu corectitudinea ei. Un test poate avea o fidelitate ridicată și totuși să măsoare lucrul greșit, motiv pentru care este prima întrebare care se pune și niciodată ultima.
- Ce este validitatea în testarea psihologică?Validitatea nu este o proprietate pe care o are un test. Este un argument privind dacă o anumită interpretare a unui anumit scor, pentru un anumit scop, este defendabilă, și trebuie reconstruită pentru fiecare utilizare nouă.
- Ce este validitatea de construct?Cea mai grea întrebare din măsurare: dacă lucrul pe care îl măsori există așa cum l-ai definit și dacă instrumentul tău îl atinge cu adevărat, și nu ceva adiacent.
- Validitate convergentă și discriminantăDouă cerințe în oglindă: o măsură trebuie să corespundă cu ceea ce ar trebui să corespundă și trebuie să rămână distinctă de ceea ce afirmă că nu este. Majoritatea instrumentelor slabe eșuează la a doua cerință.
- Ce este alfa Cronbach și ce nu esteCea mai raportată statistică în testarea psihologică, și cea mai greșit interpretată. Alpha nu îți spune că o scală este unidimensională, iar o valoare ridicată este adesea un simptom, nu o virtute.
- Eroarea standard de măsurare: cu cât poate varia scorul tăuFiecare scor are o marjă de eroare, iar pentru majoritatea testelor psihologice aceasta este mai largă decât își imaginează oamenii. Acesta este numărul care îți spune când o diferență este reală și când este doar zgomot.
- Norme și percentile: cu ce este comparat scorul tăuUn scor brut este neinterpretabil de la sine. Devine relevant doar în raport cu un grup de referință, și care grup a fost folosit este unul dintre cele mai importante și mai puțin cunoscute aspecte ale oricărui test.
- Cum este construit de fapt un test psihometricDe la definirea construct-ului până la normele publicate, procesul durează ani și elimină cea mai mare parte din ceea ce intră în el. Cunoașterea etapelor face evident care dintre ele au fost sărite de un chestionar online rapid.
- Ce înseamnă atunci când un test este numit validat?Cuvântul nu este reglementat și este folosit liber de produse care nu au făcut nimic din munca necesară. Iată ce înseamnă atunci când înseamnă ceva, și cele patru întrebări care separă cele două cazuri.
- Ce poate și ce nu poate să măsoare autoevaluareaChestionarele îți cer să fii propriul observator, ceea ce funcționează mai bine pentru unele lucruri decât pentru altele. Să știi unde metoda este puternică și unde eșuează schimbă modul în care citești orice rezultat.
- Ce înseamnă atunci când un test prezice cevaO corelație de 0,30 este o constatare solidă în cercetarea personalității și o bază șubredă pentru o decizie despre o singură persoană. Ambele afirmații sunt adevărate, iar diferența dintre ele cauzează cea mai mare parte a utilizării greșite a rezultatelor testelor.
- Screeningul nu este diagnosticUn chestionar de screening este construit să identifice cât mai multe cazuri posibile, acceptând o rată ridicată de fals-pozitive ca preț. Interpretarea unui scor de screening ca diagnostic răstoarnă exact scopul pentru care a fost conceput.