Wartości odstające - jak je wykryć i co z nimi zrobić
Wartości odstające (outliery) to obserwacje mocno oddalone od pozostałych. Bywają błędem (np. pomyłka we wpisie: wiek 220 lat), a bywają prawdziwe i ważne. Problem w tym, że potrafią zniekształcić średnią, odchylenie, korelację i współczynniki regresji.
Do wykrywania używa się wykresu pudełkowego (boxplot), reguły 1,5 rozstępu ćwiartkowego, wyników standaryzowanych (z-score powyżej około 3) oraz - w regresji - odległości Cooka dla obserwacji wpływowych. Warto łączyć metodę liczbową z oglądem wykresu.
Decyzja, co zrobić, zależy od przyczyny. Oczywiste błędy wpisu poprawia się lub usuwa. Realne, choć skrajne wartości można zostawić, przeanalizować osobno, zastosować transformację zmiennej albo metody odporne (mediana zamiast średniej, testy nieparametryczne).
Przykład: w analizie czasu reakcji kilka wyników to 200 ms (przypadkowe kliknięcia), a jeden to 15000 ms (rozproszenie uwagi). Zamiast po cichu je skasować, opisujesz kryterium (np. odrzucenie odpowiedzi poniżej 200 ms i powyżej 3 SD) i stosujesz je konsekwentnie. Typowy błąd to usuwanie „niewygodnych" punktów bez reguły.
Zasada rzetelności: w pracy opisz, ile obserwacji odstających znaleziono, jakim kryterium i jak je potraktowano. Takie decyzje wpływają na wynik testów - jeśli chcesz, by ktoś zweryfikował je niezależnie, skorzystaj z wyceny analizy albo dopytaj asystenta o właściwe podejście do Twoich danych.
Potrzebujesz tej analizy w swojej pracy?
Dobierz analizy w kilka minut albo zleć obliczenia wraz z opisem wyników w standardzie APA.