Regresja logistyczna - kiedy zamiast liniowej
Gdy zmienna zależna jest dychotomiczna (np. zdał / nie zdał, kupił / nie kupił), regresja liniowa jest niewłaściwa - może dawać przewidywania spoza zakresu 0-1. Wtedy używamy regresji logistycznej, która modeluje prawdopodobieństwo zdarzenia.
Wyniki interpretuje się zwykle przez iloraz szans (odds ratio): o ile zmienia się szansa zdarzenia przy wzroście predyktora. Ocenę dopasowania robi się m.in. testem Hosmera-Lemeshowa i pseudo-R kwadrat. Dla wielu kategorii zmiennej zależnej stosuje się regresję wielomianową lub porządkową.
Przykład: przewidujesz zdanie egzaminu (tak/nie) na podstawie liczby godzin nauki i frekwencji. Iloraz szans 1,45 dla godzin nauki oznacza, że każda dodatkowa godzina zwiększa szansę zdania o 45%. Typowy błąd to użycie zwykłej regresji liniowej do zmiennej 0/1 albo interpretowanie surowych współczynników jak w regresji liniowej, zamiast przez iloraz szans.
Wskazówka: oceń dopasowanie (test Hosmera-Lemeshowa, pseudo-R kwadrat, tabela trafności klasyfikacji) i pilnuj wystarczającej liczby zdarzeń na predyktor. Raportuj iloraz szans z przedziałem ufności i istotnością dla każdego predyktora.
Regresja logistyczna to właściwy wybór, gdy przewidujesz zdarzenie typu tak/nie. Interpretacja przez iloraz szans i ocena dopasowania bywają kłopotliwe - jeśli chcesz mieć je policzone i opisane, zaznacz analizę w konfiguratorze albo skonsultuj model z asystentem.
Potrzebujesz tej analizy w swojej pracy?
Dobierz analizy w kilka minut albo zleć obliczenia wraz z opisem wyników w standardzie APA.