Slovník pojmů

Logistická regrese (logit model)

Definice

Logistická regrese modeluje pravděpodobnost binárního výsledku — pacient odpoví na léčbu / neodpoví, zákazník odejde / zůstane — v závislosti na vysvětlujících proměnných. Koeficienty se interpretují jako poměry šancí (odds ratio): o kolik se násobí šance výsledku při změně prediktoru o jednotku.

Regrese a modely

Na rozdíl od lineární regrese nepředpovídá hodnotu, ale pravděpodobnost v rozmezí 0–1 přes logistickou funkci. Kvalitu modelu posuzujte podle klasifikační tabulky, ROC křivky a AUC, Hosmerova–Lemeshowova testu a pseudo-R²; při nevyvážených třídách (1 % odchodů) je samotná přesnost zavádějící.

Varianty: multinomická logistická regrese pro více než dvě kategorie, ordinální pro seřazené kategorie. Vyžaduje dostatek událostí na prediktor (orientačně 10 a víc) a bez silné multikolinearity.

V Statistice

Logistická regrese je v nabídce Statistiky → Pokročilé lineární/nelineární modely → Zobecněné lineární/nelineární modely (rozdělení binomické, spojovací funkce logit) i v modulu Nelineární odhad; výstupem jsou koeficienty, poměry šancí s intervaly, klasifikační matice a ROC křivka. Pro velké tabulky a automatickou selekci proměnných poslouží také Data Mining.

Související pojmy

Návody v knowledgebase

Časté otázky

Co je poměr šancí 2,5?
Že při zvýšení prediktoru o jednotku (nebo u dané skupiny oproti referenční) je šance výsledku 2,5× vyšší. Interval spolehlivosti obsahující 1 znamená nevýznamný vliv.
Jak posoudit, zda model dobře klasifikuje?
AUC z ROC křivky (0,5 náhoda, nad 0,8 dobrý model), citlivost a specificita při zvoleném prahu — ne jen celková přesnost.

Vyzkoušejte to na vlastních datech

Statistica na 30 dní zdarma

Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.