Slovník pojmů

Náhodné lesy a boosting (random forest)

Definice

Náhodné lesy a boosting jsou souborové metody, které kombinují stovky rozhodovacích stromů do jednoho přesnějšího modelu. Náhodný les staví stromy nezávisle na náhodných podvýběrech dat a proměnných a výsledek průměruje (hlasuje); boosting staví stromy postupně a každý další opravuje chyby předchozích. Obě patří k nejúspěšnějším metodám pro tabulková data.

Data mining a strojové učení

Náhodné lesy jsou robustní vůči přeučení a šumu a téměř bez ladění dávají dobrý výsledek; boosting (stochastic gradient boosting) bývá ještě přesnější, ale citlivější na nastavení (počet stromů, rychlost učení, hloubka). Obě metody poskytují důležitost prediktorů, která částečně nahrazuje ztracenou interpretovatelnost.

Používají se pro predikci odchodu zákazníků, skórování rizika, prediktivní údržbu nebo detekci vad. Přesnost vždy ověřujte na testovacích datech nebo křížovou validací a u nevyvážených tříd sledujte AUC a citlivost, ne jen celkovou přesnost.

V Statistice

V nabídce Data Mining jsou Náhodné lesy (Random Forests) a Boosted Trees (stochastic gradient boosting) pro klasifikaci i regresi, s automatickým zastavením podle testovací chyby, grafy důležitosti prediktorů, maticí záměn, ROC křivkou a uložením modelu pro nasazení; v prostředí Workspace se snadno porovnají s dalšími modely.

Související pojmy

Návody v knowledgebase

Časté otázky

Kdy náhodný les a kdy boosting?
Náhodný les jako spolehlivý první model bez ladění; boosting, když chcete vyždímat maximum přesnosti a máte čas parametry vyladit s křížovou validací.
Jak vysvětlit model, který je „černá skříňka“?
Grafy důležitosti prediktorů a grafy částečné závislosti ukážou, které proměnné a jakým směrem výsledek ovlivňují.

Vyzkoušejte to na vlastních datech

Statistica na 30 dní zdarma

Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.