Definice
Náhodné lesy a boosting jsou souborové metody, které kombinují stovky rozhodovacích stromů do jednoho přesnějšího modelu. Náhodný les staví stromy nezávisle na náhodných podvýběrech dat a proměnných a výsledek průměruje (hlasuje); boosting staví stromy postupně a každý další opravuje chyby předchozích. Obě patří k nejúspěšnějším metodám pro tabulková data.
Data mining a strojové učení
Náhodné lesy jsou robustní vůči přeučení a šumu a téměř bez ladění dávají dobrý výsledek; boosting (stochastic gradient boosting) bývá ještě přesnější, ale citlivější na nastavení (počet stromů, rychlost učení, hloubka). Obě metody poskytují důležitost prediktorů, která částečně nahrazuje ztracenou interpretovatelnost.
Používají se pro predikci odchodu zákazníků, skórování rizika, prediktivní údržbu nebo detekci vad. Přesnost vždy ověřujte na testovacích datech nebo křížovou validací a u nevyvážených tříd sledujte AUC a citlivost, ne jen celkovou přesnost.
V Statistice
V nabídce Data Mining jsou Náhodné lesy (Random Forests) a Boosted Trees (stochastic gradient boosting) pro klasifikaci i regresi, s automatickým zastavením podle testovací chyby, grafy důležitosti prediktorů, maticí záměn, ROC křivkou a uložením modelu pro nasazení; v prostředí Workspace se snadno porovnají s dalšími modely.
Související pojmy
- Rozhodovací stromyRozhodovací strom rozděluje data posloupností jednoduchých pravidel („věk > 45 a příjem < 30 tisíc“) do stále…
- Neuronové sítěUmělá neuronová síť je model složený z vrstev propojených „neuronů“, který se učí z dat aproximovat i velmi složité…
- Křížová validaceKřížová validace odhaduje, jak dobře bude model fungovat na nových datech.
- Přeučení modelu (overfitting)Přeučení nastane, když se model naučí nejen skutečné vztahy, ale i náhodný šum trénovacích dat — na nich je skvělý, na…
- ROC křivka a AUCROC křivka zobrazuje, jak se u klasifikačního modelu mění citlivost (podíl správně zachycených pozitivních) a falešná…
Návody v knowledgebase
Časté otázky
- Kdy náhodný les a kdy boosting?
- Náhodný les jako spolehlivý první model bez ladění; boosting, když chcete vyždímat maximum přesnosti a máte čas parametry vyladit s křížovou validací.
- Jak vysvětlit model, který je „černá skříňka“?
- Grafy důležitosti prediktorů a grafy částečné závislosti ukážou, které proměnné a jakým směrem výsledek ovlivňují.
Vyzkoušejte to na vlastních datech
Statistica na 30 dní zdarma
Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.
Data mining a strojové učení
Aktualizováno: září 2026.