Definice
Rozhodovací strom rozděluje data posloupností jednoduchých pravidel („věk > 45 a příjem < 30 tisíc“) do stále homogennějších skupin, dokud v listech nezbude převažující třída nebo průměrná hodnota. Algoritmy C&RT (CART) a CHAID zvládají klasifikaci i regresi, spojité i kategoriální vstupy a chybějící hodnoty. Výsledek je čitelný jako vývojový diagram.
Data mining a strojové učení
Největší předností je interpretovatelnost: strom ukazuje, které proměnné rozhodují a v jakých mezích, což ocení lékaři, risk manažeři i technologové. Nevýhodou je nestabilita — malá změna dat může změnit strukturu — a sklon k přeučení, který se řeší prořezáváním (pruning) a křížovou validací.
Stromy jsou také základem výkonnějších souborových metod (náhodné lesy, boosted trees), které přesnost výrazně zvyšují za cenu horší interpretovatelnosti. Pro první pochopení dat a nalezení interakcí je jednoduchý strom často nejrychlejší cesta.
V Statistice
V nabídce Data Mining najdete Obecné klasifikační a regresní stromy (C&RT), CHAID i interaktivní stromy, kde větvení řídíte ručně; strom se vykreslí jako přehledný graf s podíly tříd v uzlech, doplní ho matice záměn, důležitost prediktorů a křížová validace. Hotový model uložíte pro skórování nových dat.
Související pojmy
- Náhodné lesy a boostingNáhodné lesy a boosting jsou souborové metody, které kombinují stovky rozhodovacích stromů do jednoho přesnějšího modelu.
- Logistická regreseLogistická regrese modeluje pravděpodobnost binárního výsledku — pacient odpoví na léčbu / neodpoví, zákazník odejde /…
- Křížová validaceKřížová validace odhaduje, jak dobře bude model fungovat na nových datech.
- Přeučení modelu (overfitting)Přeučení nastane, když se model naučí nejen skutečné vztahy, ale i náhodný šum trénovacích dat — na nich je skvělý, na…
- Diskriminační analýzaDiskriminační analýza hledá kombinace proměnných, které nejlépe oddělují předem známé skupiny — zdravé od nemocných…
Návody v knowledgebase
Časté otázky
- C&RT, nebo CHAID?
- C&RT dělá binární větvení a hodí se i pro regresi; CHAID větví do více skupin podle chí-kvadrát testu a je oblíbený v marketingové segmentaci s kategoriálními daty.
- Jak zabránit přeučení stromu?
- Omezte minimální velikost uzlu a hloubku, prořezávejte podle křížové validace a ověřte přesnost na testovacích datech.
Vyzkoušejte to na vlastních datech
Statistica na 30 dní zdarma
Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.
Data mining a strojové učení
Aktualizováno: září 2026.