Slovník pojmů

Rozhodovací stromy (klasifikační a regresní stromy)

Definice

Rozhodovací strom rozděluje data posloupností jednoduchých pravidel („věk > 45 a příjem < 30 tisíc“) do stále homogennějších skupin, dokud v listech nezbude převažující třída nebo průměrná hodnota. Algoritmy C&RT (CART) a CHAID zvládají klasifikaci i regresi, spojité i kategoriální vstupy a chybějící hodnoty. Výsledek je čitelný jako vývojový diagram.

Data mining a strojové učení

Největší předností je interpretovatelnost: strom ukazuje, které proměnné rozhodují a v jakých mezích, což ocení lékaři, risk manažeři i technologové. Nevýhodou je nestabilita — malá změna dat může změnit strukturu — a sklon k přeučení, který se řeší prořezáváním (pruning) a křížovou validací.

Stromy jsou také základem výkonnějších souborových metod (náhodné lesy, boosted trees), které přesnost výrazně zvyšují za cenu horší interpretovatelnosti. Pro první pochopení dat a nalezení interakcí je jednoduchý strom často nejrychlejší cesta.

V Statistice

V nabídce Data Mining najdete Obecné klasifikační a regresní stromy (C&RT), CHAID i interaktivní stromy, kde větvení řídíte ručně; strom se vykreslí jako přehledný graf s podíly tříd v uzlech, doplní ho matice záměn, důležitost prediktorů a křížová validace. Hotový model uložíte pro skórování nových dat.

Související pojmy

Návody v knowledgebase

Časté otázky

C&RT, nebo CHAID?
C&RT dělá binární větvení a hodí se i pro regresi; CHAID větví do více skupin podle chí-kvadrát testu a je oblíbený v marketingové segmentaci s kategoriálními daty.
Jak zabránit přeučení stromu?
Omezte minimální velikost uzlu a hloubku, prořezávejte podle křížové validace a ověřte přesnost na testovacích datech.

Vyzkoušejte to na vlastních datech

Statistica na 30 dní zdarma

Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.