Slovník pojmů

Přeučení modelu (overfitting) (overfitting)

Definice

Přeučení nastane, když se model naučí nejen skutečné vztahy, ale i náhodný šum trénovacích dat — na nich je skvělý, na nových datech selhává. Typické u složitých modelů (hluboké stromy, velké sítě, regrese s mnoha prediktory) a malých souborů. Pozná se podle rozdílu mezi trénovací a testovací chybou.

Data mining a strojové učení

Obrana: víc dat, jednodušší model, regularizace (penalizace složitosti), prořezávání stromů, včasné zastavení tréninku sítí, výběr proměnných a hlavně poctivé ověření na datech, která model při učení neviděl. Opakem je podučení (underfitting) — model příliš jednoduchý na to, aby vztah zachytil.

Přeučení hrozí i u klasické statistiky: regrese s 20 prediktory na 30 pozorováních má vysoké R², ale nulovou vypovídací hodnotu. Orientačně potřebujete aspoň 10–20 pozorování na každý odhadovaný parametr.

V Statistice

Statistica proti přeučení nabízí testovací sady a v-fold křížovou validaci ve všech data miningových modulech, prořezávání stromů podle validované chyby, automatické zastavení boostingu a sítí podle testovací chyby a krokovou selekci či informační kritéria v regresi; v prostředí Workspace vidíte trénovací a testovací chybu vedle sebe.

Související pojmy

Návody v knowledgebase

Časté otázky

Jak přeučení poznám?
Trénovací chyba je výrazně nižší než testovací (nebo křížově validovaná). Čím větší rozdíl, tím horší generalizace.
Je vysoké R² známkou dobrého modelu?
Ne nutně — s dostatkem prediktorů dosáhnete vysokého R² i na náhodných datech. Rozhoduje upravené R² a chyba na nových datech.

Vyzkoušejte to na vlastních datech

Statistica na 30 dní zdarma

Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.