Definice
Chybějící hodnoty jsou prázdná místa v datech — nezměřený vzorek, nevyplněná otázka, výpadek senzoru. Záleží na tom, proč chybí: náhodně (MCAR), v závislosti na jiných proměnných (MAR), nebo kvůli samotné hodnotě (MNAR — vysoké příjmy se neuvádějí). Podle toho volíte řešení: vynechání případů, nahrazení (imputaci) nebo metody, které chybějící hodnoty zvládají přímo.
Data a vizualizace
Vynechání celých řádků (listwise) je jednoduché, ale při mnoha proměnných ztratíte velkou část dat a při MNAR výsledek vychýlíte. Nahrazení průměrem podceňuje variabilitu; lepší je regresní imputace, k-nejbližší sousedé nebo vícenásobná imputace, která nejistotu nahrazení zohlední.
Vždy nejprve chybějící hodnoty popište: kolik, kde a zda souvisí s jinými proměnnými. Rozhodovací stromy a některé souborové metody zvládají chybějící hodnoty bez imputace pomocí náhradních rozdělení (surrogate splits).
V Statistice
Statistica zobrazí rozsah chybějících hodnot v Popisných statistikách, umožňuje volit vynechání po případech nebo po dvojicích a v nabídce Data nahradit chybějící hodnoty průměrem, mediánem, interpolací či regresním odhadem; stromové metody v Data Miningu pracují s chybějícími hodnotami přímo. Kódy chybějících hodnot jsou volitelné pro každou proměnnou.
Související pojmy
- Odlehlé hodnotyOdlehlá hodnota je pozorování, které se nápadně liší od ostatních — chyba měření či zápisu, jiná populace, nebo skutečný vzácný jev.
- Lineární regreseLineární regrese popisuje, jak závislá proměnná (výnos, cena, spotřeba) závisí na jedné nebo více vysvětlujících…
- Rozhodovací stromyRozhodovací strom rozděluje data posloupností jednoduchých pravidel („věk > 45 a příjem < 30 tisíc“) do stále…
- Populace a výběrPopulace (základní soubor) je celá skupina jednotek, o které chcete něco tvrdit — všichni pacienti, všechny výrobky z linky.
Návody v knowledgebase
Časté otázky
- Kolik chybějících hodnot je ještě přijatelných?
- Do 5 % obvykle nevadí; při 10–20 % zvažte imputaci a nad 30 % u jedné proměnné je otázka, zda ji vůbec použít.
- Je nahrazení průměrem v pořádku?
- Jen u malého podílu a náhodně chybějících dat. Snižuje rozptyl a zkresluje korelace; regresní nebo vícenásobná imputace jsou lepší.
Vyzkoušejte to na vlastních datech
Statistica na 30 dní zdarma
Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.