Slovník pojmů

Chybějící hodnoty (missing data)

Definice

Chybějící hodnoty jsou prázdná místa v datech — nezměřený vzorek, nevyplněná otázka, výpadek senzoru. Záleží na tom, proč chybí: náhodně (MCAR), v závislosti na jiných proměnných (MAR), nebo kvůli samotné hodnotě (MNAR — vysoké příjmy se neuvádějí). Podle toho volíte řešení: vynechání případů, nahrazení (imputaci) nebo metody, které chybějící hodnoty zvládají přímo.

Data a vizualizace

Vynechání celých řádků (listwise) je jednoduché, ale při mnoha proměnných ztratíte velkou část dat a při MNAR výsledek vychýlíte. Nahrazení průměrem podceňuje variabilitu; lepší je regresní imputace, k-nejbližší sousedé nebo vícenásobná imputace, která nejistotu nahrazení zohlední.

Vždy nejprve chybějící hodnoty popište: kolik, kde a zda souvisí s jinými proměnnými. Rozhodovací stromy a některé souborové metody zvládají chybějící hodnoty bez imputace pomocí náhradních rozdělení (surrogate splits).

V Statistice

Statistica zobrazí rozsah chybějících hodnot v Popisných statistikách, umožňuje volit vynechání po případech nebo po dvojicích a v nabídce Data nahradit chybějící hodnoty průměrem, mediánem, interpolací či regresním odhadem; stromové metody v Data Miningu pracují s chybějícími hodnotami přímo. Kódy chybějících hodnot jsou volitelné pro každou proměnnou.

Související pojmy

Návody v knowledgebase

Časté otázky

Kolik chybějících hodnot je ještě přijatelných?
Do 5 % obvykle nevadí; při 10–20 % zvažte imputaci a nad 30 % u jedné proměnné je otázka, zda ji vůbec použít.
Je nahrazení průměrem v pořádku?
Jen u malého podílu a náhodně chybějících dat. Snižuje rozptyl a zkresluje korelace; regresní nebo vícenásobná imputace jsou lepší.

Vyzkoušejte to na vlastních datech

Statistica na 30 dní zdarma

Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.

Data a vizualizace

Aktualizováno: září 2026.