Slovník pojmů

Text mining (dolování z textu)

Definice

Text mining převádí nestrukturovaný text — reklamace, poznámky servisu, otevřené odpovědi v dotaznících, zprávy — na strukturovaná data, se kterými umí pracovat statistika. Dokumenty se rozloží na slova a slovní kmeny, spočítají se četnosti a vážené matice (TF-IDF) a nad nimi běží shlukování, klasifikace nebo hledání témat.

Data mining a strojové učení

Typické úlohy: automatické třídění reklamací podle příčiny, hledání opakujících se problémů v servisních záznamech, analýza sentimentu zákaznických hodnocení nebo propojení textu s numerickými daty (kolik stojí vady popsané určitými slovy).

Klíčová je předúprava: stop-slova, lemmatizace či stemming, synonyma a oborový slovník. Výstupní matici dokument × slovo obvykle redukujete singulárním rozkladem (SVD) a teprve pak modelujete — jinak tisíce sloupců zahltí i robustní metody.

V Statistice

Modul Text Mining v nabídce Data Mining načte dokumenty ze souborů, databází či webu, provede stemming pro řadu jazyků, sestaví matici četností s TF-IDF vážením, redukuje ji pomocí SVD a předá výsledky shlukování, stromům nebo neuronovým sítím v prostředí Workspace; frekvence slov a koncepty zobrazí v interaktivních grafech.

Související pojmy

Návody v knowledgebase

Časté otázky

Zvládne text mining češtinu?
Ano — základem je stemming a vlastní slovník stop-slov; u odborných textů se vyplatí doplnit synonyma a zkratky z vašeho oboru.
Kolik dokumentů je potřeba?
Pro popisnou analýzu stačí stovky, pro spolehlivou klasifikaci tisíce označených dokumentů.

Vyzkoušejte to na vlastních datech

Statistica na 30 dní zdarma

Plná verze bez platební karty, kompletně v češtině. Nebo si nechte poslat orientační cenu za minutu.