Text Mining

Z WikiKnihovna

Autor: Kateřina Hořínková

Klíčová slova: informace, databáze, vyhledávání informací

Synonyma: ---

Související pojmy: data mining, web mining

nadřazené - ---

podřazené - ---



Text mining - výklad pojmu

Text mining je proces hledání, shromaždování a odvozování velmi užitečného materiálu z textových zdrojů. To znamená nastavování vzorů v textových souborech, odvozování pravidel vzorů, jejich aplikace na text a extrakce výstupu ve formě smysluplných informací. [3]

Text mining je dobývání znalostí z textů. Je to proces získávání skrytých faktů, z nestrukturovaných či semistrukturovaných (textových) databází.

Může být obšírně definován jako znalostně-intenzivní proces, ve kterém uživatel vzájemně působí v průběhu času za pomoci souboru analytických nástrojů se sbírkou dokumentů. Někdy může být alternativně nazýván data miningem. Rozdíl mezi data miningem a text miningem je ten, že v text miningu vychází vzory z přirozeného jazyka textu, spíše než ze strukturovaných databází faktů.

Úlohy text miningu

Mezi nejdůležitější úlohy text miningu patří:

Kategorizace - dokumenty jsou klasifikovány do předem definovaných tříd. Každý text může být v několika, jedné nebo žádné třídě. Základem je vytvoření trénovacích množin, které obsahují dokumenty správně přiřazené a díky těmto příkladům je pak možno zařazovat dokumenty nové. Tato úloha, která se nazývá učení s učitelem (supervised learning), je použita při úlohách rozpoznávání a strojovém učení.[1]

Shlukování - je souhrnný název pro celou řadu výpočetních postupů, jejichž cílem je rozklad daného souboru na několik relativně homogenních podsouborů (shluků) a to tak, aby jednotky (objekty) uvnitř jednotlivých shluků si byly co nejvíce podobné a jednotky (objekty) patřící do různých shluků si byly podobné co nejméně, přičemž každá jednotka je popsána skupinou znaků (proměnných). Výsledky analýzy závisí na volbě proměnných, zvolené míře podobnosti mezi objekty a shluky a na zvoleném algoritmu výpočtu. Na závěr shlukovací analýzy se proto provádí charakterizace (popis) jednotlivých tříd (tj. shluků) a interpretace. Shlukovací metody jsou úspěšné především v situacích, kdy objekty mají tendenci se seskupovat do přirozených tříd, oproti případům náhodného rozmístnění objektů v atributovém prostoru. [1]

Sumarizace - automatická sumarizace dokumentu umožňuje uživateli v krátkém čase prozumět obsahu daného dokumentu. Systém automatické sumarizace ze vstupního textu vyrobí souhr jeho důležitých částí. [1]

Dva hlavní typy sumarizace:

- sumarizace extrakcí - Souhrn je vyjmut z původního textu pomocí statistických principů nebo za pomocí heuristických metod nebo pomocí obou. Vyjmuté části již nejsou syntakticky ani obsahově měněny. [1]

- obsahová sumarizace - Souhrn je interpretací původního textu. Vzniká přepsáním původního textu tak, že nahrazuje příliš dlouhé části textu jejich kratšími interpretacemi. Například věta "Pěstovala na poli papriku, rajčata a okurky." může být nahrazena větou "Pěstovala na poli zeleninu.". [1]

Extrakce - indukce pravidel, která extrahují položky daného typu z určeného dokumentu, speciálně se tato metoda používá při zpracování HTML a XML stránek. Tedy takových, které používají značkovacího jazyka. Samotný proces extrakce vyžaduje trénovací stránky, kde je ukázáno jaké údaje extrahovat (např. vše co je mezi značkami <a> .... </a>). Ve chvíli, kdy je natrénovaný automat uložen, může denně extrahovat údaje z dané stránky. Bohužel obvykle přestává fungovat při změně designu stránky, a proto je vhodné používat nástroj pro kontrolu HTML kódu. [1]

Vizualizace - tato úloha je použitelná pro všechny předchozí jak doplňková. Například dendrogram pro shlukování ukazuje, jaké je rozložení dokumentů a jakým způsobem byly shluky vytvořeny. Proto můžeme lépe posoudit, zda bylo provedeno správně. Stejně tak při kategorizaci metodou rozhodovacích stromů bývá použita vizualizace.[1]

Využití

Literatura

  1. KOPÁČKOVÁ, Hana. Podpora manažerského rozhodování s využitím strojového učení : (výsledná publikace z grantu GAČR 402/05/P155). Pardubice : Univerzita Pardubice, 2007. 74 s. ISBN 978-80-7395-031-6.
  2. SKLENÁK, Vilém Vyhledávání informací v prostředí webu – mírný pokrok v mezích zákona. In Automatizace knihovnických procesů – 10 : sborník z 10. ročníku semináře pořádaného ve dnech 3.–4. května 2005 v Liberci. Praha : ČVUT, 2005. s. 6. Dostupné z WWW: <http://www.akvs.cz/akp-2005/10-sklenak.pdf>. ISBN 80-01-03228-0.
  3. Toolbox.com [online]. 29.1.2009 [cit. 2010-12-11]. Text mining. Dostupné z WWW: <http://it.toolbox.com/wiki/index.php/Text_Mining>.
  4. Text mining. In Wikipedia : the free encyclopedia [online]. St. Petersburg (Florida) : Wikipedia Foundation, 14.9.2003, last modified on 7.12.2010 [cit. 2010-12-11]. Dostupné z WWW: <http://en.wikipedia.org/wiki/Text_mining>.