Text Mining: Porovnání verzí

Z WikiKnihovna
m (75 revizí: IMPORT T-V: import stránek z hlavního jmenného prostoru z KiskWiki (http://kisk.phil.muni.cz/))
 
(Není zobrazeno 47 mezilehlých verzí od jednoho dalšího uživatele.)
Řádek 3: Řádek 3:
 
'''Klíčová slova:''' informace, databáze, vyhledávání informací
 
'''Klíčová slova:''' informace, databáze, vyhledávání informací
  
'''Synonyma:''' ---
+
'''Synonyma:''' - dolování v textech
  
 
'''Související pojmy:''' data mining, web mining
 
'''Související pojmy:''' data mining, web mining
Řádek 9: Řádek 9:
 
''nadřazené'' - ---</blockquote>
 
''nadřazené'' - ---</blockquote>
 
<blockquote>
 
<blockquote>
''podřazené'' - ---</blockquote>
+
''podřazené'' - extrakce informací, sumarizace, shlukování, clustering, sumarizace</blockquote>
  
  
Řádek 16: Řádek 16:
  
 
== Text mining - výklad pojmu ==
 
== Text mining - výklad pojmu ==
Text mining je proces hledání, shromaždování a odvozování velmi užitečného materiálu z textových zdrojů. To znamená nastavování vzorů v textových souborech, odvozování pravidel vzorů, jejich aplikace na text a extrakce výstupu ve formě smysluplných informací. [[#Literatura|[4]]]
+
Možno přeložit jako "dolování v textech".
  
Text mining je dobývání znalostí z textů. Je to proces získávání skrytých faktů, z nestrukturovaných či semistrukturovaných (textových) databází.
+
Text mining lze definovat jako proces objevování (získávání) znalostí, který má za cíl identifikovat a analyzovat užitečné informace v textech, jež jsou zajímavé pro uživatele. Dolování v textech lze také definovat jako netriviální extrakci implicitních, předem neznámých a potencionálně užitečných informací z (velkého množství) textových dat. [[#Literatura|[5]]]
  
Může být obšírně definován jako znalostně-intenzivní proces, ve kterém uživatel vzájemně působí v průběhu času za pomoci souboru analytických nástrojů se sbírkou dokumentů. Někdy může být alternativně nazýván data miningem. Rozdíl mezi data miningem a text miningem je ten, že v text miningu vychází vzory z přirozeného jazyka textu, spíše než ze strukturovaných databází faktů.
+
Cílem text miningu je usnadnění vyhledávání a zpracování informací. Výstupem jsou smysluplné informace.
 +
 
 +
Někdy může být alternativně nazýván data miningem. Rozdíl mezi data miningem a text miningem je ten, že v text miningu vychází vzory z přirozeného jazyka textu spíše než ze strukturovaných databází faktů.
 +
 
 +
 
 +
Důsledek efektivnějšího využívání informací může být například zvýšení ziskovosti, efektivity práce, aj.[[#Literatura|[5]]]
  
 
== Úlohy text miningu ==
 
== Úlohy text miningu ==
'''''Mezi nejdůležitější úlohy text miningu patří:'''''
+
'''Nejdůležitější úlohy text miningu:'''
 +
 
 +
'''Kategorizace''' - zařazení dokumentů do předem definovaných tříd. Každý text může být v několika, jedné nebo žádné třídě. Třídy jsou děleny například podle autora, názvu, klíčového slova, tématu atp.
  
 +
'''Shlukování''' - je automatická činnost sloužící ke sloučení objektů do shluků, které si jsou podobné podle zadaných parametrů. Cílem je, aby si jednotky uvnitř shluků (clusterů) byly co nejvíce podobné a a zároveň aby si shluky a jednotky patřící do různých shluků byly podobné co nejméně.
  
'''Kategorizace''' - dokumenty jsou klasifikovány do předem definovaných tříd. Každý text může být v několika, jedné nebo žádné třídě.
 
Základem je vytvoření trénovacích množin, které obsahují dokumenty správně přiřazené a díky těmto příkladům je pak možno zařazovat dokumenty nové. Tato úloha, která se nazývá učení s učitelem (supervised learning), je použita při úlohách rozpoznávání a strojovém učení.[[#Literatura|[1]]]
 
  
'''Shlukování''' - je souhrnný název pro celou řadu výpočetních postupů, jejichž cílem je rozklad daného souboru na několik relativně homogenních podsouborů (shluků) a to tak, aby jednotky (objekty) uvnitř jednotlivých shluků si byly co nejvíce podobné a jednotky (objekty) patřící do různých shluků si byly podobné co nejméně, přičemž každá jednotka je popsána skupinou znaků (proměnných). Výsledky analýzy závisí na volbě proměnných, zvolené míře podobnosti mezi objekty a shluky a na zvoleném algoritmu výpočtu. Na závěr shlukovací analýzy se proto provádí charakterizace (popis) jednotlivých tříd (tj. shluků) a interpretace. Shlukovací metody jsou úspěšné především v situacích, kdy objekty mají tendenci se seskupovat do přirozených tříd, oproti případům náhodného rozmístnění objektů v atributovém prostoru. [[#Literatura|[1]]]
+
'''Extrakce informací''' - cílem je automaticky získat strukturované informace z daného dokumentu.  
  
'''Sumarizace''' - automatická sumarizace dokumentu umožňuje uživateli v krátkém čase prozumět obsahu daného dokumentu. Systém automatické sumarizace ze vstupního textu vyrobí souhr jeho důležitých částí. [[#Literatura|[1]]]
+
'''Sumarizace''' - shrnutí obsahu textu. ''"Umožňuje uživateli v krátkém čase porozumět obsahu daného dokumentu."''[[#Literatura|[1]]]
  
'''''Dva hlavní typy sumarizace:'''''
 
<blockquote>
 
''- sumarizace extrakcí'' - Souhrn je vyjmut z původního textu pomocí statistických principů nebo za pomocí heuristických metod nebo pomocí obou. Vyjmuté části již nejsou syntakticky ani obsahově měněny. [[#Literatura|[1]]]</blockquote>
 
<blockquote>
 
''- obsahová sumarizace'' - Souhrn je interpretací původního textu. Vzniká přepsáním původního textu tak, že nahrazuje příliš dlouhé části textu jejich kratšími interpretacemi. Například věta "Pěstovala na poli papriku, rajčata a okurky." může být nahrazena větou "Pěstovala na poli zeleninu.". [[#Literatura|[1]]]</blockquote>
 
  
'''Extrakce''' - indukce pravidel, která extrahují položky daného typu z určeného dokumentu, speciálně se tato metoda používá při zpracování HTML a XML stránek. Tedy takových, které používají značkovacího jazyka. Samotný proces extrakce vyžaduje trénovací stránky, kde je ukázáno jaké údaje extrahovat (např. vše co je mezi značkami <b><a> .... </a></b>). Ve chvíli, kdy je natrénovaný automat uložen, může denně extrahovat údaje z dané stránky. Bohužel obvykle přestává fungovat při změně designu stránky, a proto je vhodné používat nástroj pro kontrolu HTML kódu. [[#Literatura|[1]]]
+
[[Soubor:text mining.jpg]]
  
'''Vizualizace''' - tato úloha je použitelná pro všechny předchozí jak doplňková. Například dendrogram pro shlukování ukazuje, jaké je rozložení dokumentů a jakým způsobem byly shluky vytvořeny. Proto můžeme lépe posoudit, zda bylo provedeno správně. Stejně tak při kategorizaci metodou rozhodovacích stromů bývá použita vizualizace.[[#Literatura|[1]]]
+
'''Proces text miningu - ilustrativní schéma[[#Literatura|[2]]]'''
  
 
== Typické využití ==
 
== Typické využití ==
 +
'''Pár příkladů možného využití text miningu:'''
  
'''Analýza odpovědí z otevřeného průzkumu''' – V dotaznících není neobvyklé použití tzv. “otevřených” otázek. Smyslem je dát respondentu prostor k vyjádření jeho pohledu nebo názoru bez omezení určitých hranic nebo určitého formátu odpovědi. Díky tomu můžeme získat náhled na zákazníkovy pohledy a názory, které by nám jinak zůstaly utajeny (v případě použití odborníky navrženého strukturovaného dotazníku). Například můžeme objevit určitý soubor slov nebo termínů, používaných běžne respondenty při popisu plusů a záporů produktu nebo služby.
+
'''Zkoumání konkurence - "crawling" (procházení) webových stránek konkurence''' – užití text miningu s velkým potenciálem. Je to automatické zpracovávání obsahů webových stránek, které slouží jako velmi efektivní způsob získávání důležitých obchodních informací o aktivitách konkurentů. Například prozkoumáním stránek konkurenční společnosti můžeme automaticky odvodit pojmy a dokumenty, které jsou na dané stránce k dispozici, a díky tomu určit nejdůležitější funkce a zaměření společnosti.
  
'''Automatické zpracování zpráv, emailů apod.''' – další běžná aplikace text miningu je pomoci s automatickým tříděním textů. Například, je možné vyfiltrovat automaticky nechtěnou poštu (“junk mail”), na základě určitých termínů nebo slov, která se v běžných legitimních zprávách nevyskytují. Takto jsou takové nevyžádané zprávy automaticky odstraněny. Tyto automatické systémy mohou také být použity i tam, kde je třeba zprávy přesměrovat na nejpravděpodobněji odpovídající oddělení nebo agenturu (např. email se stížností nebo požadavkem na městský úřad). Zároveň jsou emaily kontrolovány, zda neobsahují nevhodné nebo obscéní výrazy, tyto pak jsou automaticky navráceny odesílateli s požadavkem na odstranění těchto nevhodných výrazů.
+
'''Analýza odpovědí z otevřeného průzkumu''' – pomocí této analýzy můžeme objevit soubory slov a termínů používaných respondenty při popisu plusů a záporů produktu nebo služby. V dotaznících se obvykle používají tzv. "otevřené" otázky a odpovědi. Jejich smyslem je dát respondentovi prostor k vyjádření pohledu nebo názoru bez omezení hranicemi nebo formátem odpovědi. K utřídění těchto odpovědí je vhodný právě text mining.
  
'''Analýza záruky nebo pojistných škod, vstupních pohovorů atp.''' -  v některých komerčních sférách je většina informací sbírána otevřenou textovou formou. Například požadavky na záruku, hlášení pojistných škod, vstupní lékařské prohlídky. Tyto mohou být shrnuty do krátkých vyprávění. Tyto poznámky jsou elektronicky zpracovávány, takže tato “vyprávění” jsou pak kdykoliv k dispozici pro aplikaci algoritmů text miningu. Tyto informace mohou být užitečně využity například, k identifikaci běžných shluků problémů nebo stížností na určité automobily atp. Nápodobně v lékařském oboru, pacientův popis příznaků nám může přinést užitečná vodítka vedoucí ke konečné diagnóze.
+
'''Užití ve SPAM filtrech - automatické zpracování zpráv, emailů apod.''' – tato aplikace pomáhá s automatickým tříděním textů, emailů atp. Využití je hlavně při filtrování nevyžádané pošty či přesměrování emailů na správná oddělení (například emaily s požadavky na městský úřad atp.). Může také sloužit jako určitá bariéra či screening příchozích emailů a odflitrovat či vrátit emaily, kde jsou použita nevhodná či vulgární slova.
  
'''Zkoumání konkurence - "crawling"(prolézání)webových stránek konkurence''' – další typ potencionálně velmi užitecného využití text miningu je automatické zpracování obsahu webových stránek na určitých doménách. Například můžeme jít na webovou stránku a prolézat odkazy, které zde najdeme a prozkoumat všechny webové stránky, které zde jsou uvedeny. Tímto způsobem by jsme mohli automaticky odvodit seznam pojmů a dokumentů, které jsou na dané stránce k dispozici a tím pádem rychle určit nejdůležitější pojmy a popisované funkce. Tyto možnosti nám mohou velice efektivně dodat důležitou obchodní inteligenci o aktivitách našich konkurentů. [[#Literatura|[3]]]
+
'''Analýzy reklamací, pojistných škod, vstupních pohovorů atp.''' -  analýza záznamů a otevřených textů z komerčních sfér. Při aplikaci text miningového algoritmu jsou poznámky zpracovány a jako výstup poskytují například shluky problémů a stížností na určité produkty nebo služby (například z reklamací, stížností). Stejně tak lze použít i v lékařském oboru při určování diagnóz (vstupní lékařské prohlídky).
  
 
== Literatura ==
 
== Literatura ==
 
# KOPÁČKOVÁ, Hana. ''Podpora manažerského rozhodování s využitím strojového učení : (výsledná publikace z grantu GAČR 402/05/P155).'' Pardubice : Univerzita Pardubice, 2007. 74 s. ISBN 978-80-7395-031-6.
 
# KOPÁČKOVÁ, Hana. ''Podpora manažerského rozhodování s využitím strojového učení : (výsledná publikace z grantu GAČR 402/05/P155).'' Pardubice : Univerzita Pardubice, 2007. 74 s. ISBN 978-80-7395-031-6.
 +
# MAHMOUD AL-AYYOUB, Munyaradzi Chiwara, et al. ''Stony Brook University : Department of Computer Science'' [online]. 2009 [cit. 2010-12-28]. Text mining. Dostupné z WWW: <http://www.cs.sunysb.edu/~cse634/presentations/TextMining.pdf>.
 +
# ''SAS'' [online]. 2009-09-15 [cit. 2010-12-23]. Introduction to Text Mining and SAS Text Miner 4.1. Dostupné z WWW: <http://support.sas.com/documentation/cdl/en/tmgs/62416/HTML/default/p1vvxc2tdb3s79n1jigfqwhjguiy.htm>.
 
# SKLENÁK, Vilém Vyhledávání informací v prostředí webu – mírný pokrok v mezích zákona. In ''Automatizace knihovnických procesů – 10 : sborník z 10. ročníku semináře pořádaného ve dnech 3.–4. května 2005 v Liberci.'' Praha : ČVUT, 2005. s. 6. Dostupné z WWW: <http://www.akvs.cz/akp-2005/10-sklenak.pdf>. ISBN 80-01-03228-0.
 
# SKLENÁK, Vilém Vyhledávání informací v prostředí webu – mírný pokrok v mezích zákona. In ''Automatizace knihovnických procesů – 10 : sborník z 10. ročníku semináře pořádaného ve dnech 3.–4. května 2005 v Liberci.'' Praha : ČVUT, 2005. s. 6. Dostupné z WWW: <http://www.akvs.cz/akp-2005/10-sklenak.pdf>. ISBN 80-01-03228-0.
 +
# SEDLÁČEK, Petr. ''Faculty of Informatics MU'' [online]. 2003 [cit. 2010-12-27]. Text mining a jeho možnosti (aplikace). Dostupné z WWW: <http://www.fi.muni.cz/usr/jkucera/pv109/2003p/xsedlac5.htm>.
 
# ''StatSoft'' [online]. c2010 [cit. 2010-12-11]. Text mining. Dostupné z WWW: <http://www.statsoft.com/textbook/text-mining/>.
 
# ''StatSoft'' [online]. c2010 [cit. 2010-12-11]. Text mining. Dostupné z WWW: <http://www.statsoft.com/textbook/text-mining/>.
# ''Toolbox.com'' [online]. 29.1.2009 [cit. 2010-12-11]. Text mining. Dostupné z WWW: <http://it.toolbox.com/wiki/index.php/Text_Mining>.
 
# Text mining. In Wikipedia : the free encyclopedia [online]. St. Petersburg (Florida) : Wikipedia Foundation, 14.9.2003, last modified on 7.12.2010 [cit. 2010-12-11]. Dostupné z WWW: <http://en.wikipedia.org/wiki/Text_mining>.
 

Aktuální verze z 20. 2. 2012, 12:08

Autor: Kateřina Hořínková

Klíčová slova: informace, databáze, vyhledávání informací

Synonyma: - dolování v textech

Související pojmy: data mining, web mining

nadřazené - ---

podřazené - extrakce informací, sumarizace, shlukování, clustering, sumarizace



Text mining - výklad pojmu

Možno přeložit jako "dolování v textech".

Text mining lze definovat jako proces objevování (získávání) znalostí, který má za cíl identifikovat a analyzovat užitečné informace v textech, jež jsou zajímavé pro uživatele. Dolování v textech lze také definovat jako netriviální extrakci implicitních, předem neznámých a potencionálně užitečných informací z (velkého množství) textových dat. [5]

Cílem text miningu je usnadnění vyhledávání a zpracování informací. Výstupem jsou smysluplné informace.

Někdy může být alternativně nazýván data miningem. Rozdíl mezi data miningem a text miningem je ten, že v text miningu vychází vzory z přirozeného jazyka textu spíše než ze strukturovaných databází faktů.


Důsledek efektivnějšího využívání informací může být například zvýšení ziskovosti, efektivity práce, aj.[5]

Úlohy text miningu

Nejdůležitější úlohy text miningu:

Kategorizace - zařazení dokumentů do předem definovaných tříd. Každý text může být v několika, jedné nebo žádné třídě. Třídy jsou děleny například podle autora, názvu, klíčového slova, tématu atp.

Shlukování - je automatická činnost sloužící ke sloučení objektů do shluků, které si jsou podobné podle zadaných parametrů. Cílem je, aby si jednotky uvnitř shluků (clusterů) byly co nejvíce podobné a a zároveň aby si shluky a jednotky patřící do různých shluků byly podobné co nejméně.


Extrakce informací - cílem je automaticky získat strukturované informace z daného dokumentu.

Sumarizace - shrnutí obsahu textu. "Umožňuje uživateli v krátkém čase porozumět obsahu daného dokumentu."[1]


Soubor:Text mining.jpg

Proces text miningu - ilustrativní schéma[2]

Typické využití

Pár příkladů možného využití text miningu:

Zkoumání konkurence - "crawling" (procházení) webových stránek konkurence – užití text miningu s velkým potenciálem. Je to automatické zpracovávání obsahů webových stránek, které slouží jako velmi efektivní způsob získávání důležitých obchodních informací o aktivitách konkurentů. Například prozkoumáním stránek konkurenční společnosti můžeme automaticky odvodit pojmy a dokumenty, které jsou na dané stránce k dispozici, a díky tomu určit nejdůležitější funkce a zaměření společnosti.

Analýza odpovědí z otevřeného průzkumu – pomocí této analýzy můžeme objevit soubory slov a termínů používaných respondenty při popisu plusů a záporů produktu nebo služby. V dotaznících se obvykle používají tzv. "otevřené" otázky a odpovědi. Jejich smyslem je dát respondentovi prostor k vyjádření pohledu nebo názoru bez omezení hranicemi nebo formátem odpovědi. K utřídění těchto odpovědí je vhodný právě text mining.

Užití ve SPAM filtrech - automatické zpracování zpráv, emailů apod. – tato aplikace pomáhá s automatickým tříděním textů, emailů atp. Využití je hlavně při filtrování nevyžádané pošty či přesměrování emailů na správná oddělení (například emaily s požadavky na městský úřad atp.). Může také sloužit jako určitá bariéra či screening příchozích emailů a odflitrovat či vrátit emaily, kde jsou použita nevhodná či vulgární slova.

Analýzy reklamací, pojistných škod, vstupních pohovorů atp. - analýza záznamů a otevřených textů z komerčních sfér. Při aplikaci text miningového algoritmu jsou poznámky zpracovány a jako výstup poskytují například shluky problémů a stížností na určité produkty nebo služby (například z reklamací, stížností). Stejně tak lze použít i v lékařském oboru při určování diagnóz (vstupní lékařské prohlídky).

Literatura

  1. KOPÁČKOVÁ, Hana. Podpora manažerského rozhodování s využitím strojového učení : (výsledná publikace z grantu GAČR 402/05/P155). Pardubice : Univerzita Pardubice, 2007. 74 s. ISBN 978-80-7395-031-6.
  2. MAHMOUD AL-AYYOUB, Munyaradzi Chiwara, et al. Stony Brook University : Department of Computer Science [online]. 2009 [cit. 2010-12-28]. Text mining. Dostupné z WWW: <http://www.cs.sunysb.edu/~cse634/presentations/TextMining.pdf>.
  3. SAS [online]. 2009-09-15 [cit. 2010-12-23]. Introduction to Text Mining and SAS Text Miner 4.1. Dostupné z WWW: <http://support.sas.com/documentation/cdl/en/tmgs/62416/HTML/default/p1vvxc2tdb3s79n1jigfqwhjguiy.htm>.
  4. SKLENÁK, Vilém Vyhledávání informací v prostředí webu – mírný pokrok v mezích zákona. In Automatizace knihovnických procesů – 10 : sborník z 10. ročníku semináře pořádaného ve dnech 3.–4. května 2005 v Liberci. Praha : ČVUT, 2005. s. 6. Dostupné z WWW: <http://www.akvs.cz/akp-2005/10-sklenak.pdf>. ISBN 80-01-03228-0.
  5. SEDLÁČEK, Petr. Faculty of Informatics MU [online]. 2003 [cit. 2010-12-27]. Text mining a jeho možnosti (aplikace). Dostupné z WWW: <http://www.fi.muni.cz/usr/jkucera/pv109/2003p/xsedlac5.htm>.
  6. StatSoft [online]. c2010 [cit. 2010-12-11]. Text mining. Dostupné z WWW: <http://www.statsoft.com/textbook/text-mining/>.