WikiDer > Text-Mining

Textmining

Text-Mining oder Text-Mining bezieht sich auf den Umgang mit allen Arten von IKTTechniken, um wertvolle Informationen aus großen Mengen von Textmaterial zu extrahieren. Mit diesen Techniken wird versucht, Muster und Tendenzen zu erkennen. Konkret werden Texte mit Hilfe von Software strukturiert und analysiert, transformiert, in Datenbanken eingefügt und schließlich ausgewertet und interpretiert.

Text Mining ist verwandt mit Textanalyse; die Begriffe werden oft synonym verwendet.[1]

Obwohl auch quantitative Methoden in der Textanalyse eingesetzt werden, bezieht sich Text Mining eher auf die Analyse im großen Stil: bei Unternehmen im Kontext von Business Intelligence, zum Beispiel zur Analyse von Kundenfeedback, und zum Beispiel im sozialen Medien die öffentliche Meinung abbilden (Stimmungsanalyse). In dem Biotechnologie Text Mining dient der Analyse wissenschaftlicher Informationen aus der gigantischen Menge an Publikationen.[2][3] Text Mining wird auch verwendet von Geheimdienste.[4][5] In diesem Sinne kann Text Mining als eine Form von Data-Mining. Text Mining kann dazu dienen, einen Datensatz zu generieren, auf den dann statistische Analysen angewendet werden.

Text Mining ist ein leichter zugänglicher Begriff für bestimmte Teile des weiten Feldes von Computerlinguistik. Dieses Wissensgebiet beschäftigt sich mit der Verarbeitung menschlicher Sprache durch Computer.

Methodik

Es gibt zwei Hauptgruppen von Methoden zur Implementierung von Text Mining: regelbasiert und via maschinelles Lernen.

Regelbasierte Algorithmen bestehen aus Algorithmen, die versuchen, bestimmte Muster im Text zu erkennen. Diese Muster müssen im Voraus festgelegt werden. Beispielsweise kann man nach den Wörtern „wohnt“ oder „wohnt in“ suchen, um ein Muster im Text zu finden, das beschreibt, wo eine bestimmte Person gerade lebt.

Algorithmen basierend auf maschinellem Lernen (maschinelles Lernen) verwenden keine vordefinierten Muster, sondern lernen sie automatisch aus Text. Als "Training" wird ein Datensatz angegeben, in dem bereits viele richtige Beispiele annotiert wurden. Diese Beispiele werden dann vom Algorithmus verwendet, um die erforderlichen Muster selbst abzuleiten und sie dann auf unsichtbaren Text anzuwenden. Text Mining über maschinelles Lernen wird hauptsächlich seit 2012 mit Neuronale Netze.

Im Allgemeinen sind regelbasierte Systeme präziser, dh die gefundenen Fakten sind in der Regel richtig. Da jedoch jede Variation ein neues Muster erfordert und dies arbeitsintensiv ist, sind die Ergebnisse dieser Systeme oft unvollständig und es fehlen bestimmte Fakten im Text. Auf maschinellem Lernen basierende Algorithmen hingegen haben eine große Möglichkeit der Verallgemeinerung, das heißt, sie finden mehr Informationen im Text, auch wenn diese nicht immer zu 100 % richtig sind.