WikiDer > Data-Mining

Datamining

Data-Mining (Data Mining, Data Mining) ist die gezielte Suche nach (statistischen) Zusammenhängen zwischen verschiedenen Datensätze zum Zwecke der Erstellung von Profilen für wissenschaftliche, journalistische oder kommerzielle Zwecke. Eine solche Datensammlung kann durch die Erfassung von Ereignissen in einer Praxissituation (Kaufverhalten der Verbraucher, Symptome bei Patienten etc.) oder durch den Vergleich und die Neuinterpretation der Ergebnisse bereits durchgeführter wissenschaftlicher Studien gebildet werden.

Der Name leitet sich von der Ähnlichkeit zwischen der Suche nach statistischen Zusammenhängen und dem Graben (Mining) nach etwas Wertvollem in einem großen Datenberg ab (Große Daten). Data Mining hilft Unternehmen und Wissenschaftlern, die wesentlichen Informationen auszuwählen. Es kann ein Model erstellt werden, die das Verhalten von Personen oder Systemen vorhersagen können.

Missbrauch statistischer Daten

sehen Missbrauch statistischer Daten für den Hauptartikel zu diesem Thema.

Eine Falle, die beim Data Mining lauert, ist der Trugschluss Cum hoc ergo propter hoc: Wenn Sie genügend Daten analysieren, werden Sie früher oder später zweifellos eine statistische Korrelation zwischen zwei Variablen finden, aber das bedeutet nicht, dass es auch eine Kausalität zwischen den beiden fraglichen Variablen existiert.

Data Mining könnte beispielsweise zeigen, dass es einen Zusammenhang zwischen der Anzahl der Störche und der Geburten in einem bestimmten Land gibt, aber die Schlussfolgerung, dass Störche So Alles, was mit der Geburt von Babys zu tun hat, ist natürlich verfrüht. Schließlich werden keine Korrekturen für die Größe eines Landes oder andere Effekte vorgenommen, die nicht in der Statistik enthalten sind.

Die Wahrscheinlichkeit, dass Data Mining zu falschen Schlussfolgerungen führt, kann verringert werden, indem immer nach den Richtlinien gearbeitet wird wissenschaftliche Methode, die vorschreibt, dass es zuerst a . geben muss falsifizierbarHypothese erstellt werden und das erst nachträglich subsequently Das Hypothese sollte getestet werden.

Algorithmen und Techniken

Data Mining wird durch verschiedene Techniken unterstützt. In diesem Abschnitt werden wir einige dieser Techniken behandeln Algorithmus für Data Mining ist es a-priori-Algorithmus von Rakesh Agrawal et al.

Entscheidungsbäume

"EIN Entscheidungsbaum ist ein Vorhersagemodell, das eine Vorhersage basierend auf einer Reihe von Entscheidungen trifft. Jeder Ast des Baumes ist eine Klassifizierungsfrage und die Blätter des Baumes stellen eine Frage Partitionen des Datensammlung mit ihren jeweiligen Bewertungen vor dem."

Einer der großen Vorteile eines Entscheidungsbaums besteht darin, dass das Modell einfach zu erstellen und sehr leicht zu verstehen ist. Aufgrund dieses Vorteils sind Entscheidungsbäume die am weitesten verbreitete Data-Mining-Technik in der Wirtschaft. Entscheidungsbäume zeichnen sich durch komplexe Algorithmen aus, die in die Praxis umgesetzt werden müssen. Nachteilig ist, dass sie auf einfache Probleme oder Algorithmen nicht anwendbar sind und teilweise störende Daten verwendet werden, die zu einer falschen Antwort führen können.

Ein Entscheidungsbaum ist kein neues Konzept für Data Mining. Es gibt es seit etwa 20 Jahren. Der erste Entscheidungsbaumalgorithmus wurde von J. Ross Quinlan unter dem Namen eingeführt ID3. Seitdem wurde ID3 mehrfach angepasst und verbessert. Es hat sich auch weiter verbreitet. Innerhalb von ID3 gibt es zwei Haupttechnologien, nämlich CART und CHAID.

Neuronale Netze

EIN neurales Netzwerk basiert in gewissem Maße auf der Organisation des menschlichen Gehirns und der Art und Weise, wie das Gehirn lernt. Es gibt zwei wesentliche Strukturelemente im neuronalen Netz:

  • der Knoten: Ähnlich wie der Neuron in einem menschlichen Gehirn.
  • the link: Vergleichbar mit den Verbindungen zwischen diesen Neuronen.

Neuronale Netze waren in den frühen Stadien der Data-Mining-Technologie sehr wichtig. Ein wichtiger Vorteil neuronaler Netze besteht darin, dass sie in ihren Vorhersagen sehr genau sind und auf eine Vielzahl von Problemen angewendet werden können. Sie haben einige wichtige Einschränkungen in Bezug auf Trainingszeit, Klarheit und Dimensionalität. Sie bieten auch keine kurzen und schnellen Lösungen. Die ersten Ideen zu neuronalen Netzen entstanden während der Zweiter Weltkrieg von McCulloch und Pitts. Neuronale Netze übernehmen heute wichtige Aufgaben in der Geschäftswelt. In diese Data-Mining-Technik wird viel investiert.

Es gibt verschiedene Arten von neuronalen Netzen. Einige wichtige Typen sind: Backpropagation, Kohonen-Feature-Maps, Netze mit radialen Basisfunktionen.

Regelinduktion

Regelinduktion ist eine Form des Data Mining, die dem Prozess des Data Mining am ähnlichsten ist. Durch Regelinduktion werden interessante Erkenntnisse aus großen Datenbanken freigelegt, die bisher unbekannt waren. Vorhersagemuster finden sich beispielsweise im Kaufverhalten unserer Gesellschaft. Durch Regelinduktion können Unternehmen darauf reagieren, durch Regelinduktion können wir Informationen in einer einfachen Regel darstellen, wie zum Beispiel: „Wenn das, dann das“. Einige Beispiele: „Wenn Brot, dann Käse“; 'Wenn Kaffee, dann Milch'; usw..

Die Regelinduktion bietet somit viele Vorteile. Das Verfahren hat eine automatische Arbeitsweise, es findet Muster, die für Vorhersagen wichtig sein können, es extrahiert alle Muster aus dem Inhalt von Datenbanken. Letzteres ist sofort einer der größten Nachteile der Regelinduktion: Da alle Muster aus den Daten extrahiert werden, muss anschließend eine zweite Runde Data Mining durchgeführt werden, um die wichtigsten Erfahrungen aus der Liste der Muster zu extrahieren. Dies kann einfache Vorhersagen sehr komplex machen.

Fallbasierte Argumentation

Dieser Ansatz verwendet vergangene Fälle, um bestimmte Muster darin zu identifizieren.

Intelligente Agenten

Informationen werden aus dem Internet und aus Datenbanken auf Basis des Intranets bezogen.

Anwendungen

Forschung

In der Wissenschaft kann Data Mining eingesetzt werden, um zu untersuchen, ob kleine quantitative Unterschiede zwischen Beobachtungen, die "nicht offensichtlich" sind, von Bedeutung scheinen in der Tat nicht von Bedeutung zu sein. Bei sehr großen zu analysierenden Datenmengen kann die Kapazität auf einem Supercomputer ob es möglich ist zu verwenden verteiltes Rechnen.

Ein Beispiel für ein Medikament, dessen potenziell tödliche Nebenwirkung durch Data Mining entdeckt wurde, ist Vioxx, ein entzündungshemmendes Mittel, das daher in 2004 wurde vom Markt genommen.

Bioinformatik

Das Bioinformatik ist eine Unterdomäne von Biologie in dem das Wissen um Informatik versuchen, sich in der Biologie zu bewerben. Ein Bioinformatiker gibt die Daten, die er von einem Molekularbiologen erhalten hat, in ein Datenbank. In dieser Datenbank wird dann mittels Data Mining nach Zusammenhängen gesucht. Einige Beispiele hierfür sind:

  • Vergleichen DNA von verschiedenen Personen, um einen möglichen Zusammenhang mit Krankheiten wie Krebs zu erkennen. Sie wollen zum Beispiel herausfinden, welche Teile der DNA eine bestimmte Krankheit mit größerer Wahrscheinlichkeit treffen. Hat man diese Daten, kann man eventuell die DNA zur Bekämpfung der Krankheiten anpassen.
  • Vergleichen DNA verschiedener Organismen, um Ähnlichkeiten und Unterschiede zu finden. Zum Beispiel kann man Evolutionstheorie durch Data Mining demonstrieren.

Verkauf

Data Mining ist unter anderem Teil eines umfassenderen Prozesses, der allgemein als . bezeichnet wird Business Intelligence.

Data Mining wird häufig in Supermarktketten eingesetzt. Im Laden scannt die Kassiererin Ihre Artikel. Über den Barcode wird dann der Preis des Artikels abgefragt und die Produkte in einem Datenbank zur späteren Analyse.[1]

Durch die Analyse von Einkaufsdaten lassen sich nicht nur Zusammenhänge bei Einkäufen (zum Beispiel Hamburger und Sandwiches) ermitteln, die bei der Aufteilung der Filialen berücksichtigt werden können[2] man kann aber auch das Einkommen, die soziale Schicht und die Familiensituation eines Kunden einigermaßen genau einschätzen. Auch wichtige Ereignisse im Leben der Kunden wie Heirat, Schwangerschaft und Scheidung können mit recht hoher Genauigkeit erkannt und sogar vorhergesagt werden[3].

Außerdem wird untersucht, warum Kunden in den Laden kommen (z. B. wöchentliche Einkäufe und besondere Anlässe) und wann welche Produkte am meisten verkauft werden (z. B. Bier wird am Ende der Woche mehr verkauft). Darüber hinaus wird mittels Data Mining untersucht, für welche Produkte ein Kunde speziell in den Laden kommt (Fahrerartikel). Wenn dieser Artikel nicht mehr vorhanden ist, neigt der Kunde dazu, das Geschäft sofort zu verlassen und kommt möglicherweise nicht einmal mehr zurück. Kann man auch machen Effizienz der Stores mit Data Mining.

Data Mining ermöglicht es Endbenutzern, nützliche Geschäftsinformationen aus großen Datenbanken zu extrahieren.

— Alex Berson und Stephen J. Smiths. Data Warehousing, Data Mining und OLAP. Computing McGraw-Hill, 1997, (Zitat1: S.333, Zitat2: S.351, Zitat3: S.380 ; Bild1: S.351, Bild2: S.380, Bild3: S.475)

Finanzsektor

Im Finanzsektor ist es sehr wichtig, die Marktdamit sie darauf reagieren können. Diese Erkenntnis kann durch die Analyse von Daten aus Vergangenheit und Gegenwart gewonnen werden. Im Finanzsektor nimmt die Datenmenge jedoch exponentiell zu. Eine Antwort darauf bietet Data Mining. Data Mining hat in diesem Sektor sowohl einen prädiktiven als auch einen beschreibenden Wert. Der prädiktive Wert liegt darin, dass bestimmte Trends sichtbar gemacht werden. Ihr beschreibender Wert liegt darin, dass Profile von Kundengruppen erstellt werden können.

Datenjournalismus

investigative Journalisten Verwenden Sie Data Mining, um Fakten und Verbindungen zu finden, die Journalismus Standpunkt kann relevant sein für a Veröffentlichung. So ein investigativer Journalist sucht - oft über die Internet - digitale Archive, suche Nachrichten, Erläuterungen und Hintergründe. Bei seiner digitalen Suche nach Fakten und Zusammenhängen versucht der Journalist beispielsweise, den Wahrheitsgehalt einer Aussage zu untersuchen, ein Ereignis zu rekonstruieren, Desinformation zu widersprechen oder bisher verborgene Zusammenhänge aufzudecken. Die Ausübung von Datenjournalismus beinhaltet oft Informationen, die mit traditionellen journalistischen Ermittlungstechniken unter der Oberfläche geblieben wären.Ein Datenjournalist durchsucht Dateien mit vielen Terabyte der Daten können umfassen: Suchen nach Bildern oder Beweisen für beispielsweise Transaktionen oder Genehmigungen. Auch der sozialen Medien, Wikipedia und Websites internationaler Institutionen, Regierungen und Unternehmen können dabei helfen. In einem kurzen Video erklärt VPRODirektor Shuchen Tan erklärt, wie Forscher von Forschern Hintergrundbeleuchtung als "Fast Detektiv" in der Große Daten Über Schale ging auf die Suche nach unbekannten Verbindungen zwischen Die Niederlande, diese Ölgesellschaft und Iran (Siehe unten unter Externer Link).

Strafverfolgung

Auch der Polizei[4]hat immer mehr (digitale) Daten. Diese Daten werden in einem Data Warehouse gespeichert und die Leute nutzen Data Mining Software diese Daten zu analysieren.

Produktion

Biene Produktion Data Mining wird verwendet, um Maschinenausfälle vorherzusagen und Faktoren zu finden, die die Optimierung von Produktionskapazität Steuerung.

Datenschutz und Ethik

Alle diese Verwendungen haben eine Debatte[5]initiiert über Privatsphäre. Die untersuchten Datenbanken enthalten oft vertrauliche Informationen, insbesondere wenn diese Datenbanken der Regierung oder der medizinischer Bereich abstammen. Oft werden beim Data Mining mehrere Datenbanken gleichzeitig untersucht. Beispielsweise kann es vorkommen, dass Person A in Datenbank A anonym und in Datenbank B nicht anonym ist. Durch Data Mining könnten die Daten von Person A aus Datenbank A und Datenbank B dennoch miteinander verknüpft werden. Auf diese Weise werden Daten gewonnen, auf die man zunächst keinen Zugriff hatte und das Persönlichkeitsrecht wird verletzt.

Auch über die Ethik eine Diskussion wurde eingeleitet. Generell ist es verboten, Menschen nach Rennen, Sex und andere Funktionen. Genau dies geschieht jedoch beim Data Mining.

Die Zukunft des Data Mining

Die größte Herausforderung für die Zukunft besteht darin, die Qualität der Datenbanken zu verbessern. Den aktuellen Datenbanken fehlen viele Daten und Data Mining benötigt genau diese Daten. "Durch die Verbesserung der Datenqualität können wir bessere Data-Mining-Modelle entwickeln."[6]Zukünftig sollen auch Data-Mining-Modelle verständlicher und transparenter entwickelt werden.

Siehe auch

Externe Links

Literaturverzeichnis

  • Dimitri Tokmezis. Der digitale Schatten. Wie sich der Verlust der Privatsphäre und die Zunahme digitaler Profile auf Ihr Leben auswirken, Spektrum, Antwerpen, 2012, p. 17, s. 55-56.