{"id":174906,"date":"2023-04-22T13:51:34","date_gmt":"2023-04-22T12:51:34","guid":{"rendered":"https:\/\/liora.io\/de\/?p=174906"},"modified":"2026-08-07T14:24:19","modified_gmt":"2026-08-07T12:24:19","slug":"data-preprocessing-wie-man-seine-daten-vor-der-verarbeitung-vorbereitet","status":"publish","type":"post","link":"https:\/\/liora.io\/de\/data-preprocessing-wie-man-seine-daten-vor-der-verarbeitung-vorbereitet","title":{"rendered":"Data Preprocessing: Wie man seine Daten vor der Verarbeitung vorbereitet"},"content":{"rendered":"\n<p><strong>Da immer mehr Daten erfasst und systematisch verarbeitet werden, haben sich Machine-Learning-Methoden durchgesetzt, die viele Daten ben\u00f6tigen, um zu laufen und zu trainieren. Obwohl man naiv annehmen k\u00f6nnte, dass eine gro\u00dfe Anzahl von Daten ausreicht, um einen leistungsf\u00e4higen Algorithmus zu haben, sind die uns zur Verf\u00fcgung stehenden Daten meistens nicht geeignet und m\u00fcssen meistens vorab bearbeitet werden, um sie dann verwenden zu k\u00f6nnen: das ist der Schritt des Data Preprocessing.<\/strong><\/p>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex is-content-justification-center wp-container-core-buttons-is-layout-5ee10de4\" style=\"margin-top:32px;margin-bottom:32px\"><div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/liora.io\/de\/weiterbildung\/data-ki\/data-analyst\">Unsere Weiterbildungen<\/a><\/div><\/div>\n\n\n\n<p>Fehler bei der <a href=\"https:\/\/liora.io\/de\/data-science-und-bildung-wie-daten-die-bildung-veraendern\">Datenerfassung<\/a>, die auf menschliche oder technische Fehler zur\u00fcckzuf\u00fchren sind, k\u00f6nnen unser Dataset verf\u00e4lschen und das Training verzerren. Zu diesen Fehlern geh\u00f6ren unvollst\u00e4ndige Informationen, fehlende oder falsche Werte oder St\u00f6rger\u00e4usche, die mit der Datenerfassung zusammenh\u00e4ngen.<\/p>\n\n\n\n<p>Daher ist es oft notwendig, eine Strategie der Datenvorverarbeitung ,  auch <strong>Data Preprocessing<\/strong> genannt ,  aus unseren Rohdaten zu erstellen, um zu verwertbaren Daten zu gelangen, die uns ein besseres Modell liefern. Wir werden die wichtigsten Schritte des Data Preprocessing, ihre Bedeutung und ihre Implementierung in <a href=\"https:\/\/liora.io\/de\/api-mit-python-datenbank-verbinden\">Python<\/a> untersuchen.<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\" style=\"margin-top:32px;margin-bottom:32px\"><img alt=\"Illustration zu \u201eData Cleaning f\u00fcr das Data Preprocessing\u201c\" decoding=\"async\" height=\"1081\" loading=\"lazy\" sizes=\"(max-width: 1099px) 100vw, 1099px\" src=\"https:\/\/liora.io\/app\/uploads\/sites\/8\/2023\/04\/image3-3.png\" srcset=\"https:\/\/liora.io\/app\/uploads\/sites\/8\/2023\/04\/image3-3.png 1099w, https:\/\/liora.io\/app\/uploads\/sites\/8\/2023\/04\/image3-3-300x295.png 300w, https:\/\/liora.io\/app\/uploads\/sites\/8\/2023\/04\/image3-3-1024x1007.png 1024w, https:\/\/liora.io\/app\/uploads\/sites\/8\/2023\/04\/image3-3-768x755.png 768w\" style=\"width:100%;height:auto\" width=\"1099\"\/><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"data-cleaning-fur-das-data-preprocessing\">Data Cleaning f\u00fcr das Data Preprocessing<\/h2>\n\n\n\n<p>Der erste Schritt ist die <a href=\"https:\/\/liora.io\/de\/data-cleaning\">Bereinigung von falschen, unvollst\u00e4ndigen oder fehlenden Daten<\/a>. Es gibt verschiedene M\u00f6glichkeiten, mit diesen Problemen umzugehen, die wir im Folgenden besprechen.<\/p>\n\n\n\n<p>Wenn Daten im <a href=\"https:\/\/liora.io\/de\/datasets-top-5-websites-fuer-qualitativ-hochwertige-datensaetze\">Dataset<\/a> fehlen, kannst du sie ignorieren, wenn die Datenbank gut gef\u00fcllt ist und viele Daten in einer Zeile fehlen.<\/p>\n\n\n\n<p>Du kannst auch entscheiden, die fehlenden Daten auf verschiedene Arten zu f\u00fcllen:<\/p>\n\n\n\n<p>Du kannst sie durch den Mittelwert, den Median oder z. B. bei kategorialen Variablen durch die h\u00e4ufigste Modalit\u00e4t (auch Modus genannt) ersetzen.<\/p>\n\n\n\n<p>Pandas stellt uns Methoden zur Verf\u00fcgung, mit denen wir diese Bearbeitungen wie folgt durchf\u00fchren k\u00f6nnen:<\/p>\n\n\n\n<p>Es kann vorkommen, dass <strong>Daten unter st\u00f6rendem Rauschen bei der Erfassung leiden<\/strong>, in diesem Fall k\u00f6nnen sie von einem Computer nicht richtig verarbeitet werden. Eine M\u00f6glichkeit, dieses Problem zu l\u00f6sen, ist das Binning der (vorsortierten) Daten.<\/p>\n\n\n\n<p>Die Daten werden in Gruppen gleicher Gr\u00f6\u00dfe aufgeteilt und jede Gruppe wird unabh\u00e4ngig verarbeitet. Innerhalb einer Gruppierung k\u00f6nnen alle Daten durch ihren Mittelwert, Median oder die Extremwerte ersetzt werden.<\/p>\n\n\n\n<p>Eine andere M\u00f6glichkeit, mit verrauschten Daten umzugehen, ist die Verwendung einer Regression oder eines<strong> Clusters,<\/strong> die automatisch Gruppen von Daten bilden und es uns erm\u00f6glichen, Ausrei\u00dfer zu erkennen und sie aus der Datenbank zu entfernen.<\/p>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex is-content-justification-center wp-container-core-buttons-is-layout-5ee10de4\" style=\"margin-top:32px;margin-bottom:32px\"><div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/liora.io\/de\/weiterbildung\/data-ki\/data-analyst\">Data Analyst Weiterbildung entdecken<\/a><\/div><\/div>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"data-transformation-im-rahmen-des-data-preprocessing\">Data Transformation im Rahmen des Data Preprocessing<\/h3>\n\n\n\n<p>Diese Vorverarbeitungsstufe umfasst die Ver\u00e4nderungen, die an der eigentlichen Struktur der Daten vorgenommen werden.<\/p>\n\n\n\n<p>Diese Ver\u00e4nderungen stehen im Zusammenhang mit den mathematischen Definitionen der <a href=\"https:\/\/liora.io\/de\/3-machine-learning-algorithmen-fuer-deinen-job\">Algorithmen<\/a> und der Art und Weise, wie diese die Daten verarbeiten, um die Leistung zu optimieren. Zu diesen Techniken geh\u00f6ren z. B.:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Die Gl\u00e4ttung von Daten, wenn sie verrauscht sind.<\/li>\n<li>Die Aggregation von Daten aus vielen verschiedenen Quellen.<\/li>\n<li>Die Diskretisierung von kontinuierlichen Variablen (mit Hilfe der Intervallisierung), die es erm\u00f6glicht, die Anzahl der Modalit\u00e4ten eines Deskriptors zu verringern, und schlie\u00dflich.<\/li>\n<li>Normalisierung und Standardisierung von Daten, die numerische Daten auf eine kleinere Skala (z. B. zwischen -1 und 1) bringen, den Mittelwert zentrieren und die Varianz verringern k\u00f6nnen.<\/li>\n<\/ul>\n\n\n\n<p>Hier ist ein Beispiel f\u00fcr die <strong>Normalisierung,<\/strong> die in diesem Teil der Datenumwandlung am h\u00e4ufigsten erforderlich ist:<\/p>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"data-reduction\">Data Reduction<\/h3>\n\n\n\n<p>Obwohl es intuitiv erscheint, sich vorzustellen, dass eine sehr gro\u00dfe<strong> Datenmenge<\/strong> die Leistung eines Modells verbessert, kann es sein, dass eine zu gro\u00dfe Datenmenge die Analyse komplizierter machen kann. Daher kann es manchmal sinnvoll sein, die Menge oder Gr\u00f6\u00dfe der Daten zu reduzieren, um die Speicherkapazit\u00e4t zu verbessern und die Kosten f\u00fcr die Analyse zu senken, ohne dabei an Leistung zu verlieren (oder in manchen F\u00e4llen sogar zu gewinnen).<\/p>\n\n\n\n<p>Es gibt verschiedene Techniken zur Datenreduktion. Wir k\u00f6nnen z. B. eine bestimmte Anzahl von Variablen ausw\u00e4hlen, die wir lieber behalten und andere weglassen. Die Auswahl der relevanten Variablen kann durch die Analyse des p-Wertes der Variablen oder durch Entscheidungsbaumtechniken erfolgen, die uns eine Sch\u00e4tzung der Wichtigkeit der verschiedenen Deskriptoren geben.<\/p>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex is-content-justification-center wp-container-core-buttons-is-layout-5ee10de4\" style=\"margin-top:32px;margin-bottom:32px\"><div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/liora.io\/de\/weiterbildung\/data-ki\/data-analyst\">Data Analyst Weiterbildung entdecken<\/a><\/div><\/div>\n\n\n\n<p>Eine weitere Technik, die im Zusammenhang mit der Idee der Datenreduktion h\u00e4ufig verwendet wird, ist die Dimensionsreduktion. Diese Methode reduziert die Dimension der Daten durch genau definierte <strong>Kodierungsmechanismen.<\/strong><\/p>\n\n\n\n<p>Es gibt zwei Arten:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li>verlustbehaftete<\/li>\n<li>und verlustfreie.<\/li>\n<\/ol>\n\n\n\n<p>Wenn man die genauen Daten aus den reduzierten rekonstruieren kann, spricht man von verlustfreier Reduktion. Andernfalls wird die Reduktion verlustbehaftet durchgef\u00fchrt.<\/p>\n\n\n\n<p>Es gibt zwei bevorzugte Methoden, um auf diese Weise auf die Daten einzuwirken, eine Wavelet-Transformation oder eine PCA (Principal Component Analysis).<\/p>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"data-integration\">Data Integration<\/h3>\n\n\n\n<p>Dieser Schritt der Data <strong>Preprocessing-Strategie<\/strong> besteht darin, mehrere Quellen in einem einzigen Datenbestand zu kombinieren. Er wird im Rahmen eines Datenmanagements durchgef\u00fchrt, um nutzbare Datenbanken zu erstellen (wie z. B. die Erstellung von Bilddatenbanken, Querschnitten des Abdomens, MRTs oder R\u00f6ntgenaufnahmen f\u00fcr diagnostische Hilfsprobleme). Dennoch k\u00f6nnten einige Probleme auftreten, wie z. B. die Inkompatibilit\u00e4t bestimmter Formate oder die Redundanz bestimmter Daten.<\/p>\n\n\n\n<p>Der Schritt der vorl\u00e4ufigen Datenverarbeitung ist daher einer der wichtigsten in der <strong>Datenverarbeitung<\/strong> und -analyse. Es gibt keine perfekte Methode, die bei jeder Modellerstellung angewendet werden muss, aber wir haben zusammen die bew\u00e4hrten Verfahren gesehen, die in einer Strategie zur Datenvorverarbeitung eingesetzt werden sollten.<\/p>\n\n\n\n<p>Die hier vorgestellten Methoden werden in unseren verschiedenen Kursen weiter erforscht: Die grundlegenden mathematischen Konzepte sowie gute Praktiken der Datenvorverarbeitung je nach Kontext und Situation werden erl\u00e4utert.<\/p>\n\n\n\n<p>Um unsere Fortbildungen im Detail zu entdecken und alle Best Practices des Data Preprocessing zu lernen, informiere Dich noch heute !<\/p>\n\n\n\n","protected":false},"excerpt":{"rendered":"<p>Da immer mehr Daten erfasst und systematisch verarbeitet werden, haben sich Machine-Learning-Methoden durchgesetzt, die viele Daten ben\u00f6tigen, um zu laufen und zu trainieren. Obwohl man naiv annehmen k\u00f6nnte, dass eine gro\u00dfe Anzahl von Daten ausreicht, um einen leistungsf\u00e4higen Algorithmus zu haben, sind die uns zur Verf\u00fcgung stehenden Daten meistens nicht geeignet und m\u00fcssen meistens vorab [&hellip;]<\/p>\n","protected":false},"author":76,"featured_media":174907,"comment_status":"open","ping_status":"open","sticky":false,"template":"elementor_theme","format":"standard","meta":{"_acf_changed":false,"editor_notices":[],"footnotes":""},"categories":[2472],"class_list":["post-174906","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-data-ki"],"acf":[],"_links":{"self":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts\/174906","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/users\/76"}],"replies":[{"embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/comments?post=174906"}],"version-history":[{"count":5,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts\/174906\/revisions"}],"predecessor-version":[{"id":224901,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts\/174906\/revisions\/224901"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/media\/174907"}],"wp:attachment":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/media?parent=174906"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/categories?post=174906"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}