{"id":209196,"date":"2025-08-12T06:30:00","date_gmt":"2025-08-12T05:30:00","guid":{"rendered":"https:\/\/liora.io\/de\/?p=209196"},"modified":"2026-08-08T13:30:44","modified_gmt":"2026-08-08T11:30:44","slug":"alles-ueber-fehlende-daten","status":"publish","type":"post","link":"https:\/\/liora.io\/de\/alles-ueber-fehlende-daten","title":{"rendered":"Fehlende Daten in der Data Science meistern"},"content":{"rendered":"\n<p><strong>In der Praxis sind vollst\u00e4ndig vollst\u00e4ndige Datens\u00e4tze eine Seltenheit. Ob bei der manuellen Eingabe, der automatischen Extraktion oder der Zusammenf\u00fchrung mehrerer Quellen ,  fehlende Daten treten fast immer auf. Werden sie falsch behandelt, k\u00f6nnen sie Analysen verf\u00e4lschen, die Leistung von Modellen mindern und deutliche Verzerrungen verursachen.<\/strong><\/p>\n\n\n\n<p data-end=\"666\" data-start=\"430\">Deshalb ist es entscheidend, die <strong>Ursachen und Mechanismen<\/strong> hinter diesen L\u00fccken zu verstehen. Fehlende Werte einfach zu ignorieren, mag zwar verlockend erscheinen, bedeutet jedoch oft, einen wesentlichen Teil des Problems zu \u00fcbersehen.<\/p>\n\n\n\n<p data-end=\"963\" data-is-last-node=\"\" data-is-only-node=\"\" data-start=\"668\">In diesem Artikel erf\u00e4hrst Du, wie Du <strong>fehlende Daten in der Data Science erkennen<\/strong>, einordnen und gezielt behandeln kannst. Au\u00dferdem zeigen wir Dir, nach welchen Kriterien Du eine geeignete Imputationsmethode ausw\u00e4hlst und welche Best Practices helfen, die negativen Auswirkungen zu minimieren.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"die-natur-fehlender-daten-verstehen\">Die Natur fehlender Daten verstehen<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"definition-und-identifizierung-fehlender-daten\">Definition und Identifizierung fehlender Daten<\/h3>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex is-content-justification-center wp-container-core-buttons-is-layout-5ee10de4\" style=\"margin-top:32px;margin-bottom:32px\"><div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/liora.io\/de\/weiterbildung\/data-ki\/data-scientist\">Auch lesen: Python-Kurs f\u00fcr Anf\u00e4nger<\/a><\/div><\/div>\n\n\n\n<p>Ein fehlender Datenpunkt bezeichnet das Fehlen eines Wertes in einer Zelle eines Datensatzes.\u00a0Er kann durch NaN, None, eine leere Zelle oder Indikatoren wie \u201eN\/A\u201c dargestellt werden.<\/p>\n\n\n\n<p>Zur Identifizierung stehen mehrere Werkzeuge zur Verf\u00fcgung:<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Visuelle Exploration<\/strong>: Bibliotheken wie missingno (Python) erm\u00f6glichen die Visualisierung von Mustern fehlender Werte (z. B. Heatmaps, Matrizen).<\/li><li aria-level=\"1\"><strong>Deskriptive Funktionen<\/strong>: In Python gibt .isnull().sum() auf einem Pandas DataFrame die Anzahl fehlender Werte pro Spalte zur\u00fcck.<\/li><\/ul>\n\n\n\n\n\n<h3 class=\"wp-block-heading\" id=\"warum-fehlen-daten-die-mechanismen-des-verlusts\">Warum fehlen Daten? Die Mechanismen des Verlusts?<\/h3>\n\n\n\n<p data-end=\"855\" data-start=\"714\">Um fehlende Daten gezielt zu behandeln, musst Du zun\u00e4chst verstehen, warum sie fehlen. Klassischerweise unterscheidet man drei Mechanismen:<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>MCAR (Missing Completely at Random)<\/strong>: Die Wahrscheinlichkeit, dass ein Wert fehlt, ist unabh\u00e4ngig von allen anderen Variablen.<br data-end=\"990\" data-start=\"987\"\/><em data-end=\"1003\" data-start=\"992\">Beispiel:<\/em> Ein zuf\u00e4lliger Ausfall w\u00e4hrend der Datenerfassung.<\/li><\/ul>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>MAR (Missing at Random)<\/strong>: Das Fehlen h\u00e4ngt von anderen beobachteten Variablen ab, nicht jedoch vom fehlenden Wert selbst.<br data-end=\"1186\" data-start=\"1183\"\/><em data-end=\"1199\" data-start=\"1188\">Beispiel:<\/em> M\u00e4nner beantworten seltener eine Frage zu Depressionen als Frauen ,  das Fehlen h\u00e4ngt vom Geschlecht ab.<\/li><li aria-level=\"1\"><strong>MNAR (Missing Not at Random)<\/strong>: Das Fehlen h\u00e4ngt vom fehlenden Wert selbst oder von einem nicht beobachteten Faktor ab.<br data-end=\"1432\" data-start=\"1429\"\/><em data-end=\"1445\" data-start=\"1434\">Beispiel:<\/em> Sehr hohe Einkommen werden selten angegeben ,  der Wert selbst beeinflusst das Fehlen.<\/li><\/ul>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"auswirkungen-der-verschiedenen-fehltypen\">Auswirkungen der verschiedenen Fehltypen<\/h3>\n\n\n\n<p>Der zugrunde liegende Mechanismus hat gro\u00dfen Einfluss auf die Wahl der Behandlungsstrategie. W\u00e4hrend MCAR meist einfache Methoden erlaubt, erfordern MAR und MNAR komplexere, oft auch dom\u00e4nenspezifische Ans\u00e4tze.<\/p>\n\n\n\n\n\n<h2 class=\"wp-block-heading\" id=\"strategien-zur-behandlung-fehlender-daten\">Strategien zur Behandlung fehlender Daten<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"1-loschen-fehlender-daten\">1. L\u00f6schen fehlender Daten<\/h3>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Listenweises L\u00f6schen<\/strong><\/li><\/ul>\n\n\n\n<p>Dabei entfernst Du alle Zeilen eines Datensatzes, die mindestens einen fehlenden Wert enthalten. Diese Methode ist leicht umzusetzen, birgt jedoch ein hohes Risiko f\u00fcr Informationsverlust und Verzerrungen, wenn die Daten nicht MCAR sind.<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Paarweises L\u00f6schen<\/strong><\/li><\/ul>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex is-content-justification-center wp-container-core-buttons-is-layout-5ee10de4\" style=\"margin-top:32px;margin-bottom:32px\"><div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/liora.io\/de\/weiterbildung\/data-ki\/data-scientist\">Bayesian Optimization: So funktioniert die smarte Optimierungsmethode<\/a><\/div><\/div>\n\n\n\n<p>Hier werden f\u00fcr jede spezifische Analyse nur die Beobachtungen ber\u00fccksichtigt, bei denen die f\u00fcr diese Analyse relevanten Variablen vorhanden sind. So bleiben mehr Daten erhalten, jedoch k\u00f6nnen die Ergebnisse schwerer interpretierbar und statistische Matrizen instabil sein.<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Variablenweises L\u00f6schen<\/strong><\/li><\/ul>\n\n\n\n<p>Eine ganze Spalte wird entfernt, wenn der Anteil fehlender Werte zu hoch ist (oft &gt;50 %). Dies ist sinnvoll, wenn die Variable schwer wiederherstellbar oder nur von geringem Nutzen ist, birgt jedoch das Risiko, eine relevante Variable zu verlieren.<\/p>\n\n\n\n<figure class=\"wp-block-table is-style-stripes\"><table>\n<colgroup>\n<col\/>\n<col\/>\n<col\/>\n<\/colgroup>\n<thead>\n<tr>\n<th>Methode<\/th>\n<th>Vorteile<\/th>\n<th>Nachteile<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Listenweises L\u00f6schen<\/td>\n<td>Einfach umzusetzen<br\/>Keine k\u00fcnstliche Datenerg\u00e4nzung<\/td>\n<td>Bedeutender Informationsverlust, wenn Daten nicht MCAR sind<br\/>Verzerrungsgefahr<\/td>\n<\/tr>\n<tr>\n<td>Paarweises L\u00f6schen<\/td>\n<td>Mehr Daten bleiben erhalten<br\/>Weniger zerst\u00f6rerisch<\/td>\n<td>Ergebnisse schwer zu interpretieren<br\/>Instabile statistische Matrizen<\/td>\n<\/tr>\n<tr>\n<td>Variablen l\u00f6schen<\/td>\n<td>Schnelle Bereinigung<br\/>Dimensionsreduktion<\/td>\n<td>Risiko, eine relevante Variable zu verlieren<\/td>\n<\/tr>\n<\/tbody>\n<\/table><\/figure>\n\n\n\n\n\n<h3 class=\"wp-block-heading\" id=\"2-einfache-imputation\">2. Einfache Imputation<\/h3>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Imputation durch Mittelwert, Median oder Modus<\/strong><\/li><\/ul>\n\n\n\n<p>Fehlende Werte werden durch Ma\u00dfe der zentralen Tendenz ersetzt. Mittelwert und Median eignen sich f\u00fcr numerische Variablen, der Modus ist sowohl f\u00fcr kategoriale als auch f\u00fcr numerische Variablen einsetzbar. Diese Methode ist schnell und ressourcenschonend, kann jedoch die Varianz verringern und Verteilungen oder Korrelationen verzerren.<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Imputation durch einen konstanten Wert oder bin\u00e4ren Indikator<\/strong><\/li><\/ul>\n\n\n\n<p>Fehlende Werte werden durch einen festgelegten Wert wie \u201e-1\u201c oder \u201eUnbekannt\u201c ersetzt. H\u00e4ufig wird eine zus\u00e4tzliche bin\u00e4re Variable erg\u00e4nzt, um anzuzeigen, ob der urspr\u00fcngliche Wert fehlte. Diese Methode bewahrt die Information \u00fcber das Fehlen, kann jedoch Verzerrungen einf\u00fchren und ist empfindlich gegen\u00fcber der Wahl des Ersatzwertes.<\/p>\n\n\n\n<figure class=\"wp-block-table is-style-stripes\"><table>\n<colgroup>\n<col\/>\n<col\/>\n<col\/>\n<\/colgroup>\n<thead>\n<tr>\n<th>Methode<\/th>\n<th>Vorteile<\/th>\n<th>Nachteile<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Mittelwert \/ Median \/ Modus<\/td>\n<td>Einfach und schnell umzusetzen<br\/>Geringer Ressourcenaufwand<\/td>\n<td>Verringerung der Varianz<br\/>Kann Verteilungen und Korrelationen verf\u00e4lschen<\/td>\n<\/tr>\n<tr>\n<td>Konstanter Wert \/ Indikator<\/td>\n<td>Information \u00fcber das Fehlen bleibt erhalten<br\/>Kompatibel mit bestimmten Modellen<\/td>\n<td>Kann Verzerrungen einf\u00fchren<br\/>Anf\u00e4llig f\u00fcr willk\u00fcrlich gew\u00e4hlte Ersatzwerte<\/td>\n<\/tr>\n<\/tbody>\n<\/table><\/figure>\n\n\n\n<h3 class=\"wp-block-heading\" id=\"3-fortgeschrittene-imputation\">3. Fortgeschrittene Imputation<\/h3>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Imputation durch Regression<\/strong><\/li><\/ul>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex is-content-justification-center wp-container-core-buttons-is-layout-5ee10de4\" style=\"margin-top:32px;margin-bottom:32px\"><div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/liora.io\/de\/weiterbildung\/data-ki\/data-scientist\">Auch lesen: Real World Assets (RWA) einfach erkl\u00e4rt<\/a><\/div><\/div>\n\n\n\n<p>Fehlende Werte werden mithilfe eines Regressionsmodells vorhergesagt, das die \u00fcbrigen Variablen des Datensatzes als Pr\u00e4diktoren nutzt. Diese Methode kann die Beziehungen zwischen Variablen optimal aussch\u00f6pfen, birgt aber das Risiko, Zusammenh\u00e4nge zu \u00fcbersch\u00e4tzen oder Verzerrungen zu erzeugen, wenn Annahmen verletzt werden.<\/p>\n\n\n\n<ul class=\"wp-block-list\"><li aria-level=\"1\"><strong>Imputation durch k-n\u00e4chste Nachbarn (<\/strong><a href=\"https:\/\/liora.io\/de\/der-knn-algorithmus-einfach-erklart\" rel=\"noopener\" target=\"_blank\"><strong>k-NN<\/strong><\/a><strong>)<\/strong><\/li><\/ul>\n\n\n\n<p>Hier werden fehlende Werte durch den Durchschnitt der <em data-end=\"2288\" data-start=\"2285\">k<\/em> \u00e4hnlichsten Beobachtungen ersetzt, wobei die \u00c4hnlichkeit \u00fcber Abst\u00e4nde in den vorhandenen Variablen gemessen wird. Sie ist flexibel und kann komplexe Zusammenh\u00e4nge erfassen, ist jedoch rechenintensiv und sensibel gegen\u00fcber der Wahl von <em data-end=\"2528\" data-start=\"2525\">k<\/em> und der verwendeten Distanzmetrik.<\/p>\n\n\n\n<figure class=\"wp-block-table is-style-stripes\"><table>\n<colgroup>\n<col\/>\n<col\/>\n<col\/>\n<\/colgroup>\n<thead>\n<tr>\n<th>Methode<\/th>\n<th>Vorteile<\/th>\n<th>Nachteile<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Regression<\/td>\n<td>Nutzt Beziehungen zwischen Variablen<\/td>\n<td>Verzerrungsrisiko bei Verletzung der Annahmen<br\/>Kann Zusammenh\u00e4nge \u00fcbersch\u00e4tzen<\/td>\n<\/tr>\n<tr>\n<td>k-N\u00e4chste Nachbarn (k-NN)<\/td>\n<td>Erfasst komplexe Zusammenh\u00e4nge<br\/>Geeignet f\u00fcr numerische und gemischte Daten<\/td>\n<td>Hoher Rechenaufwand<br\/>Empfindlich gegen\u00fcber Wahl von k und Distanzmetrik<\/td>\n<\/tr>\n<\/tbody>\n<\/table><\/figure>\n\n\n\n\n\n<h2 class=\"wp-block-heading\" id=\"passende-methode-finden-und-testen\">Passende Methode finden und testen<\/h2>\n\n\n\n<p data-end=\"493\" data-start=\"68\">Die Auswahl einer geeigneten Methode zur Behandlung fehlender Daten h\u00e4ngt von mehreren Faktoren ab. Ein zentraler Punkt ist die <strong>Art der Variablen<\/strong>: Ob <strong>numerisch, kategorial oder gemischt<\/strong>, bestimmt ma\u00dfgeblich, welche Techniken sinnvoll sind. So eignen sich beispielsweise Imputationen durch Mittelwert oder Regression vor allem f\u00fcr numerische Variablen, w\u00e4hrend Modus oder konstante Werte besser zu kategorialen Daten passen.<\/p>\n\n\n\n<p data-end=\"712\" data-start=\"495\">Auch die Fehlerrate spielt eine gro\u00dfe Rolle. Liegt sie unter 5 %, k\u00f6nnen oft einfache Ans\u00e4tze ausreichen. Ab einer Rate von \u00fcber 20 % wird es hingegen riskant, Daten zu l\u00f6schen oder auf naive Imputationen zu setzen.<\/p>\n\n\n\n<p data-end=\"1171\" data-start=\"714\">Ebenso wichtig ist die Frage, ob eine Variable tats\u00e4chlich Einfluss auf das Ziel oder die Analyseergebnisse hat. Weist sie viele fehlende Werte auf und liefert nur wenig n\u00fctzliche Informationen, ist es oft effizienter, sie zu entfernen. Das spart Zeit, reduziert die Komplexit\u00e4t des Modells und erleichtert Visualisierungen ,  besonders, wenn <strong>explorative Analysen<\/strong> oder\u00a0<a href=\"https:\/\/liora.io\/de\/pearson-vs-spearman-korrelationen-einfache-erklaerung\" rel=\"noopener\" target=\"_blank\">Korrelationspr\u00fcfungen<\/a>\u00a0zeigen, dass sie nur schwach mit anderen Variablen zusammenh\u00e4ngt.<\/p>\n\n\n\n<div class=\"wp-block-buttons is-layout-flex wp-block-buttons-is-layout-flex is-content-justification-center wp-container-core-buttons-is-layout-5ee10de4\" style=\"margin-top:32px;margin-bottom:32px\"><div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"https:\/\/liora.io\/de\/weiterbildung\/data-ki\/data-scientist\">Entdecke unsere Weiterbildungen<\/a><\/div><\/div>\n\n\n\n<p data-end=\"1525\" data-is-last-node=\"\" data-is-only-node=\"\" data-start=\"1173\">Nach der gew\u00e4hlten Behandlungsmethode solltest Du deren Auswirkungen unbedingt bewerten. Vergleiche daf\u00fcr die Verteilungen der Variablen vor und nach der Imputation, \u00fcberpr\u00fcfe die Modellleistung mithilfe von\u00a0<a href=\"https:\/\/liora.io\/de\/kreuzvalidierungsverfahren-definition-und-bedeutung-fur-machine-learning\" rel=\"noopener\" target=\"_blank\">Kreuzvalidierung<\/a>\u00a0und f\u00fchre eine Sensitivit\u00e4tsanalyse durch, um mehrere Strategien zu testen und die Robustheit der Ergebnisse sicherzustellen.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\" id=\"fazit\">Fazit<\/h2>\n\n\n\n<p data-end=\"313\" data-start=\"54\">Der <strong>Umgang mit fehlenden Daten<\/strong> geh\u00f6rt zu den unvermeidbaren Herausforderungen in der Data Science. Entscheidend ist, ihre Ursachen zu verstehen, ihre Art zu erkennen, die passende Imputationsmethode auszuw\u00e4hlen und deren Auswirkungen sorgf\u00e4ltig zu bewerten.<\/p>\n\n\n\n<p data-end=\"609\" data-start=\"315\">Anstatt sich auf eine einzige L\u00f6sung zu verlassen, lohnt es sich, mehrere Ans\u00e4tze zu testen und auf den jeweiligen Kontext abzustimmen. Mit der Weiterentwicklung von Tools und Techniken wird das\u00a0<a href=\"https:\/\/liora.io\/de\/data-management-oder-datenverwaltung-was-ist-das-denn\" rel=\"noopener\" target=\"_blank\">Management fehlender Daten<\/a>\u00a0immer pr\u00e4ziser und fester Bestandteil der Datenverarbeitungspipelines.<\/p>\n\n\n\n<p data-end=\"769\" data-start=\"611\">Der Schl\u00fcssel liegt in einer rigorosen, transparenten und fundierten Vorgehensweise ,  nur so lassen sich verl\u00e4ssliche und belastbare Analysen gew\u00e4hrleisten.<\/p>\n\n\n\n","protected":false},"excerpt":{"rendered":"<p>In der Praxis sind vollst\u00e4ndig vollst\u00e4ndige Datens\u00e4tze eine Seltenheit. Ob bei der manuellen Eingabe, der automatischen Extraktion oder der Zusammenf\u00fchrung mehrerer Quellen , fehlende Daten treten fast immer auf. Werden sie falsch behandelt, k\u00f6nnen sie Analysen verf\u00e4lschen, die Leistung von Modellen mindern und deutliche Verzerrungen verursachen. Deshalb ist es entscheidend, die Ursachen und Mechanismen hinter [&hellip;]<\/p>\n","protected":false},"author":74,"featured_media":209198,"comment_status":"open","ping_status":"open","sticky":false,"template":"elementor_theme","format":"standard","meta":{"_acf_changed":false,"editor_notices":[],"footnotes":""},"categories":[2472],"class_list":["post-209196","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-data-ki"],"acf":[],"_links":{"self":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts\/209196","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/users\/74"}],"replies":[{"embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/comments?post=209196"}],"version-history":[{"count":5,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts\/209196\/revisions"}],"predecessor-version":[{"id":225443,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/posts\/209196\/revisions\/225443"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/media\/209198"}],"wp:attachment":[{"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/media?parent=209196"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/liora.io\/de\/wp-json\/wp\/v2\/categories?post=209196"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}