Fehlende Werte analysieren: NA in R verstehen
Fehlende Werte analysieren
Fehlende Werte sind in einem Datensatz nicht einfach unsichtbare Lücken. Für die Arbeit mit R kommt es darauf an, ob eine Zelle bereits als NA vorliegt oder ob ein besonderer Rohdatenwert erst als fehlend behandelt werden soll.
Kostenlos herunterladen
Forschungsdesign wählen: Merkzettel für den Aufbau einer Studie
Die Analyse fehlender Werte in R plus die Kette von der Forschungslücke bis zur Aussage, neun Designs mit Stärke und Grenze, die Wege der Erhebung, die Operationalisierung in sechs Schritten, dazu die Gütekriterien und ein Raster für das eigene Design.
Fehlende Werte im Datenmaterial fachlich einordnen
Fehlende Werte analysieren bedeutet hier, Einträge eines data.frame in R daraufhin zu betrachten, ob sie als NA gekennzeichnet sind oder als fehlende Information behandelt werden sollen. Ob eine leere Zelle nach dem Einlesen als NA vorliegt, hängt vom Einleseverfahren, vom Datentyp und von den Einstellungen ab. Daher ist für R zu prüfen, ob an dieser Stelle ein regulärer Eintrag wie eine Zahl oder ein Wort verarbeitet wird.
Im Kontext des wissenschaftlichen Arbeitens zeigt sich dies an der transparenten Vorbereitung von Daten für analytische Zwecke. Wer wissenschaftliches Schreiben plant, kann die Dokumentation der Datenverarbeitung präzise gestalten, indem normale Einträge von fehlenden Informationen unterschieden werden. Andere Bereiche wie Bestandteile einer wissenschaftlichen Arbeit, Hausarbeit schreiben sowie Masterarbeit schreiben decken separate Aufgabenkomplexe ab. Sie klären jedoch nicht, wie die Werte im gewählten Datensatz codiert sind.
Es gibt zwei typische Ausgangslagen: Rohdaten können Zellen ohne Eintrag enthalten, und sie können Antworten mit besonderen Codes enthalten. Beide Fälle verlangen eine Prüfung der konkreten Zellen und ihrer Kodierung. Die fachliche Frage lautet deshalb nicht, ob ein Feld optisch leer erscheint, sondern welchen Wert R für dieses Feld verarbeitet und ob eine besondere Antwort in der vorgesehenen Analyse unberücksichtigt bleiben soll.
Eine objektive Darstellung hält Beobachtung und Entscheidung auseinander. Zuerst wird geklärt, ob NA vorliegt oder ein besonderer Wert gespeichert ist. Anschließend wird notiert, ob dieser Wert für die jeweilige Analyse als NA gelten soll. Forschungsfrage formulieren und wissenschaftliche Argumentation bestimmen die inhaltliche Ausrichtung; bei fehlenden Werten steht hingegen die Datenrepräsentation im Vordergrund.

Begriff, Merkmale und Bestandteile der Prüfung
Der Begriff fehlender Wert bezeichnet im genannten R-Kontext eine Zelle mit der Kodierung NA. Entscheidend ist die Trennung vom regulären Dateneintrag. NA zeigt an, dass kein regulärer Wert vorliegt. Außerdem können Kommandos zur Datenbearbeitung Argumente enthalten, um vorhandene NA einzubeziehen.
Die Prüfung lässt sich in nachvollziehbarer Reihenfolge gliedern:
- Datensatz und Spalten bestimmen: Prüfe, welche Zellen und welche Spalten für die geplante Bearbeitung relevant sind. Das Ergebnis ist ein abgegrenzter Ausschnitt des
data.frame. - Leere Rohdatenfelder erkennen: Prüfe, ob Zellen in den eingelesenen Rohdaten leer sind und ob sie mit dem verwendeten Einleseverfahren als
NAvorliegen. Das Ergebnis ist eine dokumentierte Prüfung der tatsächlichen R-Kodierung. - Besondere Antwortwerte erkennen: Prüfe, ob Rohdaten Werte für Antworten enthalten, die fehlende Information ausdrücken sollen. Das Ergebnis ist eine Liste der betreffenden Ausprägungen und Spalten.
- Behandlung festlegen: Prüfe für die vorgesehene Analyse, ob diese besonderen Ausprägungen als
NAdefiniert werden sollen. Das Ergebnis ist eine begründete Entscheidung zur Verarbeitung. - Veränderung begrenzen: Soll nur ein Teil des Datensatzes angepasst werden, richte die Bearbeitung auf die betreffenden Spalten. Das Ergebnis ist eine gezielte statt pauschale Änderung.
Aus dem Paket dplyr stammen die Funktionen mutate_at() und vars() für eine ältere Form der spaltenweisen Bearbeitung. In aktuellen dplyr-Versionen sind diese Funktionen durch Auswahl mit across() innerhalb von mutate() abgelöst; die passende Umsetzung richtet sich nach Daten und Paketversion. Eine Gliederung einer Hausarbeit ordnet Textteile, während die genannte Struktur Datenfelder und deren Kodierung regelt. Literaturverzeichnis erstellen, Quellenangaben richtig zitieren und Zitierweisen betreffen Literaturnachweise, nicht die Kodierung leerer Zellen.
Fehlende Werte in R schrittweise untersuchen
- Rohdaten ansehen: Erstelle einen kleinen data.frame und prüfe ihn mit is.na(daten), anyNA(x = daten), summary(object = daten) und colSums(is.na(daten)). Ergebnis: Die Ausgaben zeigen fehlende Werte je Zelle und je Spalte.
- R-Kodierung feststellen: Prüfe im eingelesenen
data.frame, ob leere Rohdatenfelder mit dem verwendeten Einleseverfahren alsNAvorliegen. Ergebnis: Du weißt, wie diese Felder im konkreten Datensatz repräsentiert sind. - Bedeutung besonderer Werte klären: Prüfe bei vorhandenen Sondercodes, ob sie eine Antwort darstellen, die als fehlende Information behandelt werden soll. Ergebnis: Du hast die Ausprägungen identifiziert, die für die Analyse gesondert zu behandeln sind.
- Analyseentscheidung treffen: Entscheide nur für die vorgesehene Analyse, ob die identifizierten Ausprägungen zu
NAwerden sollen. Ergebnis: Die Behandlung der Werte ist ausdrücklich festgelegt. - Betroffene Spalten auswählen: Wenn nur bestimmte Spalten verändert werden sollen, grenze diese Spalten ein. Die Werkzeuge
mutate_at()undvars()betreffen eine ältere dplyr-Variante; prüfe für die verwendete Paketversion die aktuelle Auswahlmethode. Ergebnis: Die Bearbeitung bezieht sich auf den ausgewählten Teil desdata.frame. - Ausgabe erneut prüfen: Vergleiche nach der Bearbeitung, ob die betroffenen Zellen nun reguläre Dateneinträge oder
NAabbilden. Ergebnis: Der Zustand der Daten ist für die weitere Organisation oder Analyse überprüft.
Methoden wissenschaftlicher Arbeiten und qualitative und quantitative Forschung betreffen die Auswahl und Einordnung von Forschungsansätzen. Die vorliegende Schrittfolge behandelt enger die Repräsentation fehlender Informationen in R. Wer deutsche Zitierweise oder Harvard-Zitierweise verwendet, sollte diese Aufgabe ebenfalls getrennt von der Datenkodierung bearbeiten.
Kurzes Anwendungsbeispiel mit einem Datenfeld
Der folgende ausführbare R-Code erstellt ein data.frame mit einer bereits fehlenden Angabe und einem besonderen Antwortwert: daten < data.frame(antwort = c("ja", NA, "keine Angabe"), status = c(NA, rep("vorhanden", 2))); is.na(daten); anyNA(x = daten); summary(object = daten); colSums(is.na(daten)). Die Ausgaben prüfen, ob NA vorliegt, und zählen fehlende Werte je Spalte.
Für die beabsichtigte Analyse wird der klar benannte Sondercode gezielt umkodiert: daten$antwort < dplyr::na_if(daten$antwort, "keine Angabe"); colSums(is.na(daten)). Die Kontrollausgabe zeigt anschließend die Zahl der NA-Werte je Spalte. Die ursprünglich nicht ausgefüllte Zelle bleibt als NA erhalten; nur der besondere Antwortwert wird nach der Analyseentscheidung als NA behandelt.
Der Fall stellt weder ein Fachgebiet noch eine Aussage über Untersuchungsergebnisse dar. Er verdeutlicht vielmehr den Übergang vom Rohdatenfeld über die Kodierung bis zur erneuten Prüfung. Plagiat vermeiden betrifft die Prüfung von Übernahmen und Zitaten in Texten; hier wird dagegen kontrolliert, ob Datenwerte passend als reguläre Einträge oder als NA vorliegen.

Definition, Abgrenzung und formale Kontrolle prüfen
Definition prüfen: Vergleiche, ob fehlende Werte im Dokument als NA innerhalb eines R-data.frame erläutert werden. Eine reine visuelle Leerstelle in einer Tabelle darf nicht mit dieser technischen Angabe gleichgesetzt werden.
Zentrale Merkmale prüfen: Untersuche, ob zwei Situationen voneinander getrennt werden: leere Rohdatenzellen, die beim Einlesen als NA erscheinen, und gespeicherte Sonderwerte, die als fehlende Information gekennzeichnet werden sollen. Achte zusätzlich darauf, dass normale Einträge wie Texte oder Zahlen klar von NA abgegrenzt sind.
Anwendung prüfen: Stelle sicher, dass zuerst die relevanten Spalten und Werte ermittelt wurden. Prüfe anschließend, ob die Behandlung besonderer Werte gezielt auf die geplante Analyse ausgerichtet ist. Wenn eine Änderung nur bestimmte Spalten umfasst, überprüfe die Auswahl und kontrolliere die Zellen anschließend erneut.
Abgrenzung prüfen: Trenne die Datenkodierung von Fragen zur Struktur, zum Untersuchungsziel und zum Zitieren. Das Thema Fehlende Werte klärt, wie R fehlende Angaben im data.frame abbildet und wie Sonderwerte für eine Auswertung behandelt werden können. Es beantwortet nicht die Frage, wie eine wissenschaftliche Arbeit gegliedert oder welches Zitiersystem gewählt wird.
Formale Prüfung: Achte darauf, dass die Schreibweisen NA, data.frame, mutate_at() und vars() einheitlich sind, sofern sie verwendet werden. Bei mutate_at() und vars() prüfe zusätzlich, ob sie zur eingesetzten dplyr-Version passen. Prüfe weiter, ob jedem beschriebenen Sonderwert eine konkrete Spalte zugeordnet und die Entscheidung zur Behandlung nachvollziehbar dokumentiert ist.