GRUNDLAGEN

Was ist Datenanonymisierung?

Datenanonymisierung verändert personenbezogene Daten so, dass niemand die betroffene Person mehr identifizieren kann – mit keinem Mittel, das nach allgemeinem Ermessen wahrscheinlich genutzt würde. Gelingt das, fallen die Daten vollständig aus dem Anwendungsbereich der DSGVO. Genau dieser letzte Teil macht die Schwelle so viel höher, als die meisten annehmen.

Die Definition, und das Wort, das sie trägt

Anonymisierung entfernt oder verändert die Information, die einen Datensatz mit einer Person verknüpft, sodass diese weder direkt noch indirekt identifiziert werden kann. Das entscheidende Wort ist „indirekt“. Einen Namen zu löschen anonymisiert einen Datensatz nicht, der noch eine Postleitzahl, ein Geburtsdatum und eine Berufsbezeichnung enthält – diese drei zusammen identifizieren die meisten Menschen in einer Population.

Der Test ist nicht, ob Sie die offensichtlichen Identifikatoren entfernt haben. Er ist, ob eine Identifizierung für irgendjemanden, der das Ergebnis in Händen hält, noch möglich bleibt – auch durch Kombination mit anderen Daten, auf die er Zugriff hat.

Anonymisierung, Pseudonymisierung und Maskierung sind keine Synonyme

Die drei Begriffe werden ständig austauschbar verwendet und bedeuten rechtlich ganz unterschiedliche Dinge.

Anonymisierung ist für jede Partei unumkehrbar. Es gibt keinen Schlüssel. Erwägungsgrund 26 der DSGVO stellt klar: Die Grundsätze des Datenschutzes gelten nicht für anonyme Informationen. Echte anonymisierte Daten unterliegen daher keinen Pflichten.

Pseudonymisierung ersetzt Identifikatoren, behält aber eine gesondert aufbewahrte Information, die die Umkehrung ermöglicht. Nach Art. 4 Nr. 5 DSGVO muss diese zusätzliche Information gesondert aufbewahrt und geschützt werden. Pseudonymisierte Daten sind weiterhin personenbezogene Daten und bleiben im Anwendungsbereich. Art. 25 und Art. 32 behandeln Pseudonymisierung als anerkannte Schutzmaßnahme, nicht als Ausnahme.

Maskierung beschreibt die mechanische Verschleierung von Zeichen, etwa wenn nur die letzten vier Ziffern einer Kartennummer sichtbar bleiben. Sie kann eines der beiden obigen Ziele erreichen, oder keines – je nachdem, was übrig bleibt.

Die meisten als „Anonymisierer“ verkauften Tools betreiben Pseudonymisierung: Sie halten einen dauerhaften Schlüssel vor – einen Tresor, eine Zuordnungstabelle, eine Mapping-Spalte –, der aus Platzhaltern wieder Personen macht. DataAnonymiser hält keinen. Die Zuordnung lebt im Arbeitsspeicher der Sitzung, in der Sie sie erzeugt haben, und wird mit deren Ende vernichtet: Für jede Stelle, der Sie das Ergebnis aushändigen, existiert danach kein Schlüssel mehr, mit dem sich das rückgängig machen ließe. Offen bleibt die zweite Hälfte der Prüfung – ob der verbleibende Text jemanden noch indirekt identifiziert. Die Erkennung erfolgt nach bestem Bemühen, und Quasi-Identifikatoren überstehen sie. Beurteilen Sie das Ergebnis, nicht das Etikett auf dem Werkzeug.

Die wichtigsten Techniken

Unterdrückung (Suppression) löscht das identifizierende Feld vollständig. Einfach, und teuer im analytischen Wert.

Generalisierung reduziert die Präzision, bis ein Wert nicht mehr unterscheidbar ist: ein exaktes Alter wird zu einer Altersgruppe, eine volle Postleitzahl zu ihrer ersten Hälfte, ein Zeitstempel zu einem Monat.

Perturbation (Verrauschung) fügt kalibriertes Rauschen hinzu, sodass einzelne Datensätze falsch sind, aggregierte Statistiken aber nah am wahren Wert bleiben. Differential Privacy ist die mathematisch strenge Form und gibt eine beweisbare Grenze dafür an, was ein einzelner Datensatz zum Ergebnis beiträgt.

Aggregation meldet nur Gruppensummen, nie Einzelzeilen, mit einer Mindestgruppengröße, damit kleine Gruppen nicht isoliert werden können.

Synthetische Daten erzeugen einen künstlichen Datensatz mit ähnlicher statistischer Struktur. Nützlich – ein an echten Datensätzen trainiertes Modell kann diese aber preisgeben, wenn es überanpasst.

k-Anonymität und ihre Verfeinerungen l-Diversität und t-Closeness sind die Maße, mit denen das Ergebnis geprüft wird: Jeder Datensatz muss von mindestens k-1 anderen bezüglich der Quasi-Identifikatoren ununterscheidbar sein.

Warum Anonymisierung immer wieder scheitert

Das wiederkehrende Problem ist immer dasselbe. Daten, die isoliert betrachtet anonym wirken, werden identifizierend, sobald man sie mit einem anderen Datensatz verknüpft. Spärliche, hochdimensionale Daten sind besonders anfällig: Je mehr Merkmale ein Datensatz hat, desto wahrscheinlicher ist seine Kombination für eine Person eindeutig.

Anonymisierung ist zudem nicht dauerhaft. Ein heute veröffentlichter Datensatz kann in fünf Jahren gegen Zusatzdaten re-identifizierbar werden, die es heute noch nicht gibt. Deshalb behandeln Aufsichtsbehörden Anonymisierung als laufende Bewertung, nicht als einmalige Umwandlung – und deshalb behält vorsichtige Praxis Kontrollen über das Ergebnis, statt das Problem für gelöst zu erklären.

Freitext und Bilder sind ein anderes Problem

Die meiste Literatur zur Anonymisierung geht von strukturierten Daten aus, bei denen die Spalten mit Identifikatoren im Voraus bekannt sind. Freitext hat keine Spalten. Ein Name, eine Diagnose oder eine Kontonummer kann überall auftauchen, in jeder Formulierung – und das identifizierende Detail ist oft umständebedingt statt formatgebunden.

Deshalb ist die Schwärzung von Freitext naturgemäß bestmöglich, nicht garantiert: Was nicht erkannt wird, wird nicht entfernt. Alles, was aus unstrukturiertem Text abgeleitet wird, sollte geprüft werden, bevor es als sicher behandelt wird.

Wo ein lokales Tool ansetzt

Geht es darum, zu verhindern, dass Identitäten an einen Dritten gelangen – etwa einen KI-Assistenten, eine Support-Stelle oder einen Analyse-Anbieter –, ist volle Anonymisierung meist mehr, als nötig ist, und weniger, als sich überprüfen lässt. Lokale Pseudonymisierung, bevor der Text das Gerät verlässt, adressiert die tatsächliche Gefährdung: Die empfangende Stelle erhält die Identitäten nie, und die Information, die zur Umkehrung nötig wäre, verlässt Ihr Gerät nie.

DataAnonymiser arbeitet so und hält die Rückverfolgungs-Zuordnung nur im Arbeitsspeicher der laufenden Sitzung – schließen Sie die App, existiert für dieses Ergebnis nirgendwo mehr ein Schlüssel. Das ist eine praktische Hilfe, keine Compliance-Feststellung.