LOGS UND CODE

Logdateien anonymisieren: mit KI debuggen, ohne Produktionsdaten einzufügen

Der schnellste Weg zu Hilfe bei einem Stacktrace ist, ihn komplett einzufügen. Das Problem: Ein echter Stacktrace kommt meist mit den Daten einer echten Person drumherum – und oft auch mit einem Token oder einem internen Hostnamen. DataAnonymiser ersetzt diese Werte lokal durch konsistente Platzhalter, sodass die KI die Struktur des Fehlers sieht, aber nicht die Daten dahinter.

quick_anonymize.txt
Email:
Phone:
SSN:
0 personal details replaced. Nothing left this device
SENT TO OUR SERVERS: NOTHING

Logs verraten mehr als Logs

Eine Logzeile aus der Produktion enthält selten nur den Fehler. Sie enthält die Anfrage, die ihn ausgelöst hat: die E-Mail-Adresse der Person, ihre Konto-ID, die eingegebene Anschrift, manchmal die vollständige Nutzlast. Ein Stacktrace kann Variableninhalte mitführen. Eine Konfigurationsdatei führt Hostnamen und Verbindungszeichenfolgen mit.

Das in ein Cloud-KI-Tool einzufügen ist eine Offenlegung von Produktionsdaten – auch wenn es sich wie eine technische Frage anfühlt und nicht wie eine Entscheidung über das Teilen von Daten.

Auch Logdateien sind personenbezogene Daten

Der Bundesbeauftragte für den Datenschutz behandelt Logfile-Daten als personenbezogen, weil sie eindeutige Kennungen von Endgeräten enthalten, die sich mit Informationen Dritter einer Person zuordnen lassen. Für IP-Adressen, Nutzer-IDs und Sitzungskennungen in Ihren Logs gilt dasselbe. [1]

Die Datenschutzkonferenz nennt als Beispiel für einen KI-Einsatz ohne Personenbezug ein Entwicklungsteam, das mit einem Chatbot Fehler in Code sucht, der keine personenbezogenen Daten enthält. Diesem Zustand bringt Sie das Schwärzen näher; ob er tatsächlich erreicht ist, zeigt erst die Prüfung des vorbereiteten Texts. [2]

Die Daten schwärzen, die Form behalten

Was ein Log für eine KI nützlich macht, ist seine Struktur: die Abfolge der Ereignisse, die Fehlertypen, die Zeitabstände, die Wiederholungen. Nichts davon braucht die echten Werte. Konsistente, beschriftete Platzhalter bewahren die Zuordnung – dieselbe Nutzer-ID bleibt in jeder Zeile derselbe Platzhalter –, sodass ein Muster über hundert Zeilen hinweg sichtbar bleibt.

Die App liest Quellcode und Konfigurationsdateien direkt, neben reinem Text, sodass Sie mit der Datei arbeiten können, statt Fragmente daraus zu kopieren.

Beispiel: ein Stacktrace mit Kundendaten

Die folgende Logzeile ist erfunden. Original: „ERROR PaymentService: charge failed for max.mueller@example.com (user 88213) from 203.0.113.42 – IBAN DE89 3704 0044 0532 0130 00 rejected“.

Vorbereiteter Text: „ERROR PaymentService: charge failed for [email] (user [customer_id]) from [ipv4] – IBAN [iban] rejected“. Für die Frage, warum die Abbuchung scheitert, bleiben Dienst, Fehlertyp und Ablauf erhalten. Die Ersetzungen veranschaulichen den Ablauf; sie sind kein Messergebnis der Erkennung.

Eigene interne Begriffe ergänzen

Interne Hostnamen, Codenamen von Diensten, unveröffentlichte Feature-Flags und Projektnamen sind in Ihrer Organisation sensibel und für jeden allgemeinen Detektor unsichtbar. Fügen Sie sie als eigene vertrauliche Begriffe hinzu, dann erhalten auch sie ihre Platzhalter.

  1. [1]BfDI: Datenschutzrechtliche Aspekte bei der Verarbeitung von Logfile-Daten
  2. [2]Datenschutzkonferenz: Orientierungshilfe „Künstliche Intelligenz und Datenschutz“ (6. Mai 2024)

Häufige Fragen

Fragen zu diesem Ablauf.

Enthalten Logdateien personenbezogene Daten?

Meistens ja. IP-Adressen, Nutzer- und Sitzungs-IDs sowie Anfragedaten in Logs lassen sich einer Person zuordnen; der Bundesbeauftragte für den Datenschutz behandelt Logfile-Daten deshalb als personenbezogen.

Erkennt es API-Schlüssel und Tokens?

Strukturierte Identifikatoren gehören zu dem, wonach gesucht wird, und Sie können konkrete Werte als eigene Begriffe ergänzen. Dennoch gilt: Die Erkennung erfolgt nach bestem Bemühen – eine Zugangsdatei, die irgendwo eingefügt wurde, sollte unabhängig davon rotiert werden, was ein Tool meldet.

Kann ich eine ganze Logdatei auf einmal schwärzen?

Ja. Öffnen Sie die Datei, statt Fragmente einzufügen: Wie lang sie auch ist, sie wird lokal verarbeitet, und die Platzhalter bleiben von der ersten bis zur letzten Zeile konsistent.

Versteht die KI ein geschwärztes Log überhaupt noch?

Meistens ja, weil die Struktur erhalten bleibt. Was die Schwärzung verhindert, ist eine Aufgabe, die tatsächlich den wörtlichen Wert braucht – etwa den Datensatz einer bestimmten Person nachzuschlagen.

Verwandt

Wo das noch eine Rolle spielt.

DSGVO-ANONYMISIERUNG

Anonymisierung personenbezogener Daten nach DSGVO: Anforderungen, Methoden und Beispiele

Verstehen Sie DSGVO-Anonymisierung, vergleichen Sie Techniken und reduzieren Sie identifizierende Details, bevor Sie Dokumente teilen oder KI nutzen.

PSEUDONYMISIERUNG

Ein lokales Pseudonymisierungs-Tool zum Ersetzen und Wiederherstellen

Ersetzen Sie Identifikatoren durch konsistente Platzhalter und stellen Sie sie während der Arbeitssitzung lokal wieder her. Prüfen Sie Dokumente, bevor Sie sie mit KI oder anderen Lesern teilen.

DLP FÜR KI

DLP für KI: Datenabfluss an ChatGPT & Co. erkennen und eindämmen

DLP für KI, selbst gehostet: sensible Daten finden, KI-Eingaben geprüft vorbereiten und Befunde auf Ihrer eigenen Infrastruktur verwalten.

DataAnonymiser unterstützt Schwärzung und Prüfung. Die Erkennung kann Identifikatoren und Geheimnisse übersehen; rotieren Sie offengelegte Zugangsdaten unabhängig vom Ergebnis. Diese Seite ist keine Rechtsberatung.

Nutzen Sie jede KI. Behalten Sie Ihre Daten.