FUNDAMENTOS
¿Qué es la anonimización de datos?
La anonimización modifica datos personales de modo que nadie pueda identificar a la persona por medios razonablemente probables. Si se alcanza ese umbral, los datos quedan fuera del RGPD. Precisamente por eso es mucho más exigente de lo que suele suponerse.
La definición y su palabra decisiva
Anonimizar significa impedir la identificación directa e indirecta. Quitar el nombre no basta si código postal, fecha de nacimiento y profesión, combinados, siguen señalando a una persona.
La prueba no consiste en retirar los identificadores evidentes, sino en valorar si alguien podría identificar a la persona combinando el resultado con otros datos razonablemente accesibles.
Anonimización, seudonimización y enmascaramiento no son sinónimos
La anonimización efectiva es irreversible para cualquiera y, según el considerando 26 del RGPD, deja de ser información personal.
La seudonimización sustituye identificadores pero conserva información separada que permite revertir el proceso. Sigue siendo tratamiento de datos personales, aunque reduce el riesgo.
El enmascaramiento solo describe cómo se ocultan caracteres. Puede apoyar cualquiera de los objetivos anteriores o no lograr ninguno. Las herramientas vendidas como anonimizadoras suelen conservar una clave duradera; DataAnonymiser no guarda ninguna: la tabla de correspondencia solo vive en memoria durante una sesión y desaparece con ella. Para cualquier parte a la que entregue el resultado ya no existe clave con la que revertirlo. Queda la segunda mitad del criterio: si el texto restante sigue identificando a alguien de forma indirecta. La detección es de mejor esfuerzo y los cuasi-identificadores la sobreviven.
Técnicas principales
La supresión elimina campos; la generalización reduce precisión; la perturbación añade ruido calibrado; la agregación publica grupos en vez de filas individuales; y los datos sintéticos imitan la estructura estadística.
Medidas como k-anonimato, l-diversidad y t-closeness evalúan si una fila sigue destacando por sus cuasiidentificadores. La privacidad diferencial establece un límite matemático a la aportación de una persona.
Por qué falla la anonimización
Datos que parecen anónimos de forma aislada pueden identificar al cruzarlos con otro conjunto. Los datos escasos y con muchas dimensiones son especialmente vulnerables.
El riesgo cambia con el tiempo: nuevas fuentes auxiliares pueden permitir reidentificar mañana lo que hoy parece seguro. Por ello debe revisarse continuamente.
El texto libre y las imágenes son distintos
En datos estructurados se conocen las columnas. En texto libre, un nombre, diagnóstico o cuenta puede aparecer en cualquier lugar y forma; en imágenes, el contexto también identifica.
La detección en contenido no estructurado es de mejor esfuerzo, no una garantía. Revise siempre el resultado antes de tratarlo como seguro.
Dónde encaja una herramienta local
Cuando el objetivo es evitar que identidades lleguen a un asistente de IA u otro tercero, la seudonimización local aborda el riesgo práctico: el tercero nunca recibe los valores y la información de restauración no sale del dispositivo.
DataAnonymiser conserva esa correspondencia solo en la sesión activa. Es una ayuda práctica y local, no una determinación automática de cumplimiento.