FONDAMENTAUX
Qu’est-ce que l’anonymisation des données ?
L’anonymisation transforme les données personnelles afin que personne ne puisse identifier l’individu par des moyens raisonnablement susceptibles d’être utilisés. Si ce seuil est atteint, les données sortent du champ du RGPD. C’est pourquoi l’exigence est bien plus élevée qu’on ne le pense souvent.
La définition et son mot décisif
Anonymiser signifie empêcher l’identification directe comme indirecte. Supprimer le nom ne suffit pas si le code postal, la date de naissance et le métier permettent ensemble de retrouver une personne.
Le test consiste à déterminer si quelqu’un pourrait encore identifier l’individu en combinant le résultat avec d’autres données raisonnablement accessibles.
Anonymisation, pseudonymisation et masquage ne sont pas synonymes
Une anonymisation réelle est irréversible pour toute partie et, selon le considérant 26 du RGPD, ne relève plus des données à caractère personnel.
La pseudonymisation remplace les identifiants mais conserve séparément l’information permettant le retour en arrière. Elle reste un traitement de données personnelles, tout en réduisant le risque.
Le masquage décrit seulement l’occultation de caractères. Il peut servir l’un des objectifs précédents ou aucun. Les outils vendus comme anonymiseurs conservent en général une clé durable ; DataAnonymiser n’en garde aucune : la table de correspondance ne vit qu’en mémoire, le temps d’une session, et disparaît avec elle. Pour toute partie à qui vous remettez le résultat, il n’existe plus de clé permettant de revenir en arrière. Reste la seconde moitié du critère : savoir si le texte restant identifie encore quelqu’un indirectement. La détection est faite au mieux et les quasi-identifiants y survivent.
Les principales techniques
La suppression retire des champs ; la généralisation réduit la précision ; la perturbation ajoute un bruit calibré ; l’agrégation publie des groupes ; les données synthétiques reproduisent une structure statistique.
Le k-anonymat, la l-diversité et la t-proximité évaluent si une ligne reste identifiable par ses quasi-identifiants. La confidentialité différentielle limite mathématiquement la contribution d’un individu.
Pourquoi l’anonymisation échoue
Des données apparemment anonymes isolément peuvent identifier quelqu’un une fois rapprochées d’un autre jeu. Les données rares et très dimensionnelles sont particulièrement vulnérables.
Le risque évolue : de nouvelles sources auxiliaires peuvent réidentifier demain ce qui semble sûr aujourd’hui. L’évaluation doit donc être continue.
Le texte libre et les images posent un autre problème
Dans des données structurées, les colonnes sont connues. Dans du texte libre, un nom, un diagnostic ou un compte peut apparaître n’importe où ; dans une image, le contexte peut également identifier.
La détection sur du contenu non structuré reste une démarche de meilleur effort, jamais une garantie. Le résultat doit être relu avant d’être considéré comme sûr.
La place d’un outil local
Pour empêcher que des identités atteignent un assistant IA ou un tiers, la pseudonymisation locale traite le risque concret : le destinataire ne reçoit jamais les valeurs et les correspondances de restauration ne quittent pas l’appareil.
DataAnonymiser conserve ces correspondances uniquement pendant la session active. C’est une aide pratique locale, pas une décision automatique de conformité.