Intro
Un responsable RH exporte les données de paie des cinq dernières années pour « alimenter » un outil d'IA censé prédire le taux d'absentéisme : noms, salaires, diagnostics médicaux, évaluations de performance — tout y passe. Sous la nouvelle loi fédérale sur la protection des données (nLPD), entrée en vigueur le 01.09.2023, ce geste anodin constitue un traitement de données sensibles sans base légale suffisante, exposant l'entreprise à des sanctions pénales allant jusqu'à CHF 250 000.
Ce que la nLPD change réellement pour les projets IA en RH
La nLPD ne règle pas spécifiquement l'IA, mais ses principes — en particulier la minimisation des données (art. 6 al. 2), la finalité déterminée (art. 6 al. 3) et l'obligation d'analyse d'impact (AIPD) pour les traitements à risque élevé — encadrent directement tout projet d'entraînement de modèle. Un modèle prédictif RH traite quasi systématiquement des données sensibles au sens de l'art. 5 let. c nLPD : santé (absences maladie, diagnositics AT/ANP), opinions syndicales, voire origine. Ces catégories imposent des exigences renforcées.
Trois questions déterminent si votre projet IA déclenche la nLPD :
- Les données permettent-elles d'identifier une personne physique, même indirectement ? Si oui, vous traitez des données personnelles, même après pseudonymisation partielle.
- La finalité de l'entraînement IA est-elle compatible avec la finalité originale de collecte ? Des données salariales collectées pour la paie ne peuvent pas être réutilisées librement pour modéliser la probabilité de démission sans base légale ou consentement supplémentaire.
- Le résultat du modèle prend-il des décisions automatisées affectant des individus ? L'art. 21 nLPD impose alors un droit d'opposition et d'explication.
Une PME de 30 employés n'échappe pas à ces règles sous prétexte de taille : la nLPD ne prévoit aucun seuil d'effectifs pour l'obligation de protection, contrairement au RGPD européen qui exonère partiellement les TPE. Le seul critère est la nature du traitement.
Anonymisation vs pseudonymisation : la distinction qui change tout
Pseudonymisation : un traitement de données personnelles qui subsiste
Remplacer un nom par un identifiant (« EMP-0042 ») sans supprimer la clé de correspondance, c'est de la pseudonymisation. Le PFPDT (Préposé fédéral à la protection des données et à la transparence) est clair : les données pseudonymisées restent des données personnelles. Elles ne peuvent donc pas être utilisées pour entraîner un modèle externe sans base légale appropriée. La pseudonymisation est utile comme mesure de sécurité interne, pas comme porte de sortie légale.
Anonymisation réelle : le critère d'irréversibilité
Des données sont véritablement anonymes lorsqu'il est impossible, de manière absolue ou pratiquement, de réidentifier la personne — même en croisant avec d'autres jeux de données disponibles. La nLPD ne fixe pas de technique obligatoire ; elle impose un résultat. En pratique, plusieurs techniques coexistent :
- Généralisation : remplacer un salaire exact (CHF 87 400) par une tranche (CHF 80 000–90 000), un âge précis par une décennie (40–49 ans).
- Suppression de quasi-identifiants : retirer canton de domicile, titre exact, date d'entrée précise lorsqu'ils permettent à eux seuls de pointer vers un individu dans une petite structure.
- Noise injection (bruit différentiel) : ajouter une perturbation statistique contrôlée aux valeurs numériques (salaires, durées d'absence) de façon à rendre toute inférence individuelle infaisable.
- Données synthétiques : générer un jeu de données artificiel dont la distribution statistique mime les données réelles, mais où aucune ligne ne correspond à une personne existante. C'est la technique la plus robuste pour l'entraînement IA.
- k-anonymat : garantir que chaque combinaison d'attributs sensibles est partagée par au moins k individus (k ≥ 5 est un seuil minimal acceptable, k ≥ 10 recommandé pour des données de santé).
Le risque de réidentification dans une PME de 5 à 50 employés
Dans une structure de 15 personnes, même une donnée aussi banale que « femme, 35–44 ans, responsable de département, absences > 10 jours en 2023 » peut désigner une seule employée. Le seuil de k-anonymat doit être évalué en tenant compte de la taille réelle de la cohorte, pas d'un barème générique. Pour toute population inférieure à 50 individus, privilégiez les données synthétiques ou agrégez jusqu'à obtenir des groupes d'au moins 10 observations.
Analyse d'impact (AIPD) : quand est-elle obligatoire ?
L'art. 22 nLPD impose une analyse d'impact sur la protection des données avant tout traitement susceptible d'engendrer un risque élevé pour les droits fondamentaux. Entraîner un modèle IA sur des données RH entre dans ce périmètre dès lors que :
- les données sont sensibles (santé, convictions),
- le traitement est automatisé à grande échelle ou permet des décisions automatisées,
- ou qu'une surveillance systématique des employés est en jeu.
L'AIPD n'est pas un formulaire à remplir une fois. C'est une démarche documentée qui identifie les risques, les mesures d'atténuation et le résidu de risque accepté. Elle doit être mise à jour si le projet évolue. En cas de risque résiduel élevé après mesures, la nLPD prévoit la consultation du PFPDT avant traitement — une procédure rare en pratique pour les PME, mais légalement contraignante.
Pour un projet d'IA RH interne (prédiction d'absentéisme, scoring de candidats, analyse de turnover), une AIPD allégée — deux à quatre pages documentant finalité, données traitées, mesures d'anonymisation, droits des personnes et risques résiduels — est généralement suffisante si les données sont préalablement anonymisées. L'anonymisation réussie fait sortir les données du champ de la nLPD : aucune AIPD n'est alors requise pour la phase d'entraînement elle-même.
Procédure d'anonymisation pour un projet IA RH en PME : étape par étape
- Inventaire des données sources — Lister exactement quels champs seront extraits (salaire brut, absences, catégorie de poste, âge, ancienneté, sexe, évaluations). Inclure les métadonnées (horodatages, identifiants système).
- Classification de sensibilité — Distinguer données ordinaires (salaire, ancienneté) et données sensibles (motif d'absence maladie, diagnostic, grossesse). Les données sensibles imposent une anonymisation plus agressive ou leur exclusion.
- Sélection de la technique d'anonymisation — Pour une PME < 50 employés, privilégier la génération de données synthétiques (outils open source : SDV, Synthpop, ou services cloud conformes) plutôt que la généralisation seule, insuffisante dans les petites cohortes.
- Test de réidentification (privacy audit) — Avant utilisation, tenter activement de réidentifier des individus dans le jeu anonymisé en croisant avec des données publiques ou internes disponibles (organigramme, listes de projets). Si une réidentification est possible pour > 0 individu, recommencer.
- Documentation AIPD — Même si l'anonymisation est réussie, conserver la trace de la démarche : qui a décidé, quelle technique, quel audit, quelle date. En cas de contrôle du PFPDT, cette documentation est votre première ligne de défense.
- Information des employés — La politique de confidentialité (ou le règlement de traitement des données) doit mentionner l'utilisation des données RH à des fins d'analyse ou d'IA, même anonymisée. L'art. 19 nLPD impose une information active lors de la collecte.
- Contrat avec les prestataires IA externes — Si un outil SaaS ou un prestataire accède aux données (même anonymisées), un contrat de traitement des données (art. 9 nLPD) doit être signé s'il y a délégation de traitement. Si les données sont vraiment anonymes, techniquement ce n'est pas obligatoire — mais contractuellement, c'est prudent.
- Révision annuelle — Les techniques de réidentification évoluent. Ce qui était robuste en 2024 peut ne plus l'être en 2026. Planifiez un audit annuel de votre jeu de données d'entraînement.
Cas pratique
Fiduciaire Morier SA, Lausanne — 28 employés, projet prédiction de turnover
Céline Morier, directrice associée, souhaite réduire le turnover (actuellement 18 % annuel, coûtant environ CHF 45 000 par départ en recrutement et formation). Elle mandate une développeuse IA indépendante, Anaïs Roth, pour construire un modèle prédictif à partir des données RH des cinq dernières années.
Données disponibles : 28 employés actuels + 12 anciens employés sur 5 ans = 40 observations. Champs : salaire mensuel brut, ancienneté (mois), catégorie de poste (5 catégories), âge, sexe, nombre d'absences/an, motif d'absence (maladie / accident / autre), score d'évaluation annuel (1–5), issue (resté / démissionné / licencié).
Problème identifié : 40 observations, c'est insuffisant pour un k-anonymat robuste. Avec 5 catégories de poste, 2 sexes et une tranche d'âge sur dix ans, certaines cellules ne contiennent qu'un seul individu. La généralisation seule ne suffit pas.
Solution retenue : Anaïs Roth utilise la bibliothèque Python SDV (Synthetic Data Vault) pour générer 500 individus synthétiques dont la distribution statistique reproduit fidèlement les corrélations observées (ancienneté/salaire, âge/absentéisme, poste/turnover). Les données synthétiques ne correspondent à aucun des 40 individus réels.
Audit de réidentification : Céline Morier et Anaïs Roth tentent de retrouver « Marc Sonnenschein, 52 ans, associé senior, CHF 9 800/mois, démissionné en 2021 » dans le jeu synthétique. Aucune ligne ne lui correspond à moins de trois attributs simultanément erronés. Test concluant.
Documentation : Une AIPD de trois pages est rédigée, signée par Céline Morier, et archivée. La politique de confidentialité RH est mise à jour pour mentionner l'utilisation analytique des données agrégées. Le contrat avec Anaïs Roth inclut une clause de confidentialité et d'interdiction de conservation des données sources.
Résultat : Le modèle, entraîné sur données synthétiques, produit un score de risque de départ par profil de poste. Aucune donnée personnelle réelle n'a quitté l'environnement interne. La démarche est conforme à la nLPD et défendable devant le PFPDT.
Récapitulatif opérationnel
- Ne jamais utiliser directement un export RH brut (paie, absences, évaluations) pour entraîner un modèle IA sans anonymisation préalable — même pour un usage interne.
- Distinguer pseudonymisation et anonymisation : remplacer un nom par un code ne suffit pas. L'irréversibilité doit être testée, pas supposée.
- Choisir les données synthétiques dès que la cohorte est inférieure à 100 individus : c'est la seule technique offrant une garantie robuste de non-réidentification dans une PME.
- Réaliser un test de réidentification actif avant tout usage : tentez vous-même de retrouver un individu connu dans le jeu anonymisé, en croisant avec l'organigramme et des données publiques.
- Documenter la démarche AIPD même allégée : finalité, technique d'anonymisation, résultat du test, responsable, date. Deux pages suffisent si le traitement est limité.
- Mettre à jour la politique de confidentialité RH pour couvrir explicitement les usages analytiques et IA, conformément à l'obligation d'information de l'art. 19 nLPD.
- Contractualiser avec tout prestataire externe accédant aux données, même anonymisées : clause de confidentialité, interdiction de réutilisation, suppression après projet.
- Vérifier la finalité de collecte originale : les données salariales collectées pour la paie ne peuvent pas être réutilisées pour scorer des candidats sans base légale ou information supplémentaire.
- Exclure systématiquement les données sensibles de santé (diagnostics, motifs médicaux détaillés) du jeu d'entraînement — ou les remplacer par des catégories larges (absence maladie / autre) sans précision clinique.
- Planifier un audit annuel du jeu de données synthétiques : les techniques de réidentification évoluent, ce qui était sûr aujourd'hui peut ne plus l'être demain.
SynHR intègre des contrôles de traitement des données conformes à la nLPD dans les flux RH, pour aider les PME romandes à structurer leurs données avant tout projet analytique ou IA.
Sources
- Loi fédérale sur la protection des données (nLPD) — fedlex.admin.ch — Texte consolidé de la nLPD en vigueur depuis le 01.09.2023, avec les art. 5, 6, 9, 19, 21 et 22 cités dans l'article.
- Préposé fédéral à la protection des données et à la transparence (PFPDT) — Autorité de surveillance, guides pratiques sur l'anonymisation et l'analyse d'impact.
- Secrétariat d'État à l'économie (SECO) — Informations sur le droit du travail suisse et les obligations des employeurs en matière de traitement des données des travailleurs.
- Office fédéral de la statistique (OFS) — Méthodes de protection des données statistiques et standards de confidentialité applicables aux données agrégées.