Base de connaissances RH : guide pour un assistant IA
Base de connaissances RH : inventaire, nettoyage, métadonnées, droits d'accès, indexation RAG et tests. Suivez la méthode avant de lancer votre assistant IA.
Base de connaissances RH : les 9 étapes avant de lancer l'assistant
Une base de connaissances RH est un corpus documentaire validé, structuré et gouverné que l'assistant peut interroger pour répondre aux collaborateurs. Pour la créer correctement, il faut : cadrer les questions couvertes, inventorier les sources, nommer un propriétaire par document, supprimer les doublons, versionner, ajouter les métadonnées, reproduire les permissions, découper et indexer le contenu, puis tester les réponses et la gouvernance. Importer tout SharePoint dans un chatbot n'est donc pas une stratégie documentaire.
Dans une architecture RAG — retrieval-augmented generation — la question déclenche une recherche dans cet index. Les passages jugés pertinents sont ensuite transmis au modèle pour formuler une réponse accompagnée de ses sources. La documentation officielle d'Azure AI Search sur le RAG insiste sur les difficultés réelles : contenus dispersés, limites de contexte, pertinence de la recherche, contrôle d'accès et gouvernance. Le modèle n'améliore pas de lui-même un document ambigu ou périmé.
| Étape | Livrable attendu | Question de contrôle |
|---|---|---|
| 1. Périmètre | Liste des intentions couvertes | À quelles questions l'assistant doit-il répondre ? |
| 2. Inventaire | Registre des sources | Où se trouve la version officielle ? |
| 3. Propriétaires | Responsable nommé par document | Qui tranche une contradiction ? |
| 4. Nettoyage | Corpus sans doublons ni brouillons | Le contenu est-il lisible et validé ? |
| 5. Versioning | Cycle de vie documenté | Quelle version est applicable aujourd'hui ? |
| 6. Métadonnées | Schéma commun | Peut-on filtrer par entité, audience et date ? |
| 7. Permissions | Matrice d'accès | Un utilisateur ne retrouve-t-il que ses documents ? |
| 8. Indexation | Index traçable et synchronisé | Chaque fragment conserve-t-il sa source ? |
| 9. Tests | Jeu de questions et critères de recette | L'assistant sait-il répondre, citer ou s'abstenir ? |
Commencez par un périmètre métier étroit, par exemple le télétravail, les congés et les notes de frais pour une seule entité. Cette première version permet de valider la méthode avant d'ajouter paie, mobilité ou relations sociales. Si le périmètre, les intégrations et les responsabilités ne sont pas encore formalisés, utilisez d'abord notre plan de cahier des charges pour une automatisation RH.
Inventorier les documents et désigner un propriétaire métier
L'inventaire ne consiste pas à compter les PDF. Il relie chaque question à une source faisant autorité. Listez les espaces SharePoint, intranets, dossiers réseau, outils RH, modèles de mails et FAQ utilisés en pratique, puis rapprochez les copies qui traitent du même sujet. Pour chaque élément, consignez son titre, son emplacement, son format, son audience, son statut, sa date d'effet et son propriétaire métier.
Le propriétaire n'est pas nécessairement la personne qui administre SharePoint. C'est celle qui peut confirmer que la règle est correcte, arbitrer une contradiction et publier une nouvelle version : responsable paie pour les règles de bulletin, responsable relations sociales pour un accord collectif, DPO pour une procédure d'exercice des droits. Sans ce rôle, l'index finit par reproduire les divergences de l'organisation.
Classer chaque source : inclure, corriger ou exclure
| Décision | Exemples | Action |
|---|---|---|
| Inclure | Accord signé, procédure publiée, FAQ validée | Indexer avec version, portée et droits |
| Corriger avant inclusion | Scan mal reconnu, tableau sans en-tête, procédure ambiguë | Nettoyer, faire valider, puis indexer |
| Exclure | Brouillon, copie obsolète, notes personnelles, dossier salarié | Archiver ou traiter dans un flux séparé et autorisé |
Construisez ensuite une matrice « intention → source ». À « Puis-je télétravailler depuis l'étranger ? » doivent correspondre une politique précise, son champ géographique et sa version applicable. Si deux documents donnent des réponses différentes, bloquez cette intention jusqu'à arbitrage. La base de connaissances n'est prête que lorsque les règles de préséance sont explicites : accord local avant politique groupe, texte entré en vigueur avant ancien modèle, source officielle avant FAQ informelle.
Nettoyer, versionner et ajouter les métadonnées de fraîcheur
Le nettoyage vise à conserver le sens utile à la recherche. Corrigez l'OCR des documents scannés, retirez en-têtes et pieds de page répétés, préservez les titres, listes, tableaux et renvois, puis rattachez les annexes au bon document. Une ligne isolée comme « applicable après six mois » devient dangereuse si le fragment ne conserve ni le sujet, ni l'entité, ni la date d'effet.
Attribuez un identifiant stable à chaque document et ne remplacez jamais silencieusement son contenu. Un cycle simple suffit : brouillon → validé → publié → archivé. L'index destiné aux collaborateurs ne doit servir que les versions publiées et applicables ; les versions précédentes peuvent être conservées séparément pour l'audit, sans être proposées comme réponse courante.
Les métadonnées minimales à conserver
- --Identité : identifiant du document, titre, type de contenu et URL de la source officielle.
- --Cycle de vie : numéro de version, statut, date de publication, date d'effet, date de fin éventuelle et prochaine revue.
- --Responsabilité : propriétaire métier, valideur et canal de signalement d'une erreur.
- --Portée : pays, établissement, entité juridique, population, langue et thème RH.
- --Traçabilité : page ou section d'origine, identifiant du fragment et date de dernière indexation.
- --Accès : groupes autorisés, niveau de confidentialité et présence éventuelle de données personnelles.
La fraîcheur ne se résume pas à une revue annuelle identique pour tous. Définissez une échéance selon la volatilité et des déclencheurs événementiels : signature d'un avenant, changement de prestataire de mutuelle, nouvelle procédure, modification réglementaire ou arrivée d'une entité. Une tâche est envoyée au propriétaire avant l'échéance ; sans validation, le document est signalé comme à revoir ou retiré des réponses sensibles. Les métadonnées peuvent ensuite filtrer la recherche pour éviter qu'une règle française soit appliquée à une filiale belge ou qu'une ancienne politique supplante la version en vigueur.
Passez de la méthode au déploiement
Profilya vous accompagne pour cadrer le cas d'usage, sécuriser les données et déployer une automatisation adaptée à vos outils et à vos équipes.
Assistant RH IA (RAG)Appliquer les permissions, la sécurité et le RGPD avant l'indexation
Une base de connaissances RH ne doit pas devenir un raccourci autour des droits existants. Reprenez les groupes d'accès de la source, attachez-les au document puis à chacun de ses fragments, identifiez l'utilisateur au moment de la requête et filtrez les résultats avant de les transmettre au modèle. Microsoft décrit ce mécanisme comme un contrôle d'accès au niveau du document : les résultats non autorisés sont exclus en comparant l'identité ou les groupes de l'appelant aux permissions stockées dans l'index. La documentation sur le filtrage de sécurité d'Azure AI Search rappelle aussi qu'en cas de découpage, les informations de sensibilité doivent être projetées sur chaque fragment.
Séparez au minimum les contenus accessibles à tous, aux managers, aux RH et aux rôles spécialisés. Un accord collectif publié n'a pas le même niveau de confidentialité qu'une procédure disciplinaire interne. Les dossiers individuels, rémunérations, évaluations et données de santé n'ont généralement pas leur place dans un index documentaire général. Lorsqu'un collaborateur demande son solde de congés, l'assistant peut appeler le SIRH avec son identité et ses autorisations, puis présenter la donnée sans la recopier durablement dans la base. Notre article sur l'architecture d'une connexion entre Lucca et une IA illustre cette séparation entre documentation RAG et données transactionnelles.
Si le corpus contient des données personnelles, documentez la finalité, la base légale, les destinataires, les durées de conservation et les droits des personnes. Les principes de minimisation, d'exactitude, de limitation de la conservation et d'intégrité/confidentialité figurent à l'article 5 du RGPD. L'article 32 impose pour sa part des mesures adaptées au risque. La fiche de la CNIL sur la sécurité des systèmes d'IA recommande de combiner sécurité de l'infrastructure, gestion des habilitations, maintenance logicielle et analyse des risques propres à l'IA.
Traiter aussi les documents comme des entrées non fiables
Un fichier indexé peut contenir une instruction cachée ou détournée qui cherche à modifier le comportement du modèle. Le RAG ne neutralise pas ce risque : l'OWASP classe l'injection de prompt parmi les risques majeurs des applications LLM. Réservez l'ingestion aux emplacements approuvés, analysez les nouveaux fichiers, séparez les contenus externes, donnez au modèle le minimum de privilèges et exigez une validation humaine avant toute action sensible. Les secrets, clés API et instructions d'administration ne doivent jamais se trouver dans les documents récupérables. Utilisez la checklist de conformité IA RH pour formaliser ces contrôles avec le DPO et la sécurité.
Découper et indexer les documents pour une recherche RAG fiable
Le chunking découpe un document en unités que le moteur peut retrouver séparément. Un bon fragment porte une idée exploitable et conserve son contexte : titre du document, section, population concernée, date d'effet et référence de page. Découpez en priorité sur la structure naturelle — articles, titres, paragraphes, lignes de tableau — plutôt qu'à une longueur fixe qui séparerait une condition de son exception.
Il n'existe pas de taille de fragment universelle. Un article d'accord collectif, une procédure pas-à-pas et un tableau de remboursement ne se découpent pas de la même façon. La documentation Microsoft sur le découpage des documents pour le RAG recommande de choisir les paramètres selon les modèles et les usages, et prévoit un chevauchement pour préserver le contexte lorsque c'est utile. La bonne valeur est celle qui réussit votre jeu de tests, pas celle copiée d'un tutoriel.
Pipeline d'indexation recommandé
- Récupérer uniquement les sources approuvées et leur version.
- Extraire le texte, les tableaux et les références de page.
- Nettoyer puis découper selon la structure du contenu.
- Joindre les métadonnées, permissions et identifiants de source.
- Créer les représentations vectorielles et l'index textuel.
- Tester la recherche hybride, les filtres et le classement.
- Publier l'index validé et journaliser sa version.
Une recherche hybride, combinant termes exacts et similarité sémantique, est utile quand les collaborateurs emploient des mots différents de la documentation tout en citant parfois une référence précise. Appliquez d'abord les filtres de portée et d'accès, récupérez quelques passages pertinents, puis demandez au modèle de répondre seulement à partir de ce contexte, de citer le document et de signaler quand l'information manque ou se contredit. Conservez dans chaque citation l'URL, le titre, la version et la section : sans provenance consultable, l'équipe RH ne peut ni vérifier ni corriger la réponse.
Tester l'assistant RH et organiser la gouvernance après le lancement
La recette commence par un jeu de questions réelles, réécrites sans données identifiantes, couvrant les formulations courantes, les exceptions et les cas sans réponse. Pour chacune, notez le document attendu, les passages acceptables, l'audience autorisée et le comportement souhaité : répondre, demander une précision ou escalader. Conservez ce jeu de référence pour le rejouer à chaque changement de document, de découpage, de moteur de recherche ou de modèle.
| Test | Ce qu'il faut vérifier | Échec à corriger |
|---|---|---|
| Récupération | La bonne source apparaît parmi les passages retenus | Document absent, mauvais fragment ou filtre trop strict |
| Fidélité | La réponse ne dépasse pas ce que disent les sources | Ajout d'une règle, d'un délai ou d'une exception |
| Citation | Titre, version et section ouvrent la source exacte | Lien générique ou document impossible à vérifier |
| Abstention | L'assistant reconnaît un manque ou une contradiction | Réponse plausible produite sans preuve |
| Permissions | Chaque rôle voit uniquement son périmètre | Fragment confidentiel visible ou déductible |
| Fraîcheur | Une version remplacée disparaît des réponses courantes | Ancienne règle encore récupérée |
| Sécurité | Les consignes malveillantes sont ignorées et signalées | Action ou divulgation provoquée par un document |
Fixez vos critères d'acceptation par cas d'usage. Une question générale sur l'adresse du service RH n'a pas le même niveau de risque qu'une interprétation d'accord ou qu'une donnée individuelle. Pour les sujets sensibles, l'assistant peut afficher la source et orienter vers un humain au lieu de conclure. Faites tester le pilote par des collaborateurs, des managers, les RH, le DPO et l'équipe sécurité avec leurs véritables rôles d'accès.
Une gouvernance légère, mais continue
- --Propriétaires métier : valident le contenu, sa portée et sa date de prochaine revue.
- --Administrateur de la connaissance : surveille la synchronisation, les doublons, les versions et les questions sans réponse.
- --DPO et sécurité : réévaluent les risques, les habilitations, la journalisation et les incidents.
- --Comité de suivi : priorise les lacunes documentaires et valide les changements importants du système.
Suivez les questions sans réponse, les citations ouvertes, les retours négatifs, les erreurs de récupération, les documents proches de leur échéance et les tentatives d'accès refusées. Ces signaux doivent créer une tâche affectée, pas seulement remplir un tableau de bord. Si vous souhaitez transformer ce cadre en audit documentaire, POC sur vos questions réelles puis déploiement dans Teams, Slack ou votre intranet, découvrez l'accompagnement Profilya pour créer un assistant RH IA.
Questions fréquentes
Quels documents inclure dans une base de connaissances RH ?
Commencez par les documents validés qui répondent aux questions récurrentes : règlement intérieur, accords d'entreprise, politique de télétravail, règles de congés, notes de frais, mutuelle, onboarding et procédures RH. N'indexez pas par défaut les dossiers individuels, les évaluations, les bulletins de paie ou les brouillons non validés.
Faut-il déplacer tous les documents RH dans un nouvel outil ?
Non. La base de connaissances peut indexer des sources existantes comme SharePoint, un intranet ou un espace documentaire, à condition de définir une source de référence et de synchroniser son contenu, ses versions et ses permissions. Évitez cependant d'indexer plusieurs copies concurrentes d'un même document.
Combien de documents faut-il pour lancer un assistant RH IA ?
Il n'existe pas de minimum universel. Un corpus restreint, validé et centré sur quelques intentions fréquentes est préférable à des milliers de fichiers contradictoires. Le bon périmètre est celui qui permet de répondre à un lot de questions métier défini et testé avant le pilote.
À quelle fréquence mettre à jour la base de connaissances RH ?
La fréquence dépend de la volatilité du contenu. Une procédure ou une liste de contacts peut nécessiter une revue fréquente, tandis qu'un accord stable peut suivre son échéance juridique. Chaque document doit avoir un propriétaire, une date de prochaine revue et des événements déclencheurs comme une nouvelle version, un avenant ou un changement réglementaire.
Peut-on indexer des données personnelles dans une base de connaissances RH ?
Seulement si leur traitement est nécessaire, dispose d'une base légale et respecte les principes du RGPD, notamment la minimisation, la durée de conservation et la sécurité. Pour les données individuelles comme un solde de congés, il est généralement plus sûr d'interroger le SIRH à la demande avec l'identité et les droits de l'utilisateur, plutôt que de les copier dans un index documentaire général.
Quelle différence entre une base de connaissances RAG et l'entraînement d'un modèle ?
Dans un système RAG, les documents sont découpés et indexés pour être retrouvés au moment de la question, puis fournis au modèle comme contexte. Ils ne servent pas nécessairement à modifier les paramètres du modèle. Cette séparation facilite la mise à jour et le retrait d'un document, sans entraîner de nouveau le modèle.
Comment empêcher un assistant RH IA d'inventer une réponse ?
On ne peut pas garantir qu'un modèle génératif n'inventera jamais. On réduit le risque avec un corpus validé, une recherche testée, des citations obligatoires, une consigne d'abstention quand les sources sont insuffisantes, des seuils de récupération adaptés et une escalade vers l'équipe RH. Les réponses sensibles doivent rester contrôlées par un humain.
Pages associées
Pour aller plus loin
Assistant RH IA (RAG)
Profilya vous accompagne pour cadrer le besoin, sécuriser les données et déployer une solution adaptée à vos outils et à vos équipes.