Seuil matching candidat-poste : calibrer sans exclure
Calibrez un seuil matching candidat-poste avec rappel, faux négatifs, zone grise, équité et revue humaine. Suivez le protocole.
La réponse courte : calibrer une décision, pas choisir un nombre rond
Pour régler un seuil matching candidat-poste, partez du tort que produirait une erreur, pas d'un nombre séduisant comme 70/100. Définissez d'abord ce que le système décide : ordonner une pile, prioriser une première lecture, envoyer un profil en revue ou l'écarter. Construisez ensuite une vérité terrain indépendante, tracez le rappel et la précision à chaque seuil possible, chiffrez le coût des candidatures pertinentes manquées et gardez une zone grise pour la revue humaine. Validez enfin le choix sur des données que vous n'avez pas utilisées pour le régler.
Il n'existe donc ni seuil standard, ni score minimum valable pour tous les éditeurs, postes ou volumes. Deux outils qui affichent « 80 % » peuvent mesurer des objets entièrement différents. Un seuil performant sur les développeurs Java reçus l'an dernier peut aussi échouer sur des profils data, des CV en anglais ou une nouvelle taxonomie de compétences. La question exploitable n'est pas « quel nombre choisir ? », mais « quelles erreurs ce nombre provoque-t-il dans notre contexte, et lesquelles refusons-nous ? »
| Décision à documenter | Question de calibration | Garde-fou |
|---|---|---|
| Usage exact | Que change le score dans le parcours ? | Aucune finalité vague comme « améliorer le recrutement » |
| Erreur critique | Quel dommage cause un faux négatif ? | Contrainte minimale de rappel définie avant le test |
| Capacité humaine | Combien de profils peuvent être réellement relus ? | Zone grise et échantillon de contrôle sous le seuil |
| Population | Sur quels postes, langues et groupes la preuve tient-elle ? | Mesures désagrégées avec incertitude |
Cette approche rejoint le NIST AI RMF Playbook, qui recommande de choisir les métriques selon l'usage, de définir des limites acceptables de performance et les actions correctives associées, puis de réévaluer leur pertinence lorsque le contexte ou les données dérivent. Le cadre est volontaire ; il fournit ici une méthode de travail, pas un seuil de conformité.
Score de similarité, rang et probabilité : trois objets différents
Avant toute coupure, obtenez la définition mathématique et opérationnelle de la sortie. Un score de similarité compare par exemple deux représentations textuelles. Une matrice de scoring candidat-poste additionne des critères pondérés. Un rang indique seulement qu'un profil est placé avant un autre. Aucun de ces objets ne donne spontanément la probabilité qu'un candidat soit pertinent, réussisse un entretien ou performe dans le poste.
Une probabilité dite calibrée a une propriété vérifiable : parmi les observations auxquelles le modèle attribue une probabilité proche de p, une proportion proche de p possède effectivement l'étiquette cible. Cela exige une cible définie, des observations ultérieures et un test local. Afficher 0,8 ou 80 % ne prouve rien à lui seul. Le travail de Guo, Pleiss, Sun et Weinberger sur la calibration montre notamment que performance de classement et calibration des probabilités sont deux propriétés distinctes. Leurs expériences portent sur des réseaux neuronaux et ne valident évidemment aucun outil de recrutement en particulier.
Test de lecture d'un score affiché à 0,80
Demandez : « 0,80 de quoi ? », « pour quelle cible ? », « calibré sur quelle population et quelle période ? », « avec quel diagramme de fiabilité et quelle incertitude ? ». Sans réponses, utilisez ce score comme une valeur de classement interne, jamais comme « 80 % de chances de convenir ».
Si une probabilité est réellement nécessaire, réservez un jeu de calibration distinct des données d'entraînement. Une courbe de fiabilité compare les probabilités annoncées aux fréquences observées par tranche ; le score de Brier complète cette lecture :
Brier = (1 / n) × Σ (pᵢ − yᵢ)²
avec pᵢ la probabilité annoncée et yᵢ la vérité binaire. Une méthode de recalibration comme la régression logistique, l'isotonique ou le temperature scaling doit être apprise sans toucher au jeu de test final. Elle peut changer la valeur numérique du seuil sans améliorer le classement : c'est normal. Elle ne répare en revanche ni une mauvaise cible, ni un CV mal parsé, ni un critère discriminatoire.
Établir la vérité terrain et mesurer le coût des faux négatifs
Un seuil ne peut être évalué qu'en comparaison d'une référence. Évitez de prendre « embauché dans le passé » pour vérité terrain : vous ne connaissez généralement pas la performance des personnes qui ont été refusées, et les décisions historiques peuvent incorporer des préférences sans lien avec le poste. Choisissez une cible observable et adaptée à l'étape, par exemple « candidature à soumettre à une lecture approfondie selon les critères professionnels annoncés ».
Deux évaluateurs métier examinent chaque dossier indépendamment, sans voir le score. La grille décrit les preuves acceptées, le traitement d'une information absente et les critères réellement indispensables. Les désaccords sont arbitrés et conservés comme signal d'incertitude. Un faible accord humain n'est pas une invitation à automatiser : il indique d'abord que la cible ou les instructions doivent être clarifiées. Notre protocole pour tester un outil de tri de CV détaille la constitution et le gel de ce corpus.
La matrice de confusion à chaque seuil candidat
| Résultat | Référence humaine | Effet opérationnel |
|---|---|---|
| Vrai positif (TP) | Pertinent et au-dessus du seuil | Profil utile rendu visible |
| Faux positif (FP) | Non pertinent mais au-dessus | Temps de revue supplémentaire |
| Faux négatif (FN) | Pertinent mais sous le seuil | Bonne candidature moins visible ou perdue |
| Vrai négatif (TN) | Non pertinent et sous le seuil | Lecture évitée selon l'usage |
Rappel
TP / (TP + FN)
Part des profils pertinents conservés.
Précision
TP / (TP + FP)
Part des profils remontés qui sont pertinents.
Taux de faux négatifs
FN / (TP + FN) = 1 − rappel
Part des profils pertinents manqués.
Abaisser le seuil augmente généralement le rappel et la charge de lecture ; le relever améliore parfois la précision, mais augmente le risque de faux négatifs. « Accuracy » et F1 peuvent masquer ce compromis, surtout lorsque les candidatures pertinentes sont rares. Publiez donc les nombres TP, FP, FN et TN avec les taux, la prévalence et des intervalles de confiance. Une différence de quelques points sur un petit échantillon ne justifie pas à elle seule un réglage irréversible.
Vous pouvez formaliser l'arbitrage sans convertir la dignité d'un candidat en euros :
Coût(t) = cFN × FN(t) + cFP × FP(t) + cR × Nrevue(t)
Les coefficients représentent des priorités de gouvernance documentées : gravité d'une exclusion erronée, temps de revue et risque de manquer un recrutement. Le seuil retenu minimise ce coût uniquement parmi les options qui respectent d'abord vos contraintes de rappel, d'équité, de droit et de capacité. Les contraintes protègent contre un optimum économique qui sacrifierait les faux négatifs.
Passez de la méthode au déploiement
Profilya vous accompagne pour cadrer le cas d'usage, sécuriser les données et déployer une automatisation adaptée à vos outils et à vos équipes.
Solution de tri de CV par IAChoisir un seuil par usage et instaurer une zone grise
Le même modèle appelle des règles différentes selon son effet réel. Pour un simple ordre de lecture où tous les CV restent accessibles et seront finalement examinés, comparez surtout la qualité du haut de liste et le délai avant lecture des profils pertinents. Pour une shortlist limitée, le rappel devient une contrainte centrale. Pour une exclusion, le risque humain et juridique change d'échelle : un score seul ne devrait pas déclencher le rejet.
| Usage | Réglage utile | Risque à contrôler |
|---|---|---|
| Classement d'aide à la lecture | Rang, couverture du top-k et délai de lecture | Profils durablement enfouis en bas de liste |
| Priorisation | Seuil bas compatible avec la capacité de revue | Confondre « à lire plus tard » et « refusé » |
| Triage à trois voies | Borne haute, zone grise, contrôle sous borne basse | Revue humaine symbolique ou influencée par le score |
| Rejet automatique | À éviter ; revoir le processus et le droit applicable | Exclusion injustifiée et décision automatisée significative |
Deux bornes valent mieux qu'une coupure fragile
Définissez thaut pour les candidatures à lire en priorité et tbas pour ouvrir une zone grise. Entre les deux, une personne relit le CV à partir de la fiche de poste et des preuves extraites, idéalement avant d'afficher la note globale. Sous tbas, ne transformez pas automatiquement la faible priorité en refus : contrôlez un échantillon aléatoire, routez les échecs de parsing et cas hors distribution vers un humain, et rendez l'intégralité des candidatures recherchable. Ces contrôles permettent d'estimer les faux négatifs que la production créerait réellement.
La largeur de la zone grise dépend de l'incertitude et de la capacité de revue, pas d'un pourcentage prédéfini. Elle s'élargit quand les évaluateurs humains s'accordent peu, que le CV est incomplet, que le poste est nouveau ou que le profil s'éloigne des données de validation. Elle ne doit pas devenir une file d'attente fictive : assignez un responsable, un délai et un motif de décision. Pour organiser cette intervention, consultez notre guide de supervision humaine du recrutement par IA.
Tester le seuil par sous-groupe et garantir une revue humaine effective
Un rappel global acceptable peut dissimuler un taux de faux négatifs élevé pour une famille de postes, une langue, un format de CV, une situation de handicap ou un groupe protégé. Calculez la matrice de confusion par segment pertinent, avec les effectifs et l'incertitude. Le critère d'« égalité des chances » proposé par Hardt, Price et Srebro s'intéresse notamment à l'égalité du taux de vrais positifs, donc du rappel, entre groupes. C'est un outil d'analyse utile, pas une preuve automatique d'absence de discrimination ni une norme juridique universelle.
Ne collectez pas des données sensibles « au cas où ». La mesure de l'équité doit être cadrée avec le DPO et les conseils compétents : finalité, base juridique, minimisation, accès, conservation et garanties. N'appliquez pas non plus des seuils différents selon un groupe protégé sans analyse juridique approfondie. Le premier levier est de corriger les critères, données, représentations ou consignes et d'élargir la revue afin que la même règle opérationnelle respecte les tolérances fixées. Notre article sur l'audit des biais d'un outil de matching complète ce diagnostic.
Ce que demandent les textes, sans inventer un taux légal
L'annexe III du règlement européen sur l'intelligence artificielle vise les systèmes destinés à analyser et filtrer les candidatures ou évaluer les candidats parmi les cas d'emploi à haut risque, sous réserve de la qualification précise du système et de son usage. Pour les systèmes qui relèvent de ce régime, l'article 9 prévoit des tests selon des métriques et seuils probabilistes définis à l'avance et adaptés à la finalité ; l'article 15 exige un niveau approprié d'exactitude et la déclaration des métriques pertinentes. Le texte ne donne aucun « bon score » de matching applicable à tous.
L'article 14 exige une supervision qui permette notamment de comprendre les capacités et limites, de rester conscient du biais d'automatisation, d'interpréter correctement la sortie, de l'ignorer ou de la renverser. De son côté, l'article 22 du RGPD encadre les décisions fondées exclusivement sur un traitement automatisé lorsqu'elles produisent des effets juridiques ou affectent significativement une personne. Une personne qui confirme machinalement tout résultat n'est donc pas un garde-fou crédible. Le recruteur doit disposer du temps, des informations, de l'autorité et d'une interface permettant de contredire le score, avec journalisation des renversements.
Protocole de réglage, validation et surveillance de la dérive
Le seuil fait partie d'un système versionné : modèle, parseur, taxonomie, fiche de poste, consignes, interface et workflow humain. Pour éviter d'optimiser sur les réponses connues, séparez au minimum les données de réglage ou de calibration du jeu de test final. Si le volume est faible, utilisez une méthode de rééchantillonnage adaptée avec un statisticien, mais conservez une évaluation réellement indépendante avant la décision de production.
- Cadrer l'usage. Écrivez la décision affectée, la population, les postes, le volume, la capacité de revue, les responsables et les erreurs inacceptables.
- Geler la référence. Construisez une vérité terrain par double lecture aveugle, arbitrez les désaccords et isolez les cas incertains ou inévaluables.
- Séparer les jeux. Entraînez ou paramétrez sur un premier ensemble, calibrez les probabilités et choisissez les bornes sur un deuxième, puis ne mesurez qu'une fois la décision finale sur le test indépendant.
- Balayer les seuils. Pour chaque valeur candidate, calculez TP, FP, FN, TN, rappel, précision, charge de revue, résultats par segment et intervalles de confiance. Tracez la courbe précision-rappel.
- Choisir sous contraintes. Écartez les valeurs qui violent le rappel minimal, les tolérances d'équité, la capacité ou les règles juridiques. Parmi les autres, retenez la configuration au coût documenté le plus acceptable et définissez la zone grise.
- Piloter en mode ombre. Pendant une période suffisante au regard du volume, le score ne change pas la décision. Comparez ses sorties à la revue normale, analysez tous les faux négatifs disponibles et testez les renversements humains.
- Signer et versionner. Le rapport associe le seuil à une version, une population et une date ; il indique ses limites, la personne autorisée à le modifier, les critères d'arrêt et le plan de retour arrière.
Surveiller ce qui rend le seuil obsolète
Suivez la distribution des scores, la proportion envoyée dans chaque voie, les erreurs de parsing, le volume par poste, les décisions humaines et leurs motifs de renversement. Lorsque la vérité terrain arrive avec retard, rééchantillonnez régulièrement des dossiers sous le seuil pour estimer le rappel. Comparez ces métriques au référentiel de validation par métier, langue et sous-groupe pertinent. Une moyenne générale stable peut masquer une dérive locale.
Une nouvelle version du modèle, du parseur ou de la taxonomie ; une fiche de poste substantiellement modifiée ; une population différente ; une hausse des faux négatifs, des plaintes ou des renversements : chacun de ces événements déclenche une réévaluation. Fixez vos seuils d'alerte à partir du risque et de l'incertitude de vos propres données. Ne copiez pas une fréquence mensuelle ou un pourcentage trouvé dans un benchmark sans rapport avec votre usage.
Calibrer le matching sur vos postes, pas sur une promesse éditeur
Profilya peut cadrer votre corpus, mesurer les faux négatifs, concevoir la zone de revue et intégrer un workflow traçable à votre ATS. Découvrez notre solution de tri de CV par IA et demandez une démonstration sur un périmètre représentatif de vos recrutements.
Questions fréquentes
Quel est le bon seuil de matching candidat-poste ?
Il n'existe pas de seuil universel, qu'il soit exprimé sur 10, sur 100 ou en pourcentage. Le bon seuil dépend de la signification du score, de l'usage du système, de la fréquence des candidatures pertinentes, de la capacité de revue et du coût des faux négatifs. Il doit être choisi sur un jeu de calibration, validé sur un jeu de test indépendant et réévalué en production.
Un score de matching de 80 % signifie-t-il 80 % de chances de réussir ?
Non, sauf si le fournisseur définit explicitement cette sortie comme une probabilité et démontre sa calibration pour la population et la cible concernées. Un score de similarité ou une note pondérée sert souvent uniquement à ordonner les profils. Même un score affiché avec le symbole % ne devient pas, par cette présentation, une probabilité de réussite, d'embauche ou d'adéquation.
Quelle métrique protège le mieux contre l'exclusion de bons profils ?
Le rappel mesure la part des candidatures pertinentes qui passent le seuil ; son complément, le taux de faux négatifs, mesure celles qui sont manquées. Ce sont les premières métriques à suivre lorsqu'un score réduit la visibilité d'un profil. Il faut néanmoins les compléter par la précision, la charge de revue, les résultats par poste et sous-groupe, ainsi que l'incertitude statistique.
Faut-il utiliser un seul seuil pour tous les postes ?
Non. Un même score peut avoir une distribution et une signification différentes selon le métier, la séniorité, la langue, la rareté des compétences et la version du modèle. Le seuil doit être validé par usage et par famille de postes suffisamment homogène. Si les preuves sont insuffisantes pour un segment, il faut élargir la revue humaine plutôt que copier le seuil d'un autre segment.
Comment traiter les candidats proches du seuil ?
Créez une zone grise entre deux bornes au lieu d'une frontière unique. Les profils de cette zone sont relus sans que le recruteur voie d'abord le score, avec accès aux preuves extraites du CV et à la fiche de poste. Les documents incomplets, les erreurs de parsing et les cas hors distribution doivent également être routés vers cette revue.
Peut-on rejeter automatiquement les CV sous le seuil ?
Cette pratique est risquée et n'est pas recommandée. Une décision fondée uniquement sur un traitement automatisé peut relever de l'article 22 du RGPD lorsqu'elle produit un effet juridique ou affecte significativement la personne. Dans tous les cas, le recrutement exige une supervision humaine effective : pouvoir comprendre, contester et renverser la sortie, et pas simplement valider en masse les recommandations.
À quelle fréquence faut-il recalibrer le seuil ?
Aucune fréquence calendaire ne convient à tous les systèmes. Déclenchez au minimum une nouvelle validation après un changement de modèle, de parseur, de taxonomie, de fiche de poste ou de population, et lorsque les distributions de scores, le rappel, les erreurs par sous-groupe ou les taux de renversement humain sortent des tolérances fixées. Conservez aussi un contrôle périodique adapté au volume réel.
Pour aller plus loin
Solution de tri de CV par IA
Profilya vous accompagne pour cadrer le besoin, sécuriser les données et déployer une solution adaptée à vos outils et à vos équipes.