Retour au blogue
IA pour les entreprises October 5, 2026 9 min de lecture

Tester un système d'IA pour les biais : à quoi ressemblent des « mesures raisonnables » en pratique

Le droit canadien des droits de la personne ne s'intéresse pas à votre intention de discriminer. Il s'intéresse à l'effet. C'est ce qui fait d'une IA non testée dans l'embauche ou le service une véritable exposition.

Par Aparna Netheti

Tester un système d'IA pour les biais : à quoi ressemblent des « mesures raisonnables » en pratique

Tester un système d'IA pour les biais consiste à vérifier si ses résultats diffèrent entre les groupes d'une manière que vous ne pouvez pas justifier, puis à consigner ce que vous avez trouvé. C'est tout l'exercice. Il n'exige pas d'équipe de science des données, et l'omettre est plus risqué que ne le croient la plupart des entreprises canadiennes.

Voici pourquoi. Les lois sur les droits de la personne, dans les différentes juridictions canadiennes, visent l'effet discriminatoire et pas seulement l'intention. Un outil d'embauche qui classe systématiquement un groupe plus bas pose problème même si personne n'a voulu ce résultat et que personne ne peut l'expliquer. « C'est le modèle du fournisseur » n'est pas une défense que l'on souhaite éprouver.

Que peut-on tester sans équipe de recherche ?

Trois choses, par effort croissant. La plupart des entreprises peuvent faire les deux premières en une semaine.

Les taux de résultat par groupe. Prenez les décisions produites par le système sur une période. Comparez le taux de résultat favorable entre les groupes que vous pouvez licitement observer ou raisonnablement inférer. Si les candidats d'un groupe progressent à la moitié du taux d'un autre, vous avez quelque chose à expliquer, et mieux vaut vous l'expliquer à vous-même qu'à un tribunal.

La revue des intrants. Listez chaque caractéristique que voit le système. Cherchez les indicateurs indirects : code postal, prénom, année de diplomation, interruptions d'emploi, photographie, langue de la candidature. Chacun est corrélé à une caractéristique protégée. Retirer un champ protégé tout en conservant cinq indicateurs indirects ne règle rien.

Les tests appariés. Construisez des paires identiques sauf sur un attribut, faites-les passer dans le système et comparez. C'est la technique qu'utilisent depuis des décennies les chercheurs en équité du logement, elle n'exige aucun accès au modèle et fonctionne sur la boîte noire d'un fournisseur. C'est aussi l'artefact le plus convaincant que vous puissiez remettre à un auditeur.

TestEffortCe qu'il révèle
Taux de résultat par groupeFaibleUn écart systématique dans les décisions réelles
Revue des intrants et indicateurs indirectsFaibleDes caractéristiques encodant un motif protégé
Tests appariésMoyenUn traitement différencié sur un seul attribut modifié
Exactitude par sous-groupeMoyenUn modèle bon globalement et mauvais pour une minorité
Surveillance continueMoyenLa dérive après déploiement, où apparaissent la plupart des problèmes

Le problème de mesure dont personne ne vous parle

Souvent, vous ne pouvez pas mesurer l'écart, faute de recueillir les données démographiques qui le permettraient.

C'est une tension réelle au Canada. Les principes de protection de la vie privée poussent à collecter moins. Les tests d'équité exigent précisément les attributs que vous avez évité de recueillir. Les deux réflexes sont justes, et la solution n'est pas d'introduire des caractéristiques protégées dans vos systèmes opérationnels.

Ce qui fonctionne : les recueillir séparément, de façon volontaire, avec une finalité clairement limitée, conservées à l'écart du système décisionnel et utilisées uniquement pour une analyse agrégée. Ou recourir aux tests appariés, qui contournent entièrement le problème puisque vous construisez vous-même les intrants. Ou travailler avec le fournisseur et lui demander par écrit quels tests il a menés et sur quelle population.

Ce qui ne fonctionne pas : conclure que faute de pouvoir mesurer, vous n'avez aucune obligation de regarder. Ce raisonnement ne survit pas au contact d'une plainte.

Que veut dire « raisonnable » ici ?

Proportionné aux enjeux et à la portée de la décision, documenté, et répété.

Pour un outil qui rédige du contenu marketing, raisonnable équivaut presque à rien. Pour un outil qui trie des candidatures en volume, raisonnable signifie tester avant le déploiement, surveiller ensuite, disposer d'un humain pouvant renverser la décision, et retester lorsque le modèle ou le bassin de candidats change. L'écart entre les deux est énorme, d'où l'importance de commencer par l'évaluation de l'incidence algorithmique : elle vous dit de quel côté de l'échelle vous êtes.

Trois marqueurs pratiques d'un programme réel plutôt que décoratif :

  • Le test a été défini avant de voir les résultats, de sorte que le seuil n'a pas été choisi pour réussir.
  • Quelqu'un avait le pouvoir d'arrêter le déploiement selon le résultat, et cette personne n'était pas le responsable du système.
  • Le constat a été consigné, y compris lorsqu'il s'agissait d'« aucun écart important constaté », avec la date et la méthode.

Ce troisième point compte plus qu'il n'y paraît. Un résultat négatif que vous pouvez produire un an plus tard vaut bien plus qu'un souvenir assuré.

Que faire lorsqu'on trouve quelque chose ?

Pas nécessairement éteindre le système. Quatre réponses légitimes, et l'important est d'en choisir une délibérément.

Corriger les intrants, si un indicateur indirect cause le dommage. Ajuster le seuil ou le processus, par exemple en envoyant les cas limites à une révision humaine plutôt qu'à un rejet automatique. Restreindre l'usage, pour que l'outil classe sans filtrer. Ou le retirer, si l'écart est important et inexplicable.

Quel que soit le choix, consignez le raisonnement, l'approbateur et la date dans votre journal des incidents ou votre dossier d'évaluation. Une organisation qui a constaté un écart, l'a examiné et a agi se trouve en position défendable. Une organisation qui n'a jamais regardé, non, et toute la différence entre les deux est documentaire.

Et les outils achetés ?

Posez quatre questions au fournisseur et consignez les réponses mot pour mot : quels tests d'équité ont été menés, sur quelle population, quels écarts ont été trouvés, et ce que vous êtes censé tester sur vos propres données. Un fournisseur qui n'en a fait aucun n'est pas disqualifié, mais l'obligation de test bascule vers vous, et il faut en tenir compte avant de signer. Gardez les réponses avec l'entrée de votre inventaire des fournisseurs.

Ceci est de l'information générale et non un avis juridique.

Valdra rattache les tests de biais au système concerné, avec la méthode, la date et la décision qui a suivi, pour que le dossier existe quand quelqu'un pose la question un an plus tard. La vue gouvernance de l'IA l'héberge.

Questions fréquentes

Les entreprises canadiennes doivent-elles tester leurs systèmes d'IA pour les biais ?+

Aucune loi n'énonce le test de biais comme obligation distincte, mais les lois sur les droits de la personne visent l'effet discriminatoire plutôt que l'intention. Un système non testé produisant des résultats inégaux en embauche ou en service constitue une exposition réelle, quelles qu'aient été les intentions.

Peut-on tester les biais sans équipe de science des données ?+

Oui. Comparer les taux de résultat favorable entre groupes, examiner les intrants à la recherche d'indicateurs indirects comme le code postal ou l'année de diplomation, et mener des tests appariés ne différant que sur un attribut exigent des compétences analytiques ordinaires et aucun accès au modèle.

Que faire si nous ne recueillons pas de données démographiques ?+

Recueillez-les séparément et volontairement avec une finalité limitée, à l'écart du système décisionnel et en usage agrégé seulement, ou recourez aux tests appariés, qui contournent le problème puisque vous construisez les intrants. Conclure qu'aucune obligation n'existe faute de pouvoir mesurer ne tient pas.

Retirer les champs protégés règle-t-il le problème ?+

Non. Les indicateurs indirects portent la même information. Code postal, prénom, année de diplomation, interruptions d'emploi et langue de la candidature sont tous corrélés à des motifs protégés : retirer un champ en conservant plusieurs de ses substituts ne change presque rien.

Que faire si un test révèle un écart ?+

Choisissez délibérément entre corriger les intrants, ajuster les seuils ou acheminer les cas limites vers une révision humaine, restreindre l'outil au classement plutôt qu'au filtrage, ou le retirer. Puis consignez le raisonnement, l'approbateur et la date, car c'est le fait d'agir sur un constat qui rend la position défendable.

AI bias testingalgorithmic fairness Canadadiscrimination AI hiringAI audit biashuman rights AI Canadadisparate impact testing

La conformité IA et vie privée, simplifiée.

Valdra aide les entreprises canadiennes à gouverner l’IA et à respecter PIPEDA et la Loi 25 — hébergé au Canada.

Essayer Valdra

Notre propre conformité

Nous gérons notre propre programme de conformité dans Valdra — le produit que nous vendons. Nos programmes SOC 2, ISO 27001 et ISO 42001 sont en cours; nous ne revendiquons aucune certification que nous ne détenons pas encore.

Badge de conformité Valdra — cliquez pour vérifier
  • LPRPDE
  • Loi 25 (Québec)
  • LCAP
  • Données hébergées au Canada 🇨🇦
  • Gouvernance de l’IA
Voir notre centre de confiance

Auto-déclaré, et non audité par un tiers. Cliquez sur le badge pour vérifier son authenticité et voir ce qu’il couvre.