Grandes étapes de la réalisation

1. Diagnostic du biais

Nous avons d'abord mesuré le biais du modèle en production (88 % d'exactitude, mais 48 % d'octroi dans les grands centres contre 27 % en région). À cote R égale, environ 66 % de l'écart subsiste : le comité historique exigeait environ 1,6 point de cote R de plus aux candidats des régions éloignées, et favorisait aussi les familles à revenu élevé.

2. Identification des proxys

Supprimer la colonne region_administrative ne change presque rien. Un classifieur entraîné à deviner la région nous a permis de classer les variables qui la trahissent : code postal (AUC 1,00), distance (0,997), heures travaillées (0,80), revenu (0,67).

3. Choix de la métrique d'équité

Nous avons retenu l'égalité des chances, avec un mérite qui intègre le besoin financier, plutôt que la parité démographique. Ce choix cible les personnes plutôt que les régions.

4. Comparaison des méthodes de correction

Les étiquettes historiques étant biaisées, nous avons évalué cinq approches contre quatre étalons plausibles : post-traitement de Hardt et al. (ThresholdOptimizer), ExponentiatedGradient, repondération de Jiang et Nachum, correction contrefactuelle et score de mérite explicite. Les outils qui s'alignent sur les étiquettes biaisées corrigent peu.

5. Front de Pareto et règle finale

En balayant le paramètre d'équité de chaque méthode, nous avons retenu une règle simple et transparente : cote R + 0,3 × indice de besoin, sans aucune variable régionale. L'écart d'égalité des chances au pire cas passe de 0,314 à 0,075 (−76 %), avec 40 % d'octroi dans chaque groupe.

6. Plan de surveillance

Six indicateurs sont calculés à chaque lot, avant publication, avec des seuils d'alerte et une procédure d'escalade. Une démonstration sur quatre scénarios montre notamment que des dérogations manuelles, invisibles aux indicateurs classiques, sont détectées par un indicateur de fidélité à la règle.

Built With

Share this project:

Updates

Submission history