Pourquoi ÉquiAlgo

Une décision historique peut être bien prédite et rester injuste. C'est le point de départ d'ÉquiAlgo : comprendre ce qu'un modèle de bourses apprend du passé, rendre ses choix visibles et mesurer les compromis avant de proposer une nouvelle règle.

Pour le défi IVADO du CodeML 2026, The Optimizers a travaillé sur 10 000 demandes historiques synthétiques et produit des décisions pour 4 000 candidatures d'évaluation. Nous livrons un notebook, un modèle explicable, un CSV contrôlé et un plan de gouvernance.

Notre résultat principal, à budget identique

En validation croisée, avec 800 bourses pour 2 000 personnes dans chacun des cinq plis externes, notre politique neutralisée réduit l'écart absolu moyen des taux d'octroi entre grands centres et régions éloignées :

22,38 → 1,53 point de pourcentage, soit une réduction de 93,15 %.

Le compromis est visible : le F1 macro contre les décisions historiques passe de 88,29 % à 84,31 %, et l'exactitude de 88,76 % à 84,94 %.

Ces chiffres montrent une distribution plus proche entre les deux groupes et une moindre reproduction des décisions du comité. Ils ne démontrent pas une amélioration de 93 % du modèle, du mérite réel ou de l'égalité des chances. Le comparateur est notre modèle reproduisant le comité, classé au même quota de 40 %, et non la baseline officielle sur un autre découpage.

Voir les calculs, les comptes par pli et les limites.

Ce que l'audit nous a appris

Enlever « région » des entrées ne suffit pas. Sur le holdout de la baseline officielle, retirer la région puis le code postal laisse encore 17,31 points d'écart de sélection.

Nous avons donc testé ce que les autres variables révèlent du groupe régional. Hors pli, le code postal atteint une AUC de 1,000, et la distance domicile–campus 0,998. Le revenu et les heures de travail portent aussi de l'information géographique. Ces associations signalent des variables indirectes ; elles ne prouvent pas une causalité.

Ce diagnostic nous a conduits à séparer deux questions : comment le comité décidait-il ? et quelle règle d'allocation sommes-nous prêts à défendre ?

Comment nous l'avons construit

Notre pipeline Python utilise pandas, NumPy et scikit-learn. Une validation imbriquée à 5 plis externes × 3 plis internes compare neuf configurations de régression logistique. Les transformations sont ajustées sur les seules données d'entraînement de chaque pli. La sélection interne minimise la log-loss historique, avec une règle de simplicité à une erreur standard près.

Le modèle compact prend en compte la cote R, les heures travaillées, le log-revenu familial et le groupe régional. Pour le classement final, nous retirons les contributions directes du revenu et de la région. La règle devient :

score = cote R + 0,14342577944475554 × heures travaillées par semaine

Nous retenons ensuite les 40 % de scores les plus élevés, avec un départage stable des égalités par hash de l'identifiant.

Le coefficient est appris sur l'historique ; choisir de compenser les heures travaillées est un choix normatif. Le budget de 1 600 bourses sur 4 000 est également un choix explicite, dans la plage autorisée de 36 à 44 %. Ni 1 600 ni 1 650 ne constitue un quota exact imposé. Le score est un outil de classement, pas une probabilité de mérite.

Les choix difficiles — et ce que nous avons écarté

Nous avons comparé une politique neutralisée à des contraintes régionales explicites. Le diagnostic Pareto peut atteindre 0,42 point d'écart moyen avec une contrainte de 0,5 point. Il utilise cependant une autre règle, directement fondée sur les groupes régionaux : ce n'est pas la politique exportée.

Nous avons aussi analysé 200 rééchantillonnages du poids des heures. Dans cette analyse conditionnelle, 62 décisions sur 4 000 varient au moins une fois. Cette stabilité renseigne sur la sensibilité de l'allocation ; elle ne garantit pas que chaque décision soit juste.

Enfin, nous avons cessé de présenter l'optimisation du leaderboard comme une validation méthodologique. Les anciens scores concernent d'autres CSV. Notre protocole reste une validation de développement : les données avaient déjà été explorées et les anciens retours HxBuddy étaient connus.

Ce que contient le livrable final

Le fichier predictions.csv contient 4 000 identifiants uniques, dans l'ordre attendu, sans valeur manquante, avec des décisions binaires et exactement 1 600 bourses.

Sur cette cohorte, les taux d'octroi sont de 949 / 2 372 = 40,0084 % dans les grands centres et 651 / 1 628 = 39,9877 % dans les régions éloignées. L'écart descriptif est donc 0,0207 point. Les taux des cinq régions vont de 38,29 % à 41,55 %.

Il s'agit d'une autre population, sans labels de mérite : son F1, son exactitude et son score technique caché restent inconnus. L'écart descriptif ne doit pas être confondu avec les 1,53 point moyens en validation. De même, concaténer les prédictions hors pli donne 0,75 point, car les signes de certains écarts se compensent.

Nous avons figé le modèle, ses paramètres et l'empreinte du CSV. Un rejeu déterministe permet de retrouver le fichier, et un script indépendant recalcule la comparaison à partir des données autorisées.

Une proposition de gouvernance, pas seulement un classement

Avant tout usage réel, nous proposons :

  • Contrôler chaque lot : données, identifiants, budget, version et reproductibilité.
  • Surveiller les deux groupes et les cinq régions, avec effectifs et incertitude. Un écart de plus de 5 points déclencherait une enquête ; ce seuil proposé doit être approuvé.
  • Créer une référence indépendante du mérite, couvrant les personnes retenues et refusées, pour mesurer réellement l'égalité des chances et l'utilité.
  • Garantir un recours humain indépendant, la correction des données et l'examen des situations absentes du score.
  • Suspendre les nouvelles décisions automatiques en cas d'erreur systémique ou d'impossibilité de reproduction, jusqu'à revue et approbation.

Nous relions ces actions aux axes EDI du défi : affiner la méthodologie, élargir l'accès au processus, renforcer l'inclusion, intégrer les personnes concernées à la recherche en IA et suivre l'impact. Ce sont des actions proposées, pas des effets déjà démontrés.

Nos limites et la suite

Les données sont synthétiques et aucun déploiement réel n'a eu lieu. La cote R et les heures peuvent encore transmettre des inégalités ; compenser le travail peut pénaliser des personnes qui ne peuvent pas travailler. Les liens familiaux et le transfert dans le temps restent à étudier.

La parité des taux d'octroi ne démontre pas l'égalité des chances conditionnée au mérite. Les 35 points techniques IVADO reposent sur une référence cachée — 20 pour l'égalité des chances et 15 pour l'utilité. Nous ne prétendons pas les calculer localement.

La suite exige une définition du mérite approuvée avec les parties concernées, une validation externe et temporelle, puis une expérimentation supervisée. Notre réalisation est une chaîne de preuves lisible : diagnostic → politique explicable → comparaison reproductible → contrôle humain.

Explorer le projet

La couverture est une illustration conceptuelle générée par IA. Les figures de méthode et de résultats sont produites par code ; les valeurs chiffrées proviennent de nos preuves vérifiées.

Built With

Share this project:

Updates

Submission history