Les modèles de récompense jouent un rôle clé dans l’apprentissage à partir des préférences humaines, mais leur fonctionnement interne reste difficile à expliquer. Dans ce contexte, l’article “Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast” s’attaque à un angle précis : l’interprétation des modèles de récompense Mixture-of-Experts (MoE).
Les auteurs partent d’un constat simple : les poids de routage, souvent utilisés pour interpréter ces architectures, indiquent surtout quels prompts sont envoyés à tel ou tel expert. En revanche, ils n’expliquent pas réellement comment chaque expert évalue les réponses. Autrement dit, ils renseignent sur la réception des entrées, mais seulement partiellement sur le jugement produit.
Pour combler cette limite, les chercheurs proposent CoCo (*Contribution Contrast*), une méthode d’interprétation au niveau des réponses. L’idée est de caractériser le rôle d’un expert à partir de paires de réponses *choisie / rejetée* présentant les plus forts écarts de contribution. Cette approche cherche ainsi à capturer à la fois la logique de routage et le comportement de préférence, afin de fournir une lecture plus fidèle de ce que fait réellement chaque expert.
D’après le résumé de l’article, CoCo obtient de meilleurs résultats que plusieurs alternatives — approches basées sur le routeur, sur les scores ou sur des autoencodeurs clairsemés — en matière de cohérence, de fidélité et de spécialisation des interprétations, dans des évaluations automatiques comme humaines. Les auteurs indiquent également que la précision du modèle de récompense reste compétitive. Ils présentent enfin leur travail comme, à leur connaissance, la première étude systématique consacrée aux méthodes d’interprétation pour les modèles de récompense MoE.