Les modèles de langage Mixture-of-Experts (MoE) reposent sur un routeur chargé de sélectionner les experts les plus pertinents pour chaque token. Dans ce travail publié sur arXiv, les auteurs proposent Attention-Aware Routing (AAR), une variante qui ne se limite plus à l’état caché du token : elle ajoute des caractéristiques temporelles et spectrales extraites d’une fenêtre glissante de poids d’attention, afin de mieux résumer le contexte du modèle.

L’approche a une particularité méthodologique importante : le transformer de base reste entièrement gelé. Seuls les paramètres de routage sont entraînés, ce qui permet d’isoler l’effet du routage comme variable principale. Selon les auteurs, cette configuration améliore le benchmark GSM8K de 3,37 points de pourcentage par rapport à une baseline de fine-tuning supervisé limitée au routage sur OLMoE.

Au-delà du gain mesuré, l’article avance que routage et attention forment un circuit couplé. En pratique, une modification du routage à une couche donnée influencerait le flux résiduel, puis amplifierait certains comportements d’attention à la couche suivante, sans mise à jour directe du mécanisme d’attention lui-même. Les auteurs indiquent aussi qu’AAR réduit les générations longues et divergentes : les réponses incorrectes deviennent plus courtes, tandis que la longueur des réponses correctes resterait globalement stable.

Le papier souligne enfin une forte sensibilité à la profondeur. Appliquée uniformément à toutes les couches, la méthode pourrait dégrader la récupération factuelle, alors que les gains en raisonnement mathématique persisteraient lorsqu’elle est introduite plus profondément dans le réseau. Cette observation met en avant une tension possible entre récupération d’information et raisonnement, et positionne AAR comme un outil d’analyse intéressant pour mieux comprendre quelles informations d’attention sont réellement utiles au routage dans les MoE.