Les systèmes multi-agents de raisonnement mathématique s’appuient souvent sur une architecture hiérarchique où un « reviewer » spécialisé examine les réponses produites par d’autres agents. L’idée est simple : mieux repérer les erreurs devrait aider à transformer des solutions incorrectes en bonnes réponses. Dans un article déposé sur arXiv, des chercheurs testent directement cette hypothèse sur 4 181 problèmes Omni-MATH, avec des agents appariés basés sur **gpt-oss-120b**.

Le résultat principal est nuancé. Sur les problèmes les plus faciles, la collaboration apporte peu. En revanche, à partir du niveau 4 de difficulté, l’écart se creuse nettement : un mode de discussion entre pairs de type « broadcast » obtient une meilleure précision finale qu’un pipeline hiérarchique de type planner-executor-reviewer (PER). Autrement dit, une structure plus centralisée de relecture ne domine pas automatiquement lorsque les tâches deviennent plus complexes.

Les auteurs cherchent alors à comprendre l’origine de cet écart. Leur constat est central : la qualité du reviewer, mesurée par sa précision à détecter les erreurs, n’explique pas à elle seule la performance finale. Le reviewer du protocole PER est même plus précis que celui du mode broadcast (0,861 contre 0,644), mais ses critiques modifient moins souvent la réponse suivante et conduisent à moins de corrections effectivement utiles. La détection d’erreur et l’intégration de la critique apparaissent donc comme deux capacités distinctes.

L’étude suggère aussi que certaines interventions de conception peuvent être contre-productives. Forcer une reconnaissance explicite de la critique réduit la précision finale, tandis qu’intégrer plus directement les indications du reviewer dans le contexte de travail du solveur améliore partiellement le suivi, sans combler l’écart. Pour les équipes qui évaluent ces systèmes, le message est clair : mesurer uniquement la capacité à repérer les erreurs peut surestimer la qualité réelle d’un protocole si les agents n’exploitent pas ensuite ces retours pour mieux résoudre les problèmes.