Les auteurs s’intéressent à un problème central de l’évaluation automatisée du code : un modèle peut rendre un verdict assuré, accompagné d’une justification, même lorsqu’il ne dispose pas d’éléments probants suffisants. Leur point de départ est que les approches de vérification multi-agents, efficaces dans certains contextes, supposent que les preuves mobilisées soient indépendantes de la réponse examinée et qu’elles diffèrent selon les solutions comparées.

Selon l’article, cette seconde condition est généralement satisfaite lorsque l’évaluation repose sur des documents récupérés, mais elle ne l’est plus automatiquement dans le jugement de code. Les chercheurs testent ainsi MARCH, un cadre déjà publié, sans modification, sur deux benchmarks de comparaison de solutions. Résultat : le système conclut que les deux réponses sont équivalentes dans 78 % à 95 % des cas, et tombe à 4,4 % de précision dans une configuration où le même modèle interrogé directement atteint 43,7 %.

L’étude indique aussi que ni des problèmes plus simples ni un juge plus grand ne corrigent ce comportement. Pour l’expliquer, les auteurs introduisent deux mesures dérivées directement des journaux du pipeline, sans nécessiter d’annotations humaines. Ces signaux visent à estimer si le juge dispose réellement d’une base pour trancher.

En utilisant l’une de ces mesures comme mécanisme de filtrage, le système peut refuser les comparaisons qu’il ne sait pas évaluer. Dans ce cadre, sa précision passerait de 20,7 % à 36,9 %, tout en répondant encore à environ la moitié des comparaisons. La contribution mise en avant n’est donc pas un juge plus performant en valeur absolue, mais une méthode pragmatique pour identifier, sans labels, les situations où un juge IA devrait s’abstenir.