L’évaluation des agents fondés sur des modèles de langage repose encore largement sur des métriques de résultat, comme le taux de succès. Dans un article publié sur arXiv, des chercheurs défendent l’idée qu’un autre signal mérite d’être suivi : la cohérence comportementale entre différentes tâches. Leur objectif est de mieux comprendre non seulement si un agent réussit, mais aussi s’il adopte des stratégies stables et reproductibles.
Pour cela, l’étude introduit le Behavioral Consistency Metric (BCM). La méthode consiste à entraîner un modèle capable de prédire la réussite d’une tâche à partir de caractéristiques extraites des traces d’exécution d’un agent. À partir de ces éléments, les auteurs dérivent un vecteur d’attribution par trajectoire, puis mesurent la similarité moyenne entre ces vecteurs au sein d’un même système. En pratique, le BCM vise donc à quantifier la proximité des comportements observés, au-delà du simple verdict succès ou échec.
Les résultats s’appuient sur environ 9 000 trajectoires couvrant six agents de modèles de langage appliqués à des tâches d’ingénierie logicielle. Conclusion centrale : la cohérence au sein d’une même tâche et la cohérence entre tâches différentes constituent deux dimensions distinctes. Un agent peut se montrer reproductible lorsqu’il répète une tâche donnée, tout en restant fragmenté à l’échelle globale, sans stratégie stable d’un problème à l’autre. À l’inverse, certains systèmes apparaissent cohérents sur les deux plans.
L’article souligne aussi que cette cohérence ne se réduit pas au taux de réussite : des agents aux performances comparables peuvent présenter des niveaux de consistance très différents. Les auteurs indiquent enfin qu’un écart de cohérence entre modèles de pointe et modèles open source subsiste, y compris avec un contrôle intra-tâche destiné à limiter l’effet de la difficulté. Le BCM est ainsi présenté comme un signal complémentaire pour évaluer la fiabilité procédurale des agents, sous certaines conditions d’usage précisées par l’étude.