Les agents fondés sur des grands modèles de langage (LLM) s’appuient de plus en plus sur des séquences d’appels à des outils externes pour accomplir des tâches complexes. Dans ce cadre, chaque action peut modifier l’état de la tâche et influencer toutes les décisions suivantes. Le problème, soulignent les auteurs, est que les récompenses finales donnent souvent un signal trop faible pour comprendre quelles étapes intermédiaires ont réellement contribué au succès.
L’article, publié sur arXiv, défend une idée simple : avant d’exécuter un outil, l’agent devrait estimer la valeur à long terme de cette action potentielle. Cette approche suppose de comparer plusieurs invocations possibles dans un même contexte, alors que les traces d’usage disponibles ne montrent généralement que l’action effectivement choisie. Pour répondre à cette limite, les chercheurs proposent Comparative Inference for Tool-use Agents (CITA).
CITA repose sur un Comparative Inference Model (CIM), entraîné à partir de signaux appariés combinant plusieurs sources : le comportement observé des outils, une supervision présentée comme scalable via un simulateur bayésien de graphe d’outils, ainsi que des jugements sémantiques produits par un LLM chargé de comparer différentes options. L’objectif est d’estimer, pour une action candidate, sa probabilité de favoriser la réussite finale de la tâche dans le contexte courant.
D’après le résumé, la méthode améliore de manière cohérente le Tool F1 et le taux de succès sur trois benchmarks de tool-use, avec plusieurs modèles de base. Les auteurs indiquent aussi que le CIM apprend des estimations de valeur plus précises au niveau des étapes intermédiaires. Comme souvent avec une prépublication arXiv, ces résultats devront toutefois être appréciés à la lumière du papier complet et d’éventuelles validations indépendantes.