Une nouvelle publication déposée sur arXiv introduit DeReAct (*Decomposed Reasoning and Acting for Reliable AI Agents*), une architecture conçue pour rendre les agents IA plus fiables. Le travail part d’un constat simple : dans les agents de type ReAct, un seul grand modèle de langage pilote à la fois le raisonnement, les actions, l’interaction avec l’environnement et la décision de fin de tâche. Cette centralisation peut compliquer le contrôle des erreurs et favoriser des conclusions prématurées.

DeReAct propose de séparer ces fonctions en ajoutant deux mécanismes externes. Un Critic valide les actions proposées avant leur exécution, tandis qu’un Context Manager reconstruit un état du monde appuyé sur l’environnement et certifie si la tâche est réellement terminée. L’objectif est de mieux encadrer l’autorisation d’action et le contrôle de complétion, deux points que les auteurs jugent difficiles à imposer de manière indépendante dans les architectures classiques.

D’après le résumé de l’article, les gains sont les plus visibles sur des modèles dits plus faibles. Sur GAIA et SWE-bench Verified, DeReAct améliore le Pass@1 de 6,5 à 7,0 points pour Qwen3-Coder-480B et de 4,2 à 5,2 points pour Claude Sonnet 4.5. En revanche, ces gains diminuent à mesure que la capacité du modèle principal augmente. Avec Claude Opus 4.5, les performances resteraient comparables à celles de ReAct, mais avec des trajectoires jugées plus complètes en preuves et plus conformes aux contraintes.

Les auteurs soulignent ainsi qu’un contrôle externe peut être particulièrement utile lorsque certains types d’échecs sont fréquents et que la politique de filtrage est elle-même suffisamment fiable. En pratique, DeReAct semble surtout prometteur pour renforcer les agents moins performants, tout en conservant des bénéfices de robustesse et de traçabilité lorsque les modèles deviennent plus puissants. Comme il s’agit d’une publication arXiv récente, ces résultats restent à confirmer par des validations plus larges.