Les agents pilotés par grands modèles de langage savent aujourd’hui enchaîner raisonnement, appels à des outils et exécution de code pour résoudre des tâches complexes. Mais, dans de nombreux cas, les procédures efficaces découvertes pendant l’exécution restent éphémères : elles servent une fois, puis disparaissent. L’article **FlowEvo**, publié sur arXiv, propose de remédier à cette limite sans modifier les paramètres du modèle.

Le principe est de compiler les traces d’exécution réussies en **« skill records »**, c’est-à-dire des compétences réutilisables associant un artefact exécutable et des indications structurées. Ces compétences sont stockées dans une banque accessible à l’inférence. Le cadre repose sur trois mécanismes liés : la conversion de workflows en compétences, la réutilisation de ces compétences pour guider de futurs workflows, et une phase de curation destinée à écarter celles qui dégradent les performances.

Cette boucle de rétroaction workflow-compétence-workflow vise à faire évoluer les agents au fil des tâches, sans phase d’entraînement supplémentaire. Les auteurs indiquent que FlowEvo peut mobiliser les compétences accumulées soit par exécution directe, soit par injection de contexte structuré. Des contrôles d’interface, de relecture et de sécurité sont également mentionnés lors de l’admission des nouvelles compétences, lorsque cela est possible.

Côté résultats, les expériences rapportées couvrent des environnements interactifs comme **ALFWorld** ainsi que des tâches de génération de code et de mathématiques, notamment **HumanEval** et **GSM8K**. Dans les conditions d’implémentation retenues par les auteurs, FlowEvo afficherait le meilleur compromis précision-coût parmi les approches comparées. Sur ALFWorld, le papier annonce un taux de succès de **82,8 %**, soit **23,6 points** au-dessus du meilleur baseline, avec une consommation moyenne de tokens inférieure à la moitié de celle du baseline le plus efficient. Le code est annoncé comme public sur GitHub, ce qui devrait faciliter la reproduction et l’évaluation indépendante de l’approche.