Des chercheurs ont dévoilé Iris-mini et Iris-pro, deux agents de recherche conçus pour répondre à des questions nécessitant plusieurs étapes de navigation et de raisonnement sur le web. L’article, publié sur arXiv, décrit à la fois les modèles, leur pipeline de données et la méthode d’entraînement utilisée pour améliorer progressivement leurs performances face à des tâches de recherche complexes.

La construction des données repose sur la structure des hyperliens d’un corpus web. Les auteurs expliquent qu’ils génèrent des chaînes de recherche multi-sauts à partir d’un graphe d’entités dérivé d’une page source et de ses liens sortants. Les indices textuels sont reformulés pour éviter qu’une réponse puisse être trouvée par simple correspondance de chaînes de caractères. Seules les questions qu’un modèle de référence échoue à résoudre sans accès aux sources, mais réussit avec les preuves adéquates, sont conservées.

L’entraînement combine ensuite supervised fine-tuning et reinforcement learning dans une boucle baptisée *SFT-RL climbing*. Le système est optimisé contre une recherche web en direct, avec des mécanismes internes pour résumer les observations et gérer les trajectoires trop longues. Les auteurs insistent aussi sur un point méthodologique souvent sous-estimé : la gestion du contexte à l’inférence, qu’ils évaluent séparément afin de comparer les modèles dans des conditions contrôlées.

Avec cette gestion activée, Iris-mini et Iris-pro atteignent respectivement 82,2/84,8/86,9/52,3 et 88,6/85,1/92,9/56,4 sur BrowseComp, BrowseComp-ZH, DeepSearchQA et HLE. Les auteurs affirment qu’il s’agit des meilleurs résultats globaux parmi les agents de recherche open source dans leurs plages de paramètres respectives. Ils indiquent enfin prévoir la publication des poids des modèles ainsi que de la recette complète de construction des données, d’entraînement et d’évaluation.