L’évaluation des agents IA devient de plus en plus complexe à mesure que se multiplient les benchmarks, souvent liés à des environnements spécifiques et à des intégrations techniques hétérogènes. Dans un article publié sur arXiv, les auteurs proposent Harbor Adapters, une couche d’infrastructure conçue pour unifier cette évaluation et faciliter la comparaison entre agents sur des bases plus cohérentes.

Le premier apport mis en avant est l’adaptation de plus de 80 benchmarks afin de permettre l’évaluation d’agents arbitraires via une interface commune. Les chercheurs indiquent avoir validé ces adaptations par revue de code et par des expériences de parité, afin de vérifier que les résultats restent comparables aux configurations d’origine. L’objectif est de réduire le coût d’intégration, aujourd’hui l’un des principaux freins aux évaluations agentiques à grande échelle.

Deuxième contribution : une campagne d’évaluation large portant sur 8 modèles de niveaux de capacité différents, testés sur 54 benchmarks. Chaque modèle a été exécuté avec Terminus-2 ainsi qu’avec l’un de trois harnais natifs, selon le résumé. Cette base expérimentale permettrait d’observer plus finement les capacités réelles des agents, mais aussi leurs modes d’échec, dans un cadre plus homogène que les comparaisons fragmentées habituelles.

Enfin, les auteurs introduisent Harbor-Index, un ensemble curé de 82 tâches issues de 29 benchmarks, sélectionnées pour leur difficulté, leur diversité et leur qualité. Ce sous-ensemble a été affiné par filtrage de difficulté, audit humain et audit assisté par IA, puis par une boucle de correction. Les résultats rapportés suggèrent un niveau de difficulté élevé : aucune configuration modèle-harnais évaluée ne dépasse 30 % de réussite, et la meilleure, GPT-5.5 avec Codex, atteint 28,0 %.

Les auteurs annoncent publier en open source les adaptateurs, les résultats d’évaluation, leurs analyses et Harbor-Index. Si ces promesses se confirment à l’usage, Harbor pourrait devenir une brique importante pour rendre l’évaluation des agents IA plus reproductible, plus comparable et plus utile aux équipes de recherche comme aux industriels.