Un article de position récemment mis en ligne sur arXiv appelle à revoir en profondeur la manière dont l’industrie et la recherche évaluent les systèmes d’intelligence artificielle. Selon ses auteurs, le cadre dominant privilégie aujourd’hui la performance autonome, souvent mesurée à l’aune de capacités « surhumaines », ce qui revient implicitement à viser le remplacement des humains plutôt que leur appui.
Le texte soutient que cette logique d’évaluation influence directement la trajectoire du secteur. En valorisant avant tout l’autonomie complète, elle encouragerait le développement d’outils conçus pour se substituer aux utilisateurs, au lieu de renforcer leurs compétences, leur jugement ou leur productivité. Les auteurs estiment que cette orientation pourrait conduire à des résultats sociétaux moins favorables que d’autres approches plus collaboratives.
À la place, le papier propose de déplacer le centre de gravité de l’évaluation vers la performance des binômes ou équipes humain–IA. L’idée n’est pas seulement de mesurer ce que le système peut accomplir seul, mais ce qu’il permet à une personne ou à un groupe de mieux réaliser. Dans cette perspective, l’IA serait conçue comme un complément aux capacités humaines, et non comme un agent autonome poursuivant un objectif de substitution.
Ce positionnement s’inscrit dans un débat plus large sur les finalités de l’IA et sur les métriques qui structurent la recherche. L’article ne détaille pas, dans le résumé disponible, de protocole expérimental précis ni de benchmark alternatif. Mais il avance une thèse claire : changer les critères d’évaluation pourrait réorienter le développement de l’IA vers des usages plus utiles, plus coopératifs et potentiellement plus bénéfiques pour la société.