Les *agent harnesses* — ces couches d’orchestration qui pilotent des agents LLM — prennent une multitude de microdécisions : choisir un modèle, sélectionner un outil, filtrer un texte récupéré ou détecter une tentative d’injection. L’article “Fast Models, Slow Evidence” évalue deux modèles dits *System-1*, conçus pour répondre à ces questions en un seul passage, avec l’objectif de remplacer des appels LLM plus coûteux et plus lents.
L’étude compare un modèle open-weight, Laya, et un modèle hébergé, Jev, sur 11 points de décision issus de 18 sources publiques. Le protocole repose sur 7 283 cas de base et 6 640 variantes de robustesse, avec des entrées identiques, des tests appariés et des vérifications de reproductibilité selon le matériel et le jour d’exécution. Selon les auteurs, Jev surpasse significativement Laya sur 9 décisions sur 11, avec des écarts allant de 10,8 à 46 points de pourcentage.
Les résultats soulignent toutefois plusieurs fragilités. Aucun des deux modèles ne dépasse le hasard en *zero-shot* pour le routage de modèles, et ils sont à égalité sur le filtrage de pertinence en RAG. Laya apparaît particulièrement sensible à l’ordre des options : inverser cet ordre modifie 30 % de ses réponses. Le modèle se dégrade aussi fortement lorsque le nombre de candidats augmente ou quand ceux-ci se ressemblent, là où Jev conserve, d’après l’article, de meilleures performances.
Point notable : les auteurs auditent également leur propre pipeline expérimental. Ils identifient trois erreurs d’analyse et un biais de conception ayant gonflé certaines conclusions initiales, notamment sur les économies de coûts et la qualité de déploiement. Cette autocritique renforce l’intérêt du papier : au-delà de la comparaison de modèles, il rappelle qu’en matière d’agents LLM, la promesse de rapidité ne vaut que si l’évaluation est rigoureuse, reproductible et correctement interprétée.