Des chercheurs proposent HarvestBench, un benchmark conçu pour tester un angle encore peu mesuré dans l’évaluation des agents IA : leur disposition à accepter un coût pour éviter un dommage moralement sensible. Le cadre prend la forme d’une simulation de récolte coopérative, où des sous-agents pilotent deux tracteurs dans un environnement de type *gridworld*. Lorsqu’un animal bloque la route, le système demande au modèle s’il faut continuer tout droit ou contourner l’obstacle en payant un surcoût en carburant.
L’intérêt du protocole est de ne pas expliciter ce dommage dans l’objectif principal. Les auteurs comparent aussi les décisions face à deux contrôles : des rochers, qui endommagent le tracteur, et des bottes de foin, inoffensives et non vivantes. Selon le résumé de l’article, les modèles heurtent les rochers dans moins de 1 % des cas, ce qui suggère qu’ils savent éviter un coût instrumental clair. En revanche, leur comportement face aux animaux varie fortement.
L’étude couvre neuf modèles et 7 201 décisions tarifées, dont 3 951 impliquant un animal. Les taux de mise à mort vont de 0,4 % à 98,8 %, avec des écarts qui ne suivent pas simplement le niveau de capacité générale. Les auteurs indiquent aussi que quatre modèles sur six testés montrent une sensibilité statistiquement significative au prix demandé pour éviter le dommage. Autre résultat notable : tous les modèles testés écrasent plus souvent des animaux sauvages que des animaux d’élevage dans la configuration par défaut.
Le *briefing* fourni au modèle semble enfin jouer un rôle déterminant. Avec un cadrage moral explicite, le taux de mise à mort reste sous 6 % pour cinq des six modèles de raisonnement mentionnés ; sans ce cadrage, il dépasserait 84 % pour les six. Les auteurs soulignent que HarvestBench ne repose pas sur un évaluateur LLM : le score est calculé à partir des journaux d’événements du jeu, ce qui vise une meilleure reproductibilité. À ce stade, il s’agit d’un travail de recherche préliminaire publié sur arXiv, donc non encore validé par les pairs.