Les benchmarks utilisés pour évaluer les modèles de langage restent souvent éloignés de la complexité rencontrée en entreprise. Dans ce contexte, l’article HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases, publié sur arXiv, propose une méthode pour durcir des cas de test existants sans en modifier la réponse correcte attendue.

HARDEN repose sur une recherche évolutionnaire contrainte. Concrètement, la méthode adapte les entrées d’un benchmark le long d’axes de complexité spécifiques à un domaine, tout en imposant plusieurs garde-fous: préservation de la sémantique de la tâche, réalisme des cas générés et validité d’exécution. L’objectif est de produire des exemples plus difficiles, mais toujours plausibles et évaluables dans les mêmes conditions.

Les auteurs rapportent des expérimentations sur FinQA, PubMedQA et ContractNLI, avec trois tailles de modèles Qwen3.5: 35B-A3B, 122B-A10B et 397B-A17B. Selon le résumé, HARDEN réduit la précision des modèles de 22,7 % en moyenne, et jusqu’à 49,9 % par rapport à des baselines en passage unique utilisant les mêmes vérifications de faisabilité. Ces résultats suggèrent que la difficulté supplémentaire ne vient pas d’exemples invalides, mais bien d’une meilleure exploration des cas limites.

Pour les équipes IA, l’intérêt est clair: mieux tester la robustesse des modèles sans reconstruire entièrement un benchmark. À ce stade, la publication arXiv met surtout en avant la méthode et ses premiers résultats. Comme souvent avec une prépublication, il faudra examiner plus en détail les protocoles, les coûts de génération et la généralisation à d’autres familles de modèles pour mesurer pleinement sa portée opérationnelle.