PerfReasoning mesure les limites des LLM face au raisonnement sur les performances matérielles
Une équipe de recherche présente PerfReasoning, un benchmark conçu pour évaluer la capacité des grands modèles de langage à raisonner sur les performances matérielles et à générer du code de modélisation analytique. Les premiers résultats montrent un écart net entre de bonnes performances en questions-réponses et unefi