Les grands modèles de langage restent sensibles à la formulation des consignes, ce qui rend l’« ingénierie de prompt » difficile à maîtriser pour les utilisateurs non spécialistes. Dans ce contexte, les auteurs de l’article TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter proposent un système chargé de réécrire automatiquement les prompts afin de les adapter plus finement à la tâche visée.

Le principe de TAPR consiste à transformer une requête initiale en une version jugée plus claire, plus directive et potentiellement plus efficace pour le modèle en aval. Pour entraîner ce réécrivain, les chercheurs s’appuient sur un apprentissage par renforcement avec Group Relative Policy Optimization (GRPO). Les récompenses sont calculées à partir d’évaluations réalisées par un LLM jouant le rôle de juge, à la fois sur la qualité du prompt reformulé et sur la sortie produite pour la tâche correspondante.

D’après le résumé publié sur arXiv, la méthode a été testée sur plusieurs familles d’usages, dont la question-réponse, le résumé et le raisonnement arithmétique. Les auteurs indiquent observer des améliorations régulières par rapport aux modèles de base en matière de réécriture de prompts. Ils précisent également qu’un fine-tuning de Phi-4-mini-instruct, utilisé comme base pour TAPR, génère des formulations plus explicites et plus instructives.

L’article mentionne aussi des gains sur des benchmarks établis comme Natural Questions et GSM8K, ce qui suggère un impact concret sur la précision des réponses dans certains scénarios. Comme souvent avec ce type de travaux, il faudra toutefois examiner les détails expérimentaux complets pour mesurer la robustesse des résultats et leur généralisation à d’autres modèles ou contextes métier. Le code a été mis à disposition publiquement sur GitHub, un point qui pourrait faciliter la reproduction et l’évaluation indépendante de l’approche.