Des travaux récents sur les grands modèles de langage ont popularisé la recherche en contexte: le modèle produit une première solution, l’évalue, puis la révise au fil de plusieurs tentatives. Dans cet article, les auteurs proposent un cadre théorique pour comprendre quand cette stratégie apporte un avantage réel, au-delà d’un simple échantillonnage répété.
Leur idée est de modéliser ce processus comme une inférence approximative sur des traces de raisonnement. Le modèle de base fournit une forme de prior, tandis que la réflexion interne agit comme un signal de retour pour réviser ce prior vers un posterior plus utile. L’enjeu central devient alors la complexité d’échantillonnage à l’inférence: combien de tentatives séquentielles faut-il pour atteindre une forte probabilité de succès ?
Le résultat principal est nuancé. Si les réflexions du modèle parviennent à localiser de manière fiable les erreurs précoces, alors la recherche en contexte peut offrir des gains exponentiels par rapport au mode zéro-shot. Dans ce scénario, des problèmes dont le taux de réussite initial est extrêmement faible pourraient être résolus avec un nombre seulement polynomial de tentatives successives. En revanche, si cette capacité de localisation échoue, le fait de conditionner les essais futurs sur les essais passés n’apporte, asymptotiquement, pas d’avantage clair par rapport à des tirages parallèles indépendants.
Les auteurs avancent aussi que ces bénéfices seraient robustes et apprenables. Selon leur analyse, des mises à jour approximatives du posterior suffisent, et un entraînement en cross-entropy sur des trajectoires de recherche permettrait de retrouver ce comportement avec une complexité d’échantillons polynomiale. Enfin, ils relient ce mécanisme à une abstraction par étapes de l’apprentissage par renforcement avec récompenses vérifiables, où l’extension optimale de politique suivrait une règle similaire de repondération. Les prédictions qualitatives de la théorie auraient été confrontées à des modèles réels de raisonnement, sans que le résumé arXiv ne détaille ici les résultats expérimentaux complets.