Les modèles de langage capables de traiter de très longues fenêtres de contexte se heurtent de plus en plus à un goulot d’étranglement : la phase de prefill, durant laquelle l’attention dense parcourt l’ensemble du prompt avant même le début de la génération. Dans un article publié sur arXiv, les auteurs proposent RBS-Attention (*Radius-Bounded Sparse Prefill*), une méthode visant à alléger ce calcul sans nécessiter de réentraînement du modèle.

L’idée centrale est de corriger une faiblesse des approches de sélection sparse par blocs. En résumant un bloc par son centroïde, celles-ci peuvent manquer un token très pertinent noyé parmi d’autres moins utiles — un phénomène que les auteurs appellent mean dilution. Pour y répondre, RBS-Attention combine deux branches de sélection : une branche de base, fondée sur la pertinence moyenne, et une branche de “sauvetage”, qui s’appuie sur le rayon maximal d’un bloc de clés afin de repérer les blocs potentiellement sous-estimés.

Les deux branches sont seuillées séparément puis fusionnées, ce qui permet, d’après les auteurs, de conserver une exécution compatible avec les schémas block-sparse de type FlashAttention. Sur GPU H100, l’article rapporte jusqu’à 20,65× d’accélération du prefill-attention seul, 11,92× dans vLLM, et 5,97× sur le temps total jusqu’au premier token à 128K de contexte, sur Qwen3-30B-A3B-Instruct-2507-FP8.

Côté qualité, les résultats avancés restent proches de l’attention dense sur certains tests. Sur Qwen3-32B, RBS-Attention atteindrait 88,65 de score global sur RULER, contre 89,52 pour l’attention dense. Les auteurs mentionnent aussi des évaluations complémentaires sur LongBench-v2, InfiniteBench et Video-MME. Comme il s’agit d’un préprint arXiv, ces performances devront toutefois être confirmées par des validations indépendantes et par des tests en production.