Le papier présenté sur arXiv s’attaque à un problème très concret du déploiement des grands modèles de langage sur l’edge : anticiper correctement la latence d’inférence selon l’appareil, le backend logiciel, le modèle et même le comportement du prompt. Les auteurs rappellent que cette latence varie fortement avec l’utilisation matérielle, les mécanismes de gestion dynamique de fréquence et de tension (DVFS) ou encore les effets thermiques, ce qui complique la sélection rapide d’un LLM adapté à un terminal donné.
Le cadre proposé représente chaque requête comme une configuration combinant matériel, runtime, modèle et prompt. Il distingue aussi les phases de *prefill* et de *decode*, qui n’ont pas les mêmes caractéristiques de performance. Pour améliorer la prédiction, le système fusionne des descripteurs statiques avec de la télémétrie matérielle dynamique via un modèle de prédiction à porte (*gated model*), orienté vers des scénarios de déploiement plutôt que vers une simple mesure hors ligne.
Les expérimentations ont été menées principalement sur des smartphones Pixel, avec une validation du pipeline de profilage sur Jetson Nano, Orange Pi 5 Pro et une plateforme GPU de classe RTX 3090. Sur Pixel 8, les auteurs indiquent une amélioration du coefficient R² de latence totale de 0,953 à 0,960, et de la latence de décodage de 0,957 à 0,973 par rapport à une base statique seule. Sur Pixel 8 Pro, la prédiction de la phase de *prefill* passerait de -1,383 à 0,966.
L’étude met aussi en avant l’intérêt du transfert inter-appareils avec calibration légère. Dans ce cadre, le passage de Pixel 8 Pro vers Pixel 8 ferait progresser le R² de latence totale de -0,974 à 0,940. Enfin, les mesures hétérogènes soulignent l’écart considérable entre plateformes : un même modèle SmolLM2 atteindrait 8,42 tokens/s sur Orange Pi 5 Pro contre 64,38 tokens/s sur une machine de classe RTX 3090. De quoi renforcer l’idée qu’une prédiction de latence sensible au runtime peut devenir un outil clé pour industrialiser le choix des LLM en environnement edge.