TinyCeNN-LM s’attaque à un problème délicat dans les modèles de langage préentraînés : remplacer l’attention sans perturber les représentations attendues par les couches suivantes. Plutôt qu’un remplacement global, les auteurs proposent un cadre de conversion post-entraînement sous contrôle qualité, fondé sur des couches cellulaires-récurrentes inspirées des CeNN, avec traitement local borné, mémoire récurrente compacte, routage et fusion.
Le point central de l’article est un mécanisme d’acceptation ou de retour arrière appliqué à chaque couche convertie. La conversion n’est retenue que si des seuils fixes sont respectés à la fois sur la fidélité des représentations et sur la dégradation de la log-vraisemblance négative (NLL). Trois variantes sont étudiées : Integrated Memory, MemoryFusion et PDelta3-GDN2-CLVR+Local32. Cette logique confirme que la compatibilité structurelle prime sur l’ambition d’un remplacement universel de l’attention.
Sur SmolLM2-135M, les couches 0 à 2 sont acceptées, avec un ΔNLL cumulé de +0,01209. La couche 3 est en revanche rejetée : la NLL reste jugée acceptable, mais la fidélité des représentations ne passe pas le seuil requis. Sur Qwen3.5-0.8B, les couches d’attention complète 3, 7 et 11 sont acceptées, pour un ΔNLL final de +0,02073. La variante Integrated Memory maintient la perplexité dans une fourchette de -0,07 % à +0,93 %, tout en réduisant le cache total jusqu’à 6,01 %.
Les auteurs mentionnent aussi un contrôle aval limité, sur un échantillon de 200 éléments, où les versions converties de Qwen obtiennent une précision globale de 28,5 % à 32,0 %. Ces résultats restent prudents et ne démontrent ni accélération systématique ni substitution générale de l’attention. L’apport principal de TinyCeNN-LM est ailleurs : montrer qu’une conversion structurelle conservatrice, validée couche par couche, peut être envisageable sans rompre l’équilibre d’un modèle existant.