Inférence LLM : la sparsité cesse d'être un réglage pour devenir une capacité apprise

💡 En résumé

Douze papiers de la catégorie cs.LG publiés ce lundi 21 septembre, lus en profondeur : ils racontent tous le même déplacement. Pendant des années, la sparsité dans l’inférence des grands modèles de langage était un réglage — un seuil choisi par un ingénieur, appliqué uniformément, qu’on ajustait à la main en espérant ne pas casser la qualité. Les travaux de cette semaine en font une capacité apprise : les seuils sont prédits à partir de la requête, le cache mémoire est prévu avant le premier jeton, la quantification est décomposée en composantes identifiables, et la géométrie des blocs de factorisation est intégrée à l’optimiseur.

Le résultat le plus parlant vient d’Elastic Threshold Attention : en apprenant la sparsité de l’intérieur plutôt qu’en la découpant de l’extérieur, on fait disparaître les puits d’attention sur les premiers jetons — cet artefact que tout le monde contournait à coups de bricolages depuis deux ans. Un modèle de 1,45 milliard de paramètres rivalise alors avec l’attention dense à 85 % de sparsité d’entraînement et 38 % de densité de décodage active, avec un gain de vitesse murale de 2,5× sur FlashAttention-2 jusqu’à 512 000 jetons de contexte.

À côté, la famille « cache KV » pousse la logique un cran plus loin : ne plus seulement décider quoi garder, mais prévoir ce qu’on aura besoin de garder. Et sur les architectures à experts, trois papiers séparent enfin des quantités que tout le monde confondait.

🔥 Tendances : ne plus payer pour ce qui ne sert pas, mais apprendre où est l’information

Prefill : quand un centroïde de bloc cache le jeton qui compte

L’inférence en contexte long est de plus en plus limitée par la phase de prefill — le traitement du prompt entier avant que la génération commence. La sélection de blocs épars réduit ce coût, mais elle souffre d’un mode d’échec que les auteurs de RBS-Attention nomment joliment : la dilution par la moyenne. Un bloc dont le centroïde est peu pertinent peut contenir un jeton hautement pertinent, noyé parmi beaucoup d’autres qui ne le sont pas.

RBS-Attention ajoute une seconde branche de sélection. La branche de base sur centroïde capte la pertinence moyenne ; la branche dite de sauvetage utilise le rayon maximal des blocs-clés et sa distribution — dépendante du prompt, de la couche et de la tête — pour repérer les blocs menacés de sous-estimation. Les deux branches sont seuillées indépendamment puis combinées, ce qui préserve l’exécution régulière de FlashAttention par blocs.

Sur H100, à 128 000 jetons de contexte sur Qwen3-30B-A3B-Instruct-2507-FP8, le gain annoncé est de 20,65× sur l’attention de prefill seule, 11,92× sur l’attention de prefill dans vLLM et 5,97× de bout en bout sur le temps jusqu’au premier jeton. La méthode est sans entraînement. Côté qualité, la comparaison honnête est celle du modèle dense Qwen3-32B : 88,65 de précision globale RULER contre 89,52 pour l’attention dense — autrement dit, environ un point de qualité pour un ordre de grandeur de vitesse.

Décodage : la sparsité apprise fait disparaître la béquille

Elastic Threshold Attention (ETA) attaque le goulot d’étranglement en bande passante mémoire du décodage en contexte long. L’approche est une architecture entraînable de bout en bout qui prédit des seuils contextuels dynamiques directement depuis les représentations de requête — permettant au modèle d’allouer un contexte quasi dense aux étapes difficiles de récupération ou de raisonnement, tout en élaguant les jetons de routine.

Le détail technique qui compte est ailleurs. Pour apprendre cette politique sans effondrement de représentation, ETA supprime multiplicativement les logits sous le seuil vers zéro pendant l’entraînement, au lieu de les supprimer sèchement. Cette suppression douce fournit un réservoir probabiliste distribué — et son effet documenté est que les puits d’attention localisés sur les jetons initiaux disparaissent. À 85 % de sparsité d’entraînement et 38 % de densité de décodage active, un modèle ETA pré-entraîné de 1,45 milliard de paramètres rivalise avec l’attention dense sur la modélisation de langage, le raisonnement de sens commun et la récupération en contexte long.

Côté déploiement, un noyau de décodage Triton filtre les blocs du cache KV en temps O(1) grâce à des bornes géométrico-probabilistes mises en cache, pour un gain allant jusqu’à 2,5× sur FlashAttention-2. Et pour les déploiements spécialisés, un algorithme de calibration hors ligne gèle des seuils constants par tête, éliminant le surcoût du prédicteur et coupant 27 % de calcul d’attention supplémentaires.

Cache KV : prévoir la demande avant de commencer à décoder

TierKV traite le cas mobile, où le cache KV domine la mémoire parce qu’il croît linéairement avec la longueur de séquence et qu’on y accède à chaque étape de décodage. Les approches antérieures réduisent l’empreinte par compression de rang faible, éviction de jetons ou déport flash — mais le surcoût de reconstruction, la perte irréversible de jetons ou les blocages d’entrée-sortie annulent souvent le bénéfice.

Le cadre proposé, appelé optimisation de cache multi-niveaux prédictive, prévoit la demande future de cache à partir des états cachés du prefill et affecte conjointement les jetons à trois niveaux — exact, rang faible, et déporté en flash — sous les contraintes de mémoire et de précision de l’appareil. La formulation conserve l’accès au contexte complet, supprime la dépendance circulaire de l’éviction réactive, et admet un solveur de forme fermée qui choisit les frontières de niveau et les rangs par couche au moment de l’exécution. Sur huit modèles texte, vision et audio, et trois systèmes sur puce mobiles : débit de prefill jusqu’à 17,6× supérieur aux frameworks mobiles existants, cache KV résident en RAM réduit de 12,5 à 34 %, ce qui autorise des contextes nettement plus longs à budget mémoire constant, avec une dégradation de précision mineure.

Le contraste avec RBS-Attention est instructif : l’un décide quoi lire pendant le prefill, l’autre décide où stocker pour le décodage. Les deux remplacent une heuristique figée par une prédiction.

Mixture-of-Experts : séparer trois quantités confondues

Les architectures à experts souffrent d’une confusion conceptuelle que IntBMoE dissipe. Pour un jeton donné, trois quantités devraient pouvoir être réglées séparément : la participation (combien d’experts contribuent à la sortie), l’exécution (combien sont effectivement calculés, donc le coût de calcul) et la matérialisation (combien d’ensembles de paramètres de taille experte doivent être construits et stockés, donc le coût mémoire).

Le routage épars garde l’exécution et la matérialisation basses, mais réduit la participation : seuls quelques experts contribuent par jeton. Le mélange dense restaure la participation complète, mais son exécution croît avec le nombre d’experts. La fusion de paramètres maintient l’exécution à un expert, mais sa matérialisation croît avec le nombre de décisions de routage.

IntBMoE découple les trois en associant composition dense et exécution éparse par blocs : les blocs proviennent d’un petit codebook appris, un par entrée, et un hyper-réseau léger fusionne à chaque couche interne toutes les bases d’experts du pool en un expert composé. La participation est complète, l’exécution reste éparse, la matérialisation est bornée par la taille du codebook et non par l’entrée. Un mécanisme de portes résiduelles à double chemin couple ensuite deux chemins composés indépendamment. Le système est déployé dans le moteur de recommandation génératif d’AMap, servant des centaines de millions d’utilisateurs sous un budget de latence de 60 ms, avec un gain relatif de 2,4 % sur les tests A/B en ligne.

L0-MoE prend un chemin plus simple et complémentaire : une approche MoE légère régularisée en norme L0, avec une matrice de confusion de clusters pour la curation de jeux de données par domaine et un batching dynamique pour l’entraînement. Résultat : jusqu’à 2,5× d’accélération sur un modèle dense sans perte de performance notable.

Routage et attention forment un circuit couplé

Attention-Aware Routing apporte le résultat le plus surprenant du lot. Le routeur d’un MoE sélectionne et pondère classiquement les experts à partir de l’état caché du jeton, avec peu d’information contextuelle. AAR enrichit le routeur de caractéristiques temporelles et spectrales extraites d’une fenêtre glissante de poids d’attention — un résumé de l’état contextuel du modèle, désenchevêtré de l’état caché. Le transformer de base reste entièrement gelé ; seuls les paramètres de routage sont entraînés, ce qui isole le routage comme unique variable.

Sur OLMoE, AAR améliore GSM8K de +3,37 points par rapport à une référence de réglage fin du routage seul. Mais la découverte structurelle est ailleurs : routage et attention forment un circuit couplé. Un changement de routage à la couche l se propage dans le flux résiduel et amplifie les puits d’attention à la couche l+1, remodelant l’attention sans aucune modification directe du mécanisme d’attention. AAR réduit aussi les générations longues divergentes — les réponses fausses raccourcissent, les correctes gardent leur longueur. Et l’effet est fortement dépendant de la profondeur : appliqué indistinctement à toutes les couches, il peut dégrader la récupération factuelle, alors que les gains de raisonnement mathématique persistent quand on l’introduit plus profond. Cette tension entre récupération et raisonnement selon la profondeur fait de l’AAR sélectif par couches un instrument de sondage contrôlé.

🤖 Nouveaux outils : quantification, optimisation, compression

La quantification devient explicable plutôt que réglée

La quantification poids-activations après entraînement réduit la mémoire et le coût d’inférence, mais la quantification agressive en W4A4 reste difficile : les valeurs aberrantes d’activation dégradent la résolution effective. Les remèdes existent — optimisation des poids, mise à l’échelle par canal, rotation orthogonale — mais on ne savait pas précisément quelles composantes d’erreur chacun traite.

Le papier de cette semaine propose une décomposition exacte de l’erreur de quantification locale en un terme de compensation de poids guidée par l’activation et un résidu orthogonal, puis borne ce résidu à l’aide de quantités persistantes d’activation aberrante et d’activation régulière. La décomposition clarifie quelles composantes relèvent de la compensation de poids et lesquelles exigent une conception de transformation. Les bornes du résidu servent ensuite à dériver des règles pratiques pour la rotation de Hadamard randomisée, la sélection de signes et la mise à l’échelle par canal — en expliquant notamment comment des signes aléatoires suppriment l’interférence constructive entre canaux aberrants persistants, et comment l’équilibrage des seconds moments conduit à une règle d’échelle L2 tandis qu’un relâchement supplémentaire retrouve la mise à l’échelle L∞ de type SmoothQuant.

Le tout est évalué sans rétropropagation sur huit modèles Llama et Mistral, avec des performances compétitives face à SpinQuant entraîné par gradient. Pour un ingénieur déploiement, l’enjeu est double : un cadre qui explique au lieu d’énumérer, et une reproductibilité accrue puisqu’aucun gradient n’entre dans la recette.

La géométrie des blocs de factorisation entre dans l’optimiseur

Un motif structurel ubiquitaire du deep learning moderne est le bloc de factorisation linéaire : un sous-module de la forme W = BA, où deux matrices de paramètres sont multipliées sans non-linéarité intermédiaire. On le trouve dans les adaptateurs LoRA, les couches compressées en rang faible, les produits requête-clé de l’auto-attention. Tous partagent une pathologie : la factorisation n’est pas unique, ce qui peut déstabiliser l’entraînement et limiter les taux d’apprentissage utilisables. Malgré cela, ces blocs sont optimisés avec des méthodes euclidiennes qui ignorent la géométrie sous-jacente.

Stiefel-AdamW contraint un facteur sur la variété de Stiefel et laisse l’autre euclidien, ce qui réduit la symétrie de jauge complète à une symétrie orthogonale compacte : l’explosion des facteurs devient impossible tout en conservant le préconditionnement diagonal qui fait la force pratique d’AdamW. L’estimation des moments se fait dans l’espace euclidien ambiant, la géométrie n’intervenant que par une projection tangentielle et une rétraction sur la variété. Le surcoût d’implémentation est minimal, et l’optimiseur hérite à la fois de la stabilité des méthodes riemanniennes et des garanties de convergence standard. Validation sur du réglage fin de type LoRA de GPT2, ViT et Mistral 7B, et sur le pré-entraînement complet de GPT2 sur OpenWebText.

Élaguer sans sur-élaguer

Layerwise Decoupling propose une méthode de sparsification structurée des couches entièrement connectées qui traite les couches séquentiellement plutôt que de pénaliser toutes les couches conjointement. Le procédé extrait des sous-réseaux superficiels à deux couches, normalise les poids internes et applique une pénalité de groupe structurée à la matrice de poids externe de chaque bloc, élaguant les neurones et réduisant la largeur couche par couche. Les auteurs prouvent que l’objectif découplé contraint est équivalent à l’optimum à une pénalité jointe spécifique, pour toute activation positivement homogène — ce qui autorise une formulation propre, projetée et proximale.

Le résultat central est empirique : la reformulation découplée est plus robuste que les méthodes couplées, avec une plage utilisable plus large pour l’intensité de régularisation et un taux plus faible de sur-élagage catastrophique à précision comparable. Vérifié en classification contrôlée, en récupération éparse, dans un test de contrainte en réseau de neurones informé par la physique en grande dimension, et sur les couches feed-forward d’OPT-1,3B.

Deux résultats qui déplacent le curseur de la coordination

Deux papiers sortent du champ de l’optimisation pour toucher à la communication entre modèles, et leurs chiffres méritent d’être connus.

World Modeling in Transformers prend un cas devenu célèbre — TaxiGPT, un transformer entraîné sur des marches aléatoires dans Manhattan, dont les échecs avaient été interprétés comme la preuve d’une carte interne incohérente. Par analyse mécaniste et interventions causales, les auteurs montrent que le modèle représente bien les intersections et les rues, suit sa position et utilise une boussole d’objectif pour naviguer. Ses échecs proviennent d’une interférence entre caractéristiques d’intersection superposées, qui perturbe la localisation dans la carte interne. Le packing d’affordances — regrouper les représentations des intersections ayant les mêmes mouvements légaux — limite les conséquences de ces erreurs. Conclusion méthodologique : passer de « ce modèle a-t-il un modèle du monde ? » à « comment étudier mécaniquement son modelage du monde ».

The Communication Bottleneck mesure ce qui survit à la sérialisation en langage naturel. Un protocole aller-retour fait générer un problème verbal à partir d’une expression arithmétique, puis fait extraire l’expression à partir du seul énoncé, avec équivalence symbolique comme oracle exact. En évaluant toutes les combinaisons de seize modèles, les auteurs établissent une matrice de communication dont les marges séparent qualité de génération et qualité d’extraction. Trois résultats : le canal est avec pertes et asymétrique — échanger les rôles de générateur et d’extracteur déplace la précision de jusqu’à 60,4 points, et la meilleure paire atteint 92,9 % en combinant deux modèles différents plutôt qu’un modèle identique aux deux bouts ; au moins 73,6 % des échecs d’aller-retour proviennent de la génération, et la difficulté est pilotée par la structure de l’arbre (nombre d’opérateurs, profondeur, branchement à droite) plutôt que par la famille de modèle ; et le canal est entraînable — environ 3 600 exemples de réglage fin partageant les opérateurs et formes d’arbre de l’évaluation hissent tous les modèles à poids ouverts au-dessus de Gemini-3.1-Pro non entraîné.

Scaling Discovery through Test-Time Communication complète le tableau par un résultat contre-intuitif : sur ARC-AGI-3, une équipe de k agents communicants égale le taux de succès de 4k agents indépendants, et l’avantage croît avec k. Une tâche qu’aucun agent seul ne résout devient résoluble par une équipe de façon fiable. Sur l’empaquetage de polyominos, les agents communicants dépassent le meilleur score connu. Sur la compression de classificateurs MNIST, une équipe de quatre agents produit une soumission de 1 957 octets atteignant 99,4 % de précision de test, plus petite que le meilleur résultat humain connu et que le meilleur résultat mono-agent. La limite est explicite : quand le calcul est contraint ou qu’aucune mesure claire du progrès n’existe, les agents indépendants peuvent l’emporter.

📊 Analyse : le changement d’unité économique

Ce que ces douze papiers changent n’est pas une constante de performance, mais l’unité dans laquelle on raisonne.

Pendant la période précédente, l’unité était le paramètre et l’octet : combien de milliards, combien de gigaoctets, combien de bits par poids. Les travaux de cette semaine déplacent l’unité vers la décision d’information. RBS-Attention demande : ce bloc mérite-t-il d’être lu ? ETA demande : ce jeton mérite-t-il d’être conservé, et avec quelle résolution ? TierKV demande : dans quel niveau de mémoire ce jeton ira-t-il, sachant ce que je vais bientôt lire ? IntBMoE demande : combien d’experts contribuent, combien s’exécutent, combien existent ? La quantification demande : cette erreur relève-t-elle de la compensation de poids ou de la transformation ?

Dans chacune de ces formulations, la réponse est calculée ou apprise au moment de l’exécution, par opposition à fixée à l’avance. C’est la différence entre un compilateur qui applique des passes prédéfinies et un ordonnanceur qui prend ses décisions avec l’information disponible.

Deux conséquences pratiques en découlent.

La première concerne la transférabilité. Un seuil appris soulève immédiatement la question de sa validité hors du contexte d’entraînement. RBS-Attention répond partiellement en dérivant sa distribution de rayon de manière dépendante du prompt, de la couche et de la tête — un prédicteur qui s’adapte plutôt qu’une constante. ETA répond par un algorithme de calibration hors ligne pour les déploiements spécialisés, avec des seuils constants par tête une fois la calibration faite. TierKV répond par un solveur qui choisit les niveaux au moment de l’exécution. Les trois reconnaissent le même risque et l’adressent par des mécanismes de repli explicites. C’est le signe d’un domaine qui mûrit : il ne prétend plus que la méthode marche partout, il documente la procédure de déploiement.

La seconde concerne la mesurabilité. Stiefel-AdamW, la décomposition de quantification et le découplage par couches partagent une propriété remarquable : ils reposent sur des arguments analytiques. Une symétrie de jauge réduite, une borne de résidu, une preuve d’équivalence à l’optimum. Cela les rend auditables — on peut vérifier la raison du gain, pas seulement constater le gain. À l’heure où l’efficacité de l’inférence devient un argument commercial central, cette distinction va compter : une amélioration qu’on peut expliquer se reproduit, une amélioration qu’on peut seulement mesurer se perd au changement de version.

Le dernier point est un rappel d’humilité fourni par le papier sur le goulot de communication. Toute cette ingénierie d’efficacité à l’intérieur d’un modèle coexiste avec une perte massive dès qu’un modèle doit transmettre une structure arborescente à un autre par du texte. Au moins 73,6 % des échecs naissent à la génération, et la difficulté suit la forme de l’arbre, pas la famille de modèle. Autrement dit : on optimise l’intérieur du canal avec une sophistication croissante, alors que la sortie du canal reste le maillon faible. Aucun noyau Triton ne corrigera cela. Le remède identifié est ailleurs — de la supervision ciblée sur la sérialisation, avec un peu plus de trois mille exemples suffisant à dépasser un modèle de frontière non entraîné sur cette compétence précise.

Une dernière observation, sur le coût caché. Ces méthodes déplacent du calcul vers des prédicteurs, des solveurs, des calibrations et des codebooks. La question opérationnelle devient donc : ce coût supplémentaire est-il amorti sur la durée de vie du service ? Pour RBS-Attention, la réponse est triviale — c’est sans entraînement, le gain se paie au premier appel. Pour TierKV, le solveur s’exécute une fois par séquence, ce qui s’amortit sur un contexte long. Pour ETA, la calibration est hors ligne et le prédicteur peut même être gelé pour supprimer son surcoût. Les auteurs de ces travaux ont tous pris soin de chiffrer cette compensation, ce qui n’était pas le cas dans la génération précédente de papiers « accélération » où le gain annoncé ne résistait pas au premier profil de production.

🎯 À retenir

  • La sparsité devient apprise. Elastic Threshold Attention prédit ses seuils depuis la requête et fait disparaître les puits d’attention sur les premiers jetons ; un modèle de 1,45 Md de paramètres égale l’attention dense à 85 % de sparsité d’entraînement et 2,5× plus vite que FlashAttention-2 jusqu’à 512 K jetons.
  • Prefill en contexte long. RBS-Attention traite la « dilution par la moyenne » par une double sélection centroïde + sauvetage, sans entraînement : 20,65× sur l’attention de prefill, 5,97× sur le temps jusqu’au premier jeton à 128 K, pour environ un point de RULER.
  • Cache KV prédictif. TierKV prévoit la demande depuis les états de prefill et répartit les jetons sur trois niveaux : jusqu’à 17,6× de débit de prefill et 12,5 à 34 % de cache résident en moins sur des SoC mobiles.
  • MoE : trois quantités, pas une. IntBMoE sépare participation, exécution et matérialisation via un codebook de blocs — déployé chez AMap pour des centaines de millions d’utilisateurs sous 60 ms de budget. L0-MoE atteint 2,5× sur un modèle dense.
  • Routage et attention sont couplés. Modifier le routage à une couche amplifie les puits d’attention à la suivante : la tension récupération/raisonnement selon la profondeur est désormais mesurable.
  • La quantification devient explicable. La décomposition exacte de l’erreur W4A4 en compensation guidée par l’activation et résidu orthogonal donne des règles dérivées plutôt que des recettes, sans rétropropagation, sur huit modèles Llama et Mistral.
  • Le maillon faible n’est pas dans le modèle. Au moins 73,6 % des échecs de communication entre modèles naissent à la génération, et 3 600 exemples de supervision ciblée suffisent à hisser tous les modèles ouverts au-dessus d’un modèle de frontière non entraîné sur cette compétence.

A lire aussi