Moins de mémoire, même réponse : la compression redevient le sujet central

Moins de mémoire, même réponse : la compression redevient le sujet central

💡 En résumé

La journée technique du 7 octobre tient en une question unique, déclinée sur toute la pile : combien de mémoire et de calcul faut-il dépenser pour obtenir la même réponse ? Côté inférence, trois papiers attaquent le cache KV et la quantification des modèles de diffusion — AttSVD garde tous les tokens mais les stocke moins cher, MaskAhead les évince par masque, SoloQ quantifie sans données de calibration. Côté entraînement, TRIAGE stabilise l’apprentissage NVFP4 4 bits, GA-GRPO donne enfin la théorie du guidage externe dans le RLVR, DART-ES bat GRPO en coût, et DRMoET rend le routage MoE robuste à ses propres erreurs.

Résultat : des gains mesurés, pas des promesses. La moitié de la mémoire KV à qualité dense, 9,5× à 20,1× de réduction en diffusion, 2,61× de mémoire en moins pour 2,24× de vitesse, moins d’heures-GPU que l’état de l’art antérieur. Et deux résultats plus philosophiques : l’hyper-connectivité résiduelle des encodeurs de diffusion n’est peut-être pas nécessaire, et Muon est théoriquement faux pour les convolutions — mais plus efficace quand même.

🔥 Tendances : le cache KV, goulot unique de l’inférence longue

AttSVD : garder tous les tokens, stocker des directions

Le cache clé-valeur d’un transformeur autorégressif croît linéairement avec le contexte et domine la mémoire en contexte long. La plupart des remèdes sans entraînement évitent (evict) les tokens peu importants — un choix irréversible le long de l’axe de la séquence. AttSVD prend le parti inverse : garder chaque token, mais l’écrire moins cher sur l’axe des caractéristiques.

La méthode dérive la base de compression de la géométrie d’attention de chaque prompt : une SVD tronquée, en ligne et par prompt, qui ne conserve que les directions que l’attention lit réellement, réduisant la mémoire KV persistante par tête proportionnellement au rang retenu. Deux stratégies de mise en cache au décodage sont proposées — accumulation et flux — pour les régimes de génération courte et longue. Deux raffinements rendent la compression adaptative : une règle d’énergie par matrice dimensionne indépendamment l’espace des logits et la masse d’attention ; une troncature de base tenant compte de l’attention ne coupe que dans les espaces effectivement lus, préservant à la fois les logits et la sortie d’attention. Bonus : les mêmes facteurs offrent une interprétabilité gratuite par tête sur le rang effectif et la géométrie consommée.

Le résultat mesuré : sur plusieurs modèles, un benchmark agentique et l’intégralité de LongBench, AttSVD reste au niveau du cache dense en utilisant jusqu’à 50 % de la mémoire du cache KV.

MaskAhead : deux problèmes, un seul mécanisme de masque

Les modèles de langage à diffusion par blocs conservent un grand cache KV tout au long de la génération et l’attendent à chaque étape de débruitage, ce qui limite à la fois la capacité mémoire et la vitesse. Réduire ce coût demande de trancher deux questions distinctes : quels tokens passés utiliser pour débruiter le bloc courant (sélection) et quels garder en mémoire pour les blocs futurs (éviction).

MaskAhead résout les deux avec un seul mécanisme de classement fondé sur les masques : les masques du bloc courant guident la sélection, des sondes sur les blocs masqués à venir guident l’éviction ; les deux classent les entrées KV selon leur contribution estimée à la sortie d’attention. La variante quantifiée Q-MaskAhead calcule sélection et attention directement depuis un KV en bits bas, préservant en grande partie les entrées sélectionnées.

Sur Fast-dLLM-v2, DreamReasoner et LLaDA2.0-mini — couvrant raisonnement à génération longue, questions-réponses à prompt long et recherche d’aiguille dans une botte de foin — MaskAhead réduit la mémoire KV de 9,5× en moyenne pour 1,2 point de F1 perdu en QA long-prompt. Q-MaskAhead pousse à 20,1× pour 2,3 points. En profil système batch-32 : 1,23× de bout en bout et 1,68× au stade du décodage par rapport à l’inférence dense.

SoloQ : quantifier les modèles de diffusion sans calibration

Les modèles de langage par diffusion (dLLM) apparaissent comme une alternative crédible aux autorégressifs grâce à la génération bidirectionnelle par diffusion. Mais leurs tailles croissantes et leurs coûts d’inférence — le débruitage sur séquence complète qui invoque à répétition des passes avant coûteuses, plus le cache KV des modèles par blocs — rendent le déploiement difficile.

La quantification bits bas poids-activations est donc attractive. Problème : les méthodes de quantification post-entraînement existantes dépendent de données de calibration, alors que les distributions d’activations se déplacent selon l’état de masquage et l’étape de débruitage. SoloQ répond par une quantification sans calibration : elle projette poids et activations dans une base tournée normalisée à distribution marginale prévisible, ce qui rend la quantification indépendante des données. Combinaison d’une rotation structurée K-RPBH et d’une correction légère de remise à l’échelle ; la distribution post-rotation prévisible supporte à la fois des codebooks assortis et le format matériel NVFP4. Pour les modèles par blocs, SoloQ ajoute une quantification du cache KV au moment du commit, compressant les états persistants sans perturber le bloc en cours de débruitage.

Bilan sur LLaDA et Dream (séquence complète) et Fast-dLLM v2 et Nemotron-Labs-Diffusion (par blocs) : précision conservée en 4 bits, au-dessus des références calibrées sur les benchmarks de connaissance et de raisonnement ; en NVFP4, −2,61× de mémoire pic et +2,24× de vitesse de bout en bout.

🤖 Nouveaux outils : l’entraînement se passe aussi de précision

TRIAGE : le RL en NVFP4, stabilisé par la direction

L’exécution en précision réduite peut accélérer substantiellement l’apprentissage par renforcement des grands modèles, mais les écarts entre exécution de l’apprenant et de l’échantillonneur peuvent déstabiliser l’optimisation. TRIAGE caractérise l’interaction entre ce décalage (mismatch) et la direction du gradient de politique, en distinguant les contributions qui amplifient localement de celles qui contractent — distinction qu’une mesure d’amplitude seule ne peut pas faire.

En NVFP4 natif, les auteurs observent un déséquilibre précoce entre les deux régions amplificatrices, favorisant les mises à jour à avantage négatif et écart négatif ; leurs tokens de queue se concentrent dans une petite fraction des segments avant que le décalage ne se propage globalement. TRIAGE rééquilibre sélectivement ces mises à jour par diagnostic au niveau du segment et applique une réparation bornée au décalage résiduel, tout en conservant l’exécution avant W4A4 NVFP4 native chez l’échantillonneur et l’apprenant.

Sur Qwen3-4B et Qwen3-30B-A3B : optimisation stable sur l’horizon évalué, performance de niveau pleine précision sur cinq benchmarks de raisonnement mathématique, et jusqu’à 2,3× de débit de rollout en plus par rapport à BF16.

GA-GRPO : la théorie du guidage externe, enfin

Le RLVR (reinforcement learning with verifiable rewards) est devenu le paradigme dominant pour produire du raisonnement multi-étapes, et une vague de méthodes — LUFFY, ExPO, PAPO, TAPO — y ajoute un guidage externe : traces expertes, auto-explications, motifs de pensée récupérés. Chacune rapporte des gains empiriques ; aucune ne fournit de taux de convergence, de borne de biais ni de règle de pondération optimale pour le signal de guidage.

GA-GRPO comble ce vide : il traite le guidage externe comme un opérateur stochastique G qui réécrit la distribution des questions, et analyse l’estimateur de gradient de politique résultant comme un estimateur on-policy biaisé, dont le biais est borné par la divergence en variation totale δ_G entre la distribution d’échantillonnage augmentée et celle de la politique. Le cadre subsume GRPO vanilla, LUFFY, ExPO, PAPO et TAPO comme cas particuliers.

Résultats théoriques : sous des hypothèses de régularité et de divergence bornée, GA-GRPO converge en O(1/√T) vers un voisinage O(δ√T) du point stationnaire de GRPO ; le poids de guidage MSE-optimal a une forme fermée, λ*(T, δ, σ₀²) = σ₀² / (σ₀² + R_max² δ² T) ; et une borne inférieure minimax établit que le terme de biais Ω(δ²T) est inévitable. Sur Qwen2.5-Math-7B-Base, sur neuf benchmarks maths et hors distribution, le GA-GRPO à poids optimal égale ou dépasse TAPO, LUFFY, ExPO et GRPO vanilla en consommant 31 % d’heures-GPU en moins — et huit expériences d’analyse valident chaque prédiction théorique.

DART-ES : le fine-tuning complet sans rétropropagation, moins cher que GRPO

Les stratégies d’évolution (ES) permettent un fine-tuning complet de tous les paramètres d’un LLM avec seulement du calcul en passe avant. Mais les ES standard moyennent uniformément les récompenses et compriment le retour de population en un scalaire unique, ce qui rend difficile de capturer comment la valeur d’apprentissage d’un problème évolue avec la capacité du modèle.

DART-ES estime la solvabilité locale de chaque problème depuis son taux de réussite dans la population de perturbations, et agrège les observations historiques en un état de difficulté dynamique. Cet état partagé pilote conjointement une repondération continue par difficulté et un replay des échantillons rares solubles, sans modèle de difficulté supplémentaire ni rétropropagation.

Chiffres : DART-ES dépasse ES sur les cinq modèles de base et porte la précision moyenne de 72,07 % à 73,53 %, au-dessus des 73,26 % de GRPO sur GSM8K. Sur cinq benchmarks de raisonnement mathématique exigeants : 49,20 % contre 48,34 % pour ES, compétitif avec de bons modèles 7B entraînés par RL. Gains confirmés en instruction tuning, génération de code et tâche Countdown avec un modèle 14B. Et l’avantage système est net : −15,2 % à −50,2 % de temps par pas, −21,1 % à −51,1 % de mémoire pic par GPU par rapport à GRPO — malgré le fine-tuning de tous les paramètres, DART-ES reste moins coûteux en temps et en mémoire que GRPO+LoRA.

DRMoET : le routage MoE assume ses erreurs

Les transformeurs à mélange d’experts gagnent en capacité en n’activant que quelques experts par token, mais cette parcimonie crée un problème de fiabilité caché : quand le routage est imparfait, un modèle équilibré en charge peut envoyer des tokens vers des experts insuffisamment entraînés pour les entrées assignées.

DRMoET traite les experts d’une couche comme des groupes de robustesse endogènes et optimise les issues de routage à forte perte plutôt que d’égaliser simplement le trafic. Il met à jour une distribution d’experts par couche via une règle softmax régularisée par entropie sur des pertes d’experts pondérées par l’activation et lissées en moyenne mobile, renforçant les chemins de routage non-optimaux plausibles sans changer le calcul MoE standard. À l’échelle 10,3 B de paramètres totaux et 67 B de tokens d’entraînement, la moyenne sur sept tâches passe de 0,6625 à 0,6767 (la référence sans perte auxiliaire : 0,6431). Les analyses mécanistes montrent une variance de perte d’experts plus faible, −4,3 % de perte excédentaire sous mauvais routage forcé mi-k, et une meilleure spécialisation experts/domaines. La robustesse du routage — pas seulement l’équilibre d’utilisation — devient un objectif pratique pour passer à l’échelle.

Et deux résultats qui interrogent les fondations

Le RLVR sous confidentialité différentielle existe. « Reward-Driven Learning under Prompt-Level Differential Privacy » entraîne un modèle sur des problèmes qui peuvent eux-mêmes être confidentiels — et le modèle entraîné peut révéler lesquels il a vus. En prenant le groupe des réponses à un prompt comme enregistrement de confidentialité, la méthode agrège leurs gradients, écrête la contribution du prompt une seule fois, ajoute du bruit gaussien et compose la perte de confidentialité entre les mises à jour : le budget ne dépend donc ni du nombre de réponses par prompt ni de la norme d’écrêtage. C’est, selon les auteurs, la première garantie de confidentialité différentielle pour l’entraînement RLVR. À ε=8 sur Qwen2.5-1.5B-Instruct, le signal de récompense apporte 2,65 points sur MATH et 3,24 sur GSM8K par rapport au contrôle, dans chaque graine ; le modèle privé retient 85-90 % du gain de GRPO non privé, et un budget huit fois plus serré ne coûte que 1,2 point au plus sur MATH.

La suppression exacte par soustraction. « Exact Unlearning via Quantized Sufficient Statistics » sépare un petit schéma gelé d’un contenu mutable, somme-décomposable : le schéma apprend la structure globale, le contenu stocke les corrections de prédiction locales comme statistiques additives indexées par régions quantifiées. Supprimer un contenu devient une soustraction exacte plutôt qu’une optimisation. Deux garanties sont distinguées : QSS-L retire exactement une étiquette en conservant l’entrée non étiquetée ; QSS-E retire entrée et étiquette. Une suppression emprunte le chemin arithmétique rapide avec probabilité 1−ρ et déclenche une reconstruction complète avec probabilité ρ. Sur 15 jeux de données vision, texte et tabulaires à ρ=0,5 %, QSS-L est à moins de 2 points de SISA sur 11 tâches et offre une latence de suppression attendue 4 à 483× plus faible sur les tâches à faible nombre de classes.

📊 Analyse : ce que la compression dit du déploiement

Le coût se déplace du calcul vers la mémoire persistante

Trois papiers indépendants (AttSVD, MaskAhead, SoloQ) attaquent le même composant : le cache KV. En contexte long ou en génération agentique, la mémoire persistante — pas les FLOPs — devient la contrainte qui décide si un modèle tourne. AttSVD choisit la représentation (rank), MaskAhead choisit le contenu (sélection et éviction), SoloQ choisit la précision (4 bits sans calibration). Les trois sont compatibles, et c’est le vrai enseignement : on peut empiler les trois axes, garder la qualité dense et diviser la facture par plusieurs.

Il faut noter une prudence méthodologique : ces réductions sont exprimées par rapport à l’inférence dense du même modèle. AttSVD parle de 50 % de la mémoire KV ; MaskAhead de 9,5× puis 20,1× selon la variante quantifiée ; SoloQ de 2,61× de mémoire pic et 2,24× de vitesse. Ce ne sont pas des chiffres interchangeables — ils mesurent des choses différentes sur des modèles différents. La comparaison utile est toujours « identique au dense sur la même tâche ».

L’entraînement sans rétropropagation redevient crédible

DART-ES est le résultat le plus contre-intuitif de la journée : une méthode à passe avant seule, sans rétropropagation, bat GRPO en précision et en coût — moins de temps par pas, moins de mémoire pic, et moins qu’un GRPO+LoRA malgré un fine-tuning de tous les paramètres. Combiné à TRIAGE, qui stabilise le RL en 4 bits pour un débit de rollout 2,3× supérieur, et à GA-GRPO, qui coupe 31 % des heures-GPU tout en ajoutant une garantie théorique, le message est que la dépense d’entraînement est devenue un objet d’optimisation à part entière, pas un coût fixe.

Les fondations aussi bougent

L’hyper-connectivité résiduelle n’est pas sacrée. DDT-RFE retire les connexions résiduelles autour de l’attention et du MLP dans chaque bloc encodeur d’un transformeur de diffusion découplé, tout en gardant l’entraînement stable, et fusionne le patch embedding d’entrée avec les features intermédiaires et finales pour que le décodeur garde l’information que l’abstraction jette. Résultat : meilleurs scores en classification d’images, segmentation sémantique, découverte d’objets et correspondance sémantique — avec moins de blocs d’encodeur — et un FID plus bas en génération sur ImageNet.

Muon est théoriquement faux pour les convolutions, mais empiriquement efficace. Muon a une interprétation claire pour les mises à jour matricielles, mais les noyaux de convolution sont des tenseurs d’ordre 4 : les implémentations standard les redimensionnent en matrices, raccourci qui casse la théorie. Les auteurs formalisent l’objectif dans la géométrie des opérateurs convolutifs et introduisent Conv-NS, qui approxime le facteur polaire dans cette géométrie en préservant le support du noyau. Verdict : Conv-NS et le Muon reshape-based atteignent une précision comparable sur CIFAR-10 et ImageNet. Hypothèse avancée : l’orthogonalisation convolutive exacte sur-contraint les mises à jour. Beau cas où la pratique s’avère meilleure que la théorie qu’on cherche à lui réappliquer.

Pourquoi les couches moyennes se ressemblent entre langues. « A theory of platonic representations » explique la similarité des représentations de phrases traduites dans les couches internes des modèles multilingues — observation reliée à l’hypothèse des représentations platoniciennes, jusqu’ici non expliquée. En générant des langues synthétiques à partir de grammaires probabilistes hors contexte partageant les règles de production hautes mais pas basses, l’auteur montre que le prédicteur Bayés-optimal de token suivant est la propagation de croyances : encoder ses messages dans des couches successives produit des prédictions analytiques qui s’accordent bien avec les transformeurs entraînés sur les mêmes données. Le cadre explique pourquoi la similarité inter-langues culmine dans les couches moyennes, distingue similarité (géométrie de voisinage partagée) et alignement (coordonnées partagées — qui survient quand les données à commutation de code sont assez abondantes), et prédit qu’en soustrayant de chaque couche la composante linéairement prédictible depuis la précédente, la similarité inter-langues augmente — confirmé sur des LLM pré-entraînés.

Deux avertissements à garder en tête

L’adaptation auto-surveillée casse son propre moniteur. « The Premise Is the Problem » étudie les systèmes qui se mettent à jour après déploiement et qui surveillent, pour se protéger, les mêmes erreurs de prédiction qui guident ces mises à jour. Verdict en prévision de séries temporelles multi-pas : les cibles chevauchantes et la dépendance des erreurs de prévision brisent une hypothèse clé (l’échangeabilité) ; le moniteur déclenche des alarmes alors qu’aucun changement nuisible n’a eu lieu, et sa réponse peut détériorer la qualité des prédictions. Plus gênant : l’adaptation peut cacher un changement soutenu à son propre moniteur, tandis que le modèle gelé d’origine en garde un signal plus clair. Le réflexe à en tirer est méthodologique — vérifier les hypothèses du moniteur, comparer adaptation et modèle gelé sous retour réaliste, et borner l’effet de chaque réponse protectrice.

La distillation de séries temporelles a ses propres règles. MemKD (Memory-Discrepancy Knowledge Distillation) montre que les méthodes de distillation conçues pour la vision négligent les dépendances temporelles et la rétention de mémoire propres aux modèles récurrents : sa fonction de perte capture l’écart de rétention entre professeur et étudiant sur les sous-séquences, ce qui permet des réseaux récurrents compacts et performants pour l’analyse en temps réel, y compris sur dispositifs portables.

🤖 Un modèle, deux lectures

Falcon-Emirati-7B du Technology Innovation Institute mérite une mention à part, parce qu’il démontre une thèse mesurable : la taille seule n’achète pas la compétence dialectale. Le modèle est bâti sur Falcon-H1-Arabic (architecture hybride Mamba + attention en parallèle dans chaque bloc, sorties fusionnées avant projection) et spécialisé sur l’arabe émirati. Sur Alyah, benchmark natif de 1 173 questions collectées manuellement, il atteint 84,83 %, devant tous les autres modèles arabes et multilingues comparés, y compris plusieurs modèles plusieurs fois plus gros.

Le chiffre le plus parlant est ailleurs, dans la fidélité dialectale en génération libre jugée par LLM : 0,52 en crédit partiel pour Falcon-Emirati-7B, contre 0,05 pour ALLaM-7B-Instruct-preview, 0,03 pour gemma-3-27b-it, 0,02 pour Jais-2-8B-Chat et pratiquement 0,00 pour Fanar-2-27B-Instruct. Autrement dit, les autres modèles connaissent souvent la bonne réponse mais la disent en arabe standard — même quand on les interroge directement en émirati. Le seul endroit où les concurrents tiennent est la catégorie « salutations et expressions quotidiennes », là où l’émirati et l’arabe standard se recouvrent le plus. Sur la tâche multiple-choice du benchmark ArabCulture-Dialogue (283 scénarios des Émirats), Falcon-Emirati-7B obtient 85,57 %, devant ALLaM-7B (83,39 %), Jais-2-8B (73,79 %) et Fanar-2-27B (71,50 %).

Mistral Large 4 complète le tableau côté échelle : un modèle multimodal de 1 000 milliards de paramètres, surnommé « Le Chonk », pour l’instant accessible seulement via un endpoint public avec garde-fous, les poids devant être publiés dans environ trois semaines après les tests de sûreté. Fait notable sur le plan industriel : ML4 a été entraîné entièrement sur le calcul de Mistral, avec seulement 4 000 GPU Nvidia — « deux à trois fois moins que nos concurrents chinois, et significativement moins que les concurrents à code fermé », selon Pierre Stock, VP Science. Les cas d’usage optimisés visent la cybersécurité, la finance et la conception de puces.

🎯 À retenir

  • Le cache KV est le nouveau champ de bataille. Trois approches complémentaires — représentation (AttSVD, 50 % de mémoire), contenu (MaskAhead, 9,5× à 20,1×), précision (SoloQ, −2,61× de mémoire pic) — montrent qu’on peut empiler les axes sans sacrifier la qualité dense. Elles sont mesurées contre l’inférence dense du même modèle : ne pas comparer les facteurs entre eux.
  • L’entraînement sans rétropropagation gagne. DART-ES (ES, passe avant seule) porte GSM8K de 72,07 % à 73,53 %, au-dessus des 73,26 % de GRPO, avec −15 à −50 % de temps par pas et −21 à −51 % de mémoire pic — et reste moins cher que GRPO+LoRA malgré le fine-tuning complet.
  • Le RL en 4 bits devient stable. TRIAGE stabilise le NVFP4 natif W4A4 sur les deux côtés (échantillonneur et apprenant), avec une performance de niveau pleine précision sur cinq benchmarks de raisonnement et jusqu’à 2,3× de débit de rollout.
  • Le guidage externe a une théorie. GA-GRPO borne le biais du guidage par la divergence en variation totale, donne le poids MSE-optimal en forme fermée et prouve une borne inférieure minimax : le biais est inévitable, mais il se pondère. À poids optimal, 31 % d’heures-GPU en moins.
  • Les MoE échouent par routage, pas par capacité. DRMoET optimise les issues de routage à forte perte plutôt que d’égaliser le trafic : 0,6625 → 0,6767 sur sept tâches à 10,3 B, avec −4,3 % de perte excédentaire sous mauvais routage forcé.
  • La confidentialité et l’oubli entrent dans le pipeline standard. Première garantie différentielle pour le RLVR (ε=8, 85-90 % du gain non privé conservé), et suppression exacte par soustraction (QSS) avec une latence attendue 4 à 483× plus faible que SISA.
  • Deux fondations vacillent : les connexions résiduelles des encodeurs de diffusion ne sont pas obligatoires (DDT-RFE, moins de blocs, meilleurs résultats), et Muon — théoriquement mal aligné sur la géométrie convolutive — reste aussi bon en pratique, probablement parce que l’orthogonalisation exacte sur-contraint les mises à jour.

La journée technique ne raconte pas une percée, mais une consolidation : chaque brique de la pile apprend à faire plus avec moins, et commence à être mesurée avec des garanties — taux de convergence, bornes minimax, budgets de confidentialité — plutôt qu’avec des courbes d’entraînement. C’est le signe qu’un domaine passe de la démonstration à l’ingénierie.

A lire aussi