Efficacité LLM : élagage MoE, cache KV inter-familles et distillation on-policy — la mesure tranche
💡 En résumé
Le lundi 28 septembre avait livré le contrat autour de l’agent. Le mardi 29 septembre livre son sous-sol matériel et statistique : comment faire tenir ces agents dans un budget de calcul, et surtout comment savoir si l’optimisation a réellement fonctionné.
Quatre familles de résultats, toutes adossées à des protocoles appariés ou à des mesures de contre-factuel :
- Élagage et parcimonie. OMP-MoE reformule l’élagage d’experts comme une reconstruction de signal sparse par poursuite orthogonale ; sur Qwen3-30B-A3B à 50 % de compression, il retient 93,3 % de la performance d’origine, avec une recherche 33× plus rapide et une inférence 1,55× plus rapide. Model Casting et LoPA Gating repoussent le plafond de vitesse : 3,2× de FLOP à qualité égale, contre 1,6× au mieux pour top-p et TEAL, et 3,31× réel sur GPU à 90 % de parcimonie, au-delà du plafond de 3× du gating standard.
- Communication entre agents. HeteroFold transfère le cache KV d’une famille de modèles à une autre sans prefill : à 32K de contexte, Llama-3.1-8B → Ministral-3-14B est 10,7× plus rapide qu’un prefill natif et 1,18 à 1,47× plus rapide que les meilleures bases sans prefill. CacheBack fait mieux conceptuellement : l’agent récepteur envoie une description de ses besoins, qui filtre et compresse le cache de l’émetteur — 75 % de l’état en moins, +14,7 points de précision et 3,2× de latence médiane en moins face à la communication textuelle.
- Post-training. La composition des étapes SFT, RLVR et distillation on-policy n’est pas neutre : une étape qui améliore le modèle courant peut dégrader l’efficacité de la suivante. Un simple échauffement SFT avant distillation, plus une adaptation du professeur par RLVR, fait passer la précision moyenne de distillation de 29,2 % à 43,8 % — soit 50 % de mieux à nombre d’étapes identique.
- Mesure. C’est le volet le plus important et le moins confortable. Le raisonnement concentre les erreurs : la probabilité que deux réponses fausses tirées indépendamment coïncident augmente dans 10 comparaisons sur 10 (p = 0,00098) sur 74 944 échantillons. Et sur 280 combinaisons méthode-dataset-modèle réparties sur huit modèles et cinq benchmarks, aucune ne bat le vote majoritaire simple après correction.
🔥 Tendances
La parcimonie sort du conditionnement pour entrer dans le silicium
L’élagage de mélanges d’experts a longtemps été un problème de sélection : quels experts supprimer. OMP-MoE le reformule en reconstruction de signal parcimonieux. Les contributions individuelles des experts deviennent des atomes de dictionnaire, et la sélection des experts minimise gloutonnement l’erreur de reconstruction — en complexité linéaire. Une stratégie de remplissage par niveaux (« water-filling ») optimise ensuite l’allocation des experts entre couches en tenant compte à la fois de la qualité de reconstruction et de la stabilité du routage. Enfin OMP-MoE† ajuste dynamiquement l’activation des experts selon une prédiction d’énergie. Les auteurs rapportent des gains constants à des taux d’élagage de 25 à 50 % sur Qwen, DeepSeek-V2, GPT-OSS et Mixtral.
Model Casting va plus loin en attaquant le plafond structurel. L’idée : calculer d’abord la sortie de la matrice de gating, et grâce à sa grande parcimonie, éviter tout calcul sur les deux autres matrices du réseau feed-forward — d’où un plafond de 3× sur les FLOP. Pour le dépasser, LoPA Gating paramétrise la matrice de gating avec moins de FLOP et de paramètres que les deux autres, libérant du budget. Deux régimes testés : projection d’un modèle préentraîné avec une activation induisant la parcimonie, ou entraînement LoPA depuis zéro. À 90 % de parcimonie, 3,31× de gain réel au GPU avec noyaux dédiés, quand la « RELU-fication » plafonne sous 80 % de parcimonie.
La leçon de méthode est nette : l’accélérateur théorique est une borne supérieure, et c’est le noyau dédié qui convertit le budget de FLOP en temps mural.
Le cache KV devient un objet de communication
C’est la bascule la plus intéressante de la journée. Tant que les agents communiquaient en texte, chaque récepteur repayait le coût de prefill d’un contexte déjà traité par l’émetteur. Deux travaux attaquent ce gaspillage, avec des philosophies opposées.
HeteroFold accepte l’hétérogénéité et la traite frontalement : les deux modèles restent gelés, mais il faut aligner les structures, reprojeter le cache de l’émetteur dans l’espace du récepteur et le calibrer pour préserver le comportement du récepteur — le tout en gérant les différences de tokenisation, de profondeur et de représentation KV. Il obtient les meilleures performances de transfert de cache sur les quatre benchmarks à contexte long et la plupart des réglages à contexte court, sur six directions de transfert, et égale la communication textuelle sur le benchmark multi-agents.
CacheBack part d’une observation plus fine : un agent n’a besoin de recevoir que ce dont l’agent récepteur a besoin pour sa tâche locale. Le récepteur transmet donc à l’émetteur une petite description de ses besoins informationnels, qui sert à filtrer et compresser le cache KV. L’implémentation est un conditionnement par les poids d’attention de l’émetteur, sans entraînement et robuste. Sur FanOutQA avec Qwen 3 : 75 % de l’état reçu en moins, +14,7 points de précision, 3,2× de latence médiane en moins. Le résultat tient à travers des familles de modèles couvrant les Transformers denses, les hybrides Mamba-attention et l’attention à fenêtre glissante — ce qui suggère un principe plutôt qu’un artefact d’architecture.
Le point dur reste le mur mémoire : un cache KV complet croît linéairement avec le contexte et avec le nombre d’agents qui coordonnent. Le conditionnement par le récepteur n’est pas une astuce de compression, c’est une réponse au fait que la plupart des agents n’ont pas besoin de ce qu’on leur envoie.
Post-training : l’ordre des étapes compte plus que leur contenu
Understanding the Synergy between SFT, RLVR, and OPD apporte le résultat le plus actionnable sur les pipelines modernes. Les auteurs caractérisent la distillation on-policy sur neuf paires élève-professeur, de 2× à 53× de rapport de paramètres, et montrent que son efficacité dépend de la compatibilité élève-professeur, non de l’échelle du professeur. Trois effets en découlent :
- Un bref échauffement SFT améliore la distillation qui suit, tandis qu’un élève renforcé par RLVR régresse sous distillation du même professeur.
- Adapter le professeur par RLVR augmente la précision aval proportionnellement à la capacité ajoutée.
- À précision comparable, la distillation laisse une meilleure initialisation pour le RLVR aval que le SFT, avec un écart qui se creuse à mesure que le calcul RL augmente.
Combinées, ces deux interventions — adaptation du professeur et échauffement de l’élève — font passer la précision moyenne de 29,2 % à 43,8 % après le même nombre d’étapes de distillation. La conclusion s’énonce comme une règle d’ingénierie : choisir chaque étape non pas pour la capacité qu’elle ajoute, mais pour l’interface d’apprentissage qu’elle crée pour la suivante.
Train4Merge durcit un choix rarement examiné : faut-il construire chaque expert de domaine par SFT ou par RL quand ils serviront de professeurs dans une distillation on-policy ? À performance comparable sur Qwen3.5-9B, les professeurs RL guident mieux que les professeurs SFT : +4,27, +1,50 et +0,86 points en agentique, raisonnement et perception. Le contraste le plus net est en agentique, où le meilleur élève guidé par SFT ne récupère que 44,44 % du gain de son professeur, contre 115,00 % pour l’élève guidé par RL — qui le dépasse donc. L’explication avancée est géométrique : les professeurs RL restent beaucoup plus proches de l’initialisation partagée en espace de paramètres, et sont donc plus faciles à suivre.
Instruct, Not Answer renverse enfin un présupposé de la distillation de contexte on-policy. La pratique courante conditionne le professeur sur des réponses ou démonstrations spécifiques à l’instance ; cela nuit aux performances, surtout hors distribution. Remplacer ce privilège par des instructions générales ciblant les erreurs fréquentes des élèves fait mieux : sur ProverQA, ProofWriter et ProntoQA, avec les familles Qwen3-Thinking et Olmo3-Thinking, les privilèges par instruction appariée battent l’or hors distribution dans 7 expériences sur 8, de 4 à 17 points, à parité en domaine. Chaque instruction ne fait que quelques phrases et s’applique uniformément à tous les exemples d’entraînement.
MaD-RL complète le tableau en s’attaquant à un effet secondaire documenté : les recettes dominantes type GRPO réduisent la diversité des sorties en concentrant la probabilité de politique sur un seul mode. La régularisation d’entropie et la température aident mais restent limitées à l’espace des jetons et orientées vers des distributions uniformes. Les auteurs généralisent le problème en appariement de distribution sur un attribut catégoriel latent, montrent que les travaux antérieurs sont un cas particulier impliquant la divergence L2, et proposent des fonctions de récompense pour KL et Jensen-Shannon.
🤖 Nouveaux outils
Quantification : le résultat vit dans le produit, pas dans l’arrondi
Product-Aware Deterministic Rounding for Quantized Matrix Multiplication attaque un point où l’on fait habituellement de l’heuristique locale. Les décisions d’arrondi scalaire interagissent à travers la multiplication matricielle : ce n’est donc pas chaque scalaire qu’il faut bien arrondir, mais le produit. Après fixation des échelles, des bornes de clipping et des grilles, la réduction par espace nul préserve le produit relâché en ne laissant au plus r décisions fractionnaires, où r est le rang du bloc de poids pondéré par les écarts actifs. La complétion par espérance conditionnelle donne un algorithme déterministe en temps polynomial dont l’erreur produit au carré est majorée par OPT + r·ν²max/4. Les chiffres sont parlants : sur des blocs équilibrés avec K = 1024 et r = 16, l’erreur médiane normalisée par dithering tombe à 0,010, contre 0,899 pour l’arrondi au plus proche. Une initialisation tenant compte du clipping réduit l’erreur médiane normalisée d’un facteur 43,4 à 10 % de clipping. Résultat annexe à retenir : l’optimisation exacte est NP-difficile même à rang un.
Comprendre ce que la compression retire vraiment
Same-State Causal Restoration pose la bonne question pour les modèles de langage par diffusion : ce qui compte n’est pas l’erreur locale d’approximation, mais quels calculs retirés changent réellement la trajectoire de débruitage aval. La méthode restaure le FFN d’origine sur l’entrée exacte atteinte par le modèle compressé et mesure le changement de trajectoire — première mesure directe de l’effet en boucle fermée à entrée courante identique. Sur LLaDA-8B-Instruct et Dream-v0-Instruct-7B, l’état côté compressé classe cet effet aval bien mieux que l’erreur quadratique locale à phase de débruitage fixée ; les interventions contrôlées montrent que la structure de la correction compte au-delà de son amplitude. Sous compression agressive de LLaDA, restaurer quatre transitions récupère 89,9 % de la précision perdue en conservant environ 36,8 % d’économie de MAC à l’échelle du modèle, et bat une base d’erreur locale à budget égal.
On-Policy Attention Linearization traite le cas où la distillation de modèles hybrides s’effondre sur les tâches longues. Le diagnostic est juste : les couches d’attention linéaire doivent compresser le contexte dans un état de taille fixe, donc leurs erreurs se composent sur les longues séquences, et la distillation hors politique n’apprend jamais à l’élève à se remettre de cette dérive. La réponse est de laisser l’élève hybride échantillonner ses propres trajectoires longues et recevoir une supervision dense du professeur attention-complet gelé. Sur Qwen3-4B et MiMo-7B-RL-0530 : 87 à 94 % de la performance attention-complete en raisonnement de sens commun, 100 % en recherche aiguille-dans-botte-de-foin, 83 à 93 % en raisonnement mathématique, avec seulement 3 milliards de jetons d’entraînement — sans SFT ni RLVR. La meilleure méthode antérieure récupérait 68 % en récupération et 21,6 % de précision absolue en mathématiques.
What Does the Rank Buy? démolit une intuition très répandue sur LoRA : sous des budgets de norme par facteur — l’idéalisation du weight decay et du contrôle de norme utilisés en pratique —, l’ensemble des mises à jour atteignables est exactement constitué des matrices de rang au plus r dans une boule de norme nucléaire, et chaque fonctionnelle de complexité ou de déplacement analysée est maximisée par une mise à jour de rang un. Le plafond de rang ne mord donc jamais : la classe de lecture linéaire étudiée est identique pour tout r ≥ 1, sa complexité de Rademacher ne dépend pas de r. Le rang gouverne en réalité quelles mises à jour sont atteignables et ce que coûte l’annulation des directions singulières dominantes du poids préentraîné — pas la capacité du modèle.
Modèles ouverts et plateformes
Holo4 est un cas d’école de parcimonie appliquée en production : 27B dense et 35B-A3B en mélange d’experts, un modèle unique qui agit par interface graphique, par code, par MCP ou par API selon la tâche, là où la plupart des modèles agentiques sont entraînés pour une seule interface. Il est entraîné par apprentissage supervisé et par renforcement sur des environnements et des tâches — dont ceux générés par une « Agentic Task Factory » interne. Sur OSWorld 2.0 : 61,7 % pour la variante 27B contre 81,8 % pour Opus 5.5, et 30,9 % pour la 35B-A3B. Les écarts sur les flux longs sont réels ; le point notable est le budget de paramètres, et le fait que les trajectoires derrière les scores publics sont publiées et rejouables.
Côté plateformes, deux mouvements de lisibilité. Anthropic sort Sonnet 5.5, présenté comme 30 % plus rapide que son prédécesseur avec une consommation de jetons nettement plus lente ; ses benchmarks le donnent meilleur qu’Opus 5.5 en codage agentique, notamment parce qu’il peut lancer plusieurs agents sans dépasser les limites de coût. Anthropic indique aussi que 5.5 est le premier Sonnet soumis aux mêmes garde-fous cyber que Fable et Opus. Google retire les « Gems » de Gemini au profit de « skills » à partir du 17 novembre 2026, avec migration automatique — un signe que la personnalisation par assistant dédié cède la place à des compétences transverses.
📊 Analyse
Le raisonnement concentre les erreurs, et l’auto-cohérence ne le voit pas
C’est le résultat le plus dérangeant du jour, et il faut le lire lentement. L’auto-cohérence repose sur une hypothèse : des échantillons indépendants divergent quand le modèle est incertain, donc leur accord est une preuve de correction. En gardant les poids fixes et en ne basculant que le mode de raisonnement, les auteurs montrent sur cinq benchmarks et 74 944 échantillons que le raisonnement concentre les erreurs du modèle : la probabilité que deux réponses fausses tirées indépendamment coïncident augmente dans les dix comparaisons à l’échelle du jeu de données (p = 0,00098), et dans neuf cas sur neuf après restriction aux problèmes que chaque mode se trompe. Là où l’espace de réponses est non borné, le raisonnement réduit le nombre de réponses distinctes produites à 0,43-0,65 du compte hors raisonnement ; là où il est borné, les deux modes partagent le même ensemble d’options et le raisonnement y concentre simplement la masse — ce qu’aucun a priori positionnel n’explique à poids fixes.
Le coût agrégé est plus faible que ce que le mécanisme prédit, parce que le raisonnement réduit aussi, dans dix cellules sur dix et d’un facteur 2,7, l’ensemble des problèmes où la diversité des réponses peut décider quelque chose. Mais le verdict final est sans appel : sur 280 combinaisons méthode-dataset-modèle couvrant huit modèles et cinq benchmarks, aucune ne bat le vote majoritaire simple après correction ; le vote pondéré par la confiance est d’accord avec lui sur 98,5 % des paires problème-méthode et n’a raison que 56,3 % du temps sur le reste. Plus troublant : la direction d’un signal peut s’inverser à poids fixes — la log-probabilité de la réponse prédit la correction quand le raisonnement est désactivé et l’erreur quand il est activé. Une combinaison apprise de six signaux n’apporte rien hors domaine. La recommandation méthodologique mérite d’être affichée : évaluer les signaux de confiance sur les décisions, pas sur la discrimination.
Les moniteurs d’activation absorbent le bruit numérique, pas le changement de texte
Same Probe, Different Numbers apporte une réponse rare : une mesure fine de la robustesse réelle des sondes d’activation au non-déterminisme numérique à l’inférence. Un classique du déploiement : la sonde est entraînée sous une configuration, puis utilisée sous la taille de lot et la précision que la pile de service impose — or les noyaux GPU courants ne sont pas invariants en taille de lot et les formats flottants arrondissent différemment. Sur Llama-3.1-8B, Qwen3-8B et Gemma-3-4B, avec 768 sondes entraînées sur une configuration et évaluées sur toutes les autres, puis comparaison verdict par verdict :
- Au niveau du prompt, la précision ne bouge jamais de plus de 0,47 point sur 1 392 transferts et seulement 0,076 % des verdicts changent ; en float32 avec seule la taille de lot variée, aucun des 201 960 verdicts ne change.
- Pendant le décodage, le taux de bascule monte à 2,8 % — mais les lignes dont les jetons réalisés correspondent ne basculent que dans 0,12 à 0,15 % des cas, contre 12,9 % pour les lignes dont les jetons divergent. La cause est le texte, pas l’arithmétique.
- Un changement de taille de lot en bfloat16 fait basculer le premier jeton généré pour 2,1 % des lignes et en laisse 25 % sur des jetons différents au vingtième.
Sous le capot, les activations bougent à peu près autant que l’arrondi du format : un changement de taille de lot en bfloat16 les perturbe d’une norme L2 relative médiane de 1e-2, environ 8× la valeur en float16. Conclusion opérationnelle : les sondes absorbent ce bruit, l’argmax du modèle lui-même non. Et surtout, la mesure agrégée est le mauvais instrument — elle sous-estime d’un facteur 2 à 9 le nombre de verdicts qui changent. Toute évaluation de robustesse d’un moniteur d’activation devrait rapporter l’accord par exemple, séparer le bruit représentationnel du changement d’entrée et déclarer la configuration de service.
Les filtres de refus ne survivent pas à la compression du cache
When Keywords Drop but Classifiers Hold prolonge exactement cette logique du côté sûreté. La compression de cache KV est utilisée partout pour le contexte long ; les systèmes déployés évaluent typiquement les refus après génération, par filtres à mots-clés ou classifieurs appris. La question : une compression qui préserve la précision de tâche préserve-t-elle l’accord entre un moniteur lexical léger et un classifieur de refus plus fort ? Protocole apparié sur 200 prompts nuisibles avec un long contexte de remplissage, chaque prompt traité une fois en rétention complète et une fois après éviction appariée. Sur Qwen2.5-3B, le refus par mots-clés tombe de 98,0 % à 80,5 % (McNemar p ≈ 1e-8) tandis que le refus vu par le classifieur reste proche du plafond (99,0-99,5 %) et que la précision MMLU ne bouge pas (50,0 %). Les étiquettes humaines suivent majoritairement le classifieur, ce qui est cohérent avec des refus mous : le modèle a bien décliné, mais sans les tournures que les heuristiques lexicales reconnaissent. L’écart n’est pas universel — il s’atténue avec des remplissages courts et un SnapKV apparié. Règle à en tirer : un audit de sûreté sous compression doit s’appuyer sur plusieurs juges appariés au contexte de service, jamais sur le seul taux de refus lexical.
Provenance, causalité et recherche autonome
Witness Overlap règle un problème que les méthodes de provenance symétriques ne peuvent pas régler. Les comparaisons par similarité de représentation, de poids ou d’empreinte comportementale détectent la parenté mais ne peuvent pas orienter la relation entre deux points de contrôle A et B. L’idée est locale et élégante : ajouter un troisième point de contrôle de la même famille comme témoin et comparer la géométrie autour de chaque extrémité candidate, la direction étant inférée en demandant lequel des candidats se comporte comme le parent divergent. Sur 176 points de contrôle issus de 16 familles, le test à un témoin oriente 95,3 % des décisions parent-enfant par cosinus de Frobenius, avec des évaluations complémentaires sur l’identification de racine, la discrimination de fratrie, la généralisation aux familles VLM et de diffusion, et l’ordonnancement en chaîne. Le signal résiste au bruit de poids et à l’élagage sparse, une variante par réduction SVD étant plus robuste que le cosinus de Frobenius.
Active Causal Discovery Benchmark fournit au passage un exercice de lucidité rare. Sur une échelle à six niveaux, la meilleure méthode non oracle est PC avec heuristique d’orientation active gloutonne — F1 dirigé de 42,7 %, SHD 4,79 — devant Claude Sonnet 4.6 en actif brut (31,7 %, 7,25) et GPT-5.4 (22,9 %, 9,27). La décomposition précision-rappel est le diagnostic le plus informatif : PC sous-engage avec une précision élevée, les LLM sur-engagent avec une précision plus faible, et l’accès à des outils statistiques augmente souvent l’abstention plutôt que l’intervention utile. Une base structurellement aveugle à DAG aléatoire atteint 23,6 % de F1 dirigé, et une sonde de densité abaisse ce plancher à 16,9 %. Les auteurs le disent eux-mêmes : ces résultats doivent être lus comme un audit de benchmark et un rapport de calibration, pas comme la preuve que les LLM résolvent la découverte causale active.
Autonomous Research Project Management as an Agent Skill ferme la boucle avec une démonstration reproductible d’agent sur matériel grand public : un solveur de régression ridge à noyau fondé sur la FFT pour grilles spatiales régulières, sur 2005 champs mensuels d’anomalie NOAA Kaplan SST v2, exécuté par DeepSeek V4 Flash sur un Apple M2 Pro en CPU seul (78,7 s, pic de 1,57 Go de RSS). L’état longue durée est découplé dans un substrat de suivi de type epic/issue sur fichiers. Sur 74 sessions de sous-agents, l’agent fait preuve d’une résilience scientifique en boucle fermée : deux barrières de revue d’hypothèse échouées routées vers la récupération bibliographique, correction de bogues d’indexation bootstrap, et seulement quatre événements de pilotage humain. La conclusion des auteurs appartient à la gouvernance : la crédibilité scientifique exige un état inspectable, des barrières de revue falsifiables et un reporting transparent des résultats négatifs.
Noisy Test-Time Reinforcement Learning for Code LLMs ajoute une brique utile côté robustesse : tirer parti de données bruitées non étiquetées au moment du test, avec auto-débruitage conservateur pour obtenir une ancre sémantique plus propre et agrégation structurelle par arbre syntaxique abstrait pour estimer une cible proxy à partir de plusieurs programmes candidats, la politique étant optimisée par une récompense hybride validité de format, similarité de code et anti-répétition.
🎯 À retenir
- La mesure agrégée est l’ennemi du diagnostic. Elle sous-estime de 2 à 9× combien de verdicts changent ; elle fait passer le vote majoritaire pour battable alors qu’aucune des 280 méthodes testées ne le bat. Compter les décisions, pas les corrélations.
- Compresser et évaluer ne sont pas des opérations séparables. Le refus par mots-clés chute de 98,0 % à 80,5 % sous éviction de cache quand le classifieur reste au plafond : le moniteur doit être mesuré sous le régime de service réel.
- Le rang de LoRA ne contrôle pas la capacité. Sous budgets de norme par facteur, une mise à jour de rang un maximise toute fonctionnalité de complexité analysée ; le rang dit quelles mises à jour sont atteignables et ce que coûte l’annulation.
- L’ordre des étapes de post-training vaut plus que leur contenu. Échauffement SFT avant distillation et adaptation RLVR du professeur : 29,2 % → 43,8 %. Un professeur renforcé par RL transmet mieux parce qu’il reste proche de l’initialisation partagée (115 % du gain transmis contre 44 % par SFT).
- Le transfuge de cache KV entre agents est déjà là. 75 % d’état en moins et 3,2× de latence en moins pour CacheBack, 10,7× plus rapide qu’un prefill natif pour HeteroFold à 32K : le texte comme protocole de communication entre agents n’était qu’une étape.
- Rien ne remplace la mesure causale. C’est la leçon commune de la restauration d’état identique pour les modèles de diffusion — quatre transitions restaurées récupèrent 89,9 % de la précision perdue — et du regain de récupération en boucle fermée par distillation on-policy.