Distillation on-policy, quantification sub-1-bit et le plafond du vote majoritaire
Distillation on-policy, quantification sub-1-bit et le plafond du vote majoritaire
💡 En résumé — La journée du 30 septembre 2026 est un condensé de ce qui se joue aujourd’hui dans l’inférence : la distillation on-policy passe d’astuce empirique à objet théorique, la quantification descend sous le bit par poids sur des modèles de 0,6 à 4 milliards de paramètres, le routage cesse d’empiler des modèles indépendants pour maximiser la couverture, et le vote majoritaire — pilier du test-time scaling — se révèle plafonné par un effet mesurable de saturation. Quatre familles de résultats, un même enseignement : les gains restants ne sont plus dans le modèle, mais dans la manière de l’interroger et de le compresser.
🔥 Tendances : la distillation on-policy devient une théorie
L’idée de la distillation on-policy (OPD) est simple : plutôt que d’imiter les réponses d’un professeur sur des données hors distribution, on fait générer les trajectoires par l’élève lui-même et on fait superviser chacune d’elles, densément, par le professeur. La promesse est de réduire l’oubli par rapport à un simple fine-tuning supervisé. La fragilité, elle, restait inexpliquée.
Understanding Off- vs On-Policy Distillation (arXiv 2609.38666) comble le trou. En étudiant la distillation séquentielle depuis plusieurs professeurs — l’élève minimisant sa divergence moyenne — les auteurs montrent que la KL directe produit un mélange arithmétique pondéré tandis que la KL inverse produit un agrégat géométrique pondéré normalisé. Ils développent des algorithmes pour apprendre ces cibles sous retour hors-politique et on-politique respectivement, avec des bornes de regret logarithmiques dans le cadre tabulaire, puis étendent l’analyse à l’approximation de fonctions. Le résultat pratique est un arbitrage clair : la KL inverse retient mieux les préférences d’un expert confiant quand le retour est peu informatif, mais elle est plus sensible aux professeurs qui attribuent une très faible probabilité aux réponses correctes. Pire, ses conditionnelles au niveau du jeton révèlent une dépendance aux distributions de continuation qui peut favoriser des préfixes incorrects sur de longs horizons. Autrement dit : le choix de la divergence n’est pas un détail d’implémentation, c’est un choix de biais.
On the Off-Policy Teacher in On-Policy Distillation (arXiv 2609.38360) identifie l’asymétrie structurelle qui ronge l’OPD : les trajectoires échantillonnées sont on-policy pour l’élève, donc off-policy pour le professeur. Or le professeur a été optimisé pour continuer des préfixes générés par sa propre politique. Empiriquement, ses performances de continuation se dégradent à mesure que ces préfixes s’allongent. La réponse, SCOUT (Student-COnditioned Updates of the Teacher), est un cadre de co-entraînement qui adapte périodiquement le professeur aux préfixes de l’élève par apprentissage par renforcement à récompenses vérifiables : le professeur génère des continuations depuis les préfixes de l’élève et apprend des récompenses de résultat. Sur des configurations, échelles et domaines variés, SCOUT améliore systématiquement l’efficacité de l’OPD.
Deux variantes de self-distillation complètent le tableau. Activation-Conditioned Self-Distillation (arXiv 2609.38342) extrait un vecteur de guidage en contrastant les activations des trajectoires auto-générées qui atteignent une réponse vérifiée correcte dans le budget de génération avec toutes les autres. Une copie gelée du modèle de base applique ce vecteur à chaque position de prédiction ; la distillation ne requiert ni texte de référence spécifique au problème, ni mise à jour des paramètres du professeur. Sur cinq modèles, ACSD obtient la meilleure exactitude moyenne sur quatre benchmarks mathématiques ; sur DeepSeek-R1-0528-Qwen3-8B, 71,9 % de moyenne mathématique et 70,9 % de pass@12 sur LiveCodeBench v6, contre 69,0 % et 66,3 % pour la baseline OPSD conditionnée par référence. GAD-RL (arXiv 2609.38282) traite le cas de la fidélité OCR, où les modèles vision-langage réécrivent un texte anormal en expression plausible. Constat : la supervision d’un professeur fixe devient progressivement moins favorable à mesure que l’élève progresse — à travers les checkpoints et entre groupes de réponses de récompenses différentes. GAD-RL désactive la distillation pour tout groupe contenant une sortie à récompense ≥ 0,95 et atténue continûment sa force à mesure que la récompense moyenne du groupe monte, en pondérant la KL directe par la probabilité que l’élève accorde au top-1 du professeur. Sur Qwen3.5-2B : 59,92 % de Micro Recall sur CHAOS-Bench, soit +8,45 et +4,43 points devant GRPO et GRPO+OPD à poids fixe, et 91,18 de score global sur OmniDocBench v1.6. UniEvo-VL (arXiv 2609.38721) étend l’idée au multimodal : un seul modèle joue professeur et élève avec des contextes différents, la distillation minimisant la divergence par état entre distributions de débruitage sur les trajectoires d’échantillonnage de l’élève. Sur Qwen-image-2512 : GenEval passe de 0,747 à 0,808 et GenEval2 Soft-TIFA de 32,97 à 35,53.
🤖 Nouveaux outils : sous le bit, et par couverture
Quantification sub-1-bit. ShamAN-Q (arXiv 2609.38521) étend NanoQuant en remplaçant sa géométrie de reconstruction diagonale par une métrique de courbure dense tractable, dans le paradigme popularisé par l’optimiseur Shampoo. Pour chaque matrice de poids, ShamAN-Q ajuste un produit de Kronecker à la matrice d’information de Fisher empirique d’un petit jeu de calibration, par minimisation de la divergence de Kullback-Leibler, formant une perte de reconstruction de Mahalanobis. Les mises à jour ADMM continues de NanoQuant deviennent des solutions d’équations de Sylvester, le format de projection et de déploiement restant inchangé. La courbure étant locale, la statistique est remesurée couche par couche juste avant factorisation, avec rafraîchissement périodique sur le modèle partiellement quantifié. Résultats sur Qwen3-Base à ≈1 bit par poids, en perplexité WikiText-2 : 27,56 → 22,96 (0,6B), 19,21 → 16,72 (1,7B), 14,29 → 13,80 (4B), avec une exactitude zero-shot égale ou meilleure sur le harness Eleuther. Sur le 0,6B, ShamAN-Q à ≈0,8 bpw égale la perplexité publiée de NanoQuant à ≈1,0 bpw.
JARQ (arXiv 2609.38599) part d’une observation qui devrait déranger : les quantifieurs post-entraînement par groupes arrondissent les poids sur une grille qui n’est jamais réajustée aux codes entiers résultants. Or la meilleure grille dépend des codes, les corrélations d’entrée couplent les erreurs de différents groupes, et les changements utiles portent souvent sur beaucoup de codes à la fois. JARQ alterne un ajustement conjoint aux moindres carrés de toutes les échelles de groupe et des propositions bornées de type Babai déplaçant plusieurs codes ensemble sur la grille courante. Le problème est un moindres carrés bilinéaire en nombres entiers mixtes à contraintes de boîte ; le solveur est sans rétropropagation, ne dégrade pas l’objectif par couche sous résolution exacte des échelles, et conserve largeur de bits, groupes, points zéro et coût d’inférence de l’hôte. Sur Llama-2, Llama-3 et Qwen avec RTN, GPTQ, OmniQuant et AWQ : JARQ réduit la perplexité dans 90 des 96 comparaisons, coupe jusqu’à 36 % la perplexité RTN en 3 bits, améliore l’exactitude QCM moyenne dans 23 des 24 configurations, et tourne en moins d’une minute par bloc de 7 milliards.
Routage par couverture. FlexRouter (arXiv 2609.38585) attaque un défaut de conception : les routeurs existants notent les LLM indépendamment pour choisir les top-k, ce qui ignore les corrélations entre modèles et impose un budget de calcul rigide. Résultat, ils sélectionnent souvent des modèles redondants qui partagent leurs modes d’échec. FlexRouter modélise explicitement la complémentarité et optimise la couverture de réponse : la probabilité qu’au moins un modèle sélectionné produise une réponse correcte — objectif aligné sur les pipelines réels où plusieurs candidats sont générés puis départagés par un vérificateur ou l’utilisateur. Le routage devient un problème de sélection de sous-ensemble orienté couverture, modélisé par processus ponctuels déterminantaux (DPP), qui capturent naturellement compétence et redondance. À l’inférence, une stratégie gloutonne sur les gains marginaux du log-déterminant permet au routeur de déterminer la taille du sous-ensemble sans budget prédéfini. Sur RouterEval : couverture plus haute et redondance plus faible, en distribution comme hors distribution.
Test-time scaling : le plafond du vote. Provable Test-Time Scaling for Beam Search (arXiv 2609.38672) donne enfin une théorie du beam search. Le papier établit une borne inférieure pour le beam search vanilla : au moins Ω(C(x)²)* échantillons sont nécessaires pour que la réponse optimale survive, où C*(x) est le coefficient de couverture au niveau du jeton. Cela motive CF-Beam (confidence-filtered beam search), qui réduit la dépendance suffisante en couverture du quadratique à quasi-linéaire sous compétitivité de préfixe. Le regret de CF-Beam est borné supérieurement par la probabilité d’événements de défaillance rares et l’erreur d’estimation de récompense mise à l’échelle par un coefficient de couverture au niveau du chemin. La conclusion est une avantage fondamental du beam search sur les méthodes au niveau séquence comme Best-of-N et Best-of-Majority : là où leurs garanties impliquent des coefficients de couverture exponentiels en l’horizon L, CF-Beam contrôle le terme dominant via un coefficient polynomial en L.
Diversity Combining for Multi-Path LLM Reasoning (arXiv 2609.38829) formalise le vote majoritaire comme un problème de combinaison de diversité emprunté aux communications sans fil : chaque chemin de raisonnement est une observation bruitée, et la corrélation par paires de la justesse des chemins plafonne la taille d’échantillon effective du vote à un seuil fini. Une analyse par moindres carrés généralisés montre que, sous échangeabilité, le combinateur linéaire symétrique optimal des plongements latents est uniforme — ce qui valide le vote majoritaire comme défaut naturel en self-consistency standard, tout en laissant la place à pondération ou élagage sous branches de gabarits hétérogènes. Sur 5 modèles et 12 benchmarks, la diversité de gabarit de prompt réduit la corrélation des chemins dans 55 des 57 cellules valides, avec l’effet le plus fort en questions-réponses ouvertes. Une règle Adaptive-K utilisant un pilote de quatre chemins permet de choisir K* et retient 96-103 % de l’exactitude de MV@K=32 sur les maths, les questions-réponses et le NLU, avec un coût moindre.
Budget Boundary Effects in Test-Time Mathematical Reasoning (arXiv 2609.38699) mesure un arbitrage rarement explicité, à partir de 19 200 traces publiques rejouées hors ligne (120 problèmes AIME, BrUMO et HMMT, deux configurations d’archive) : quand un plafond cumulatif de jetons tombe au milieu d’une dérivation, faut-il s’arrêter net (strict) ou laisser la tentative en cours se terminer (advisory) ? Trois enseignements. Au plafond 4K, la plupart des gains de précision en mode advisory remplacent une abstention par une bonne réponse ; l’arrêt strict « paie » un préfixe inachevé inutilisable par le sélecteur. Les comparaisons le long du coût réalisé diffèrent des comparaisons à plafond égal : advisory 4K en régime bas dépasse strict 8K à coût moyen de complétion comparable, tandis qu’en régime haut son exactitude observée est 0,42 point sous strict 32K en utilisant 59 % de ses jetons moyens. Enfin, augmenter la couverture des candidats ne garantit pas une meilleure exactitude : un sélecteur par log-probabilité perd de l’exactitude alors que la couverture monte, y compris après réparation de cohérence. Les auteurs plaident pour que toute courbe de budget déclare conjointement le plafond, le coût réalisé, les candidats éligibles, la règle d’arrêt et l’information du sélecteur.
Infrastructure et mécanismes. Decode-Latency Feedback Prefill (arXiv 2609.38386) implémente dans vLLM un contrôleur sans modèle qui ne modifie que le travail de préremplissage recouvrant les décodages actifs. Sur A100 80 Go avec Qwen3-0.6B en BF16, trois essais appariés de 100 requêtes réduisent la latence inter-jeton P99 de 24,8 %, 30,1 % et 28,2 % (moyenne 27,7 %), avec sorties strictement identiques. Le bénéfice n’est pas gratuit — le temps moyen jusqu’au premier jeton en P99 augmente de 34,8 % — et surtout le mécanisme ne se généralise pas à Qwen3-8B, Qwen3-32B ni à une configuration bi-GPU à parallélisme tensoriel : l’intervalle d’appel asynchrone du scheduler n’est qu’un proxy du temps d’itération GPU réellement terminé. Un résultat négatif propre, qui définit la frontière de la contribution. Revisiting scaling laws for reward optimization (arXiv 2609.38526) donne la loi d’échelle qui manquait : la performance évolue approximativement comme Θ(√min{log(M), K}), où M est le nombre de comparaisons d’entraînement et K le budget de divergence de la politique, avec un ajustement de R² de 97 % à 99 % — la sur-optimisation y apparaît comme un problème de sélection parmi des variables gaussiennes i.i.d. sous retour bruité. Function-Space Transformer (arXiv 2609.38348) propose de stocker les caractéristiques à des ancres dont les positions sont prédites depuis les observations et raffinées récursivement, dépassant nettement Perceiver IO sur Burgers et Darcy et rivalisant avec le Fourier Neural Operator. Enfin, Reflect Reverse (arXiv 2609.38536) explique mécaniquement pourquoi les agents fondés sur des modèles à diffusion tombent dans des boucles de réessai : le décodeur masqué engage la position la plus confiante, et dans un état d’échec le contexte offre déjà comme remplissage confiant… l’action qui vient d’échouer. Le facteur responsable est aveugle à la tâche, donc il s’annule exactement dans la conditionnelle inverse — que les dLLM évaluent nativement en masquant les jetons de tâche, pour quelques passes parallèles. Le remède est sans entraînement.
📊 Analyse : quatre leviers, une même discipline
Ce que ces vingt travaux partagent, c’est une discipline de mesure plus dure.
Premier constat : le gain d’un composant dépend de l’endroit où on l’applique. JARQ ne touche pas aux codes, seulement à la grille — et coupe 36 % de perplexité en 3 bits. GAD-RL ne fait que moduler la force de la distillation selon la performance de l’élève, et gagne 8,45 points sur GRPO. ShamAN-Q ne change que la géométrie de reconstruction et fait passer un modèle de 0,6B en qualité à 0,8 bpw là où NanoQuant l’atteint à 1,0 bpw. La marge restante n’est plus dans les algorithmes eux-mêmes, mais dans leur calibrage conditionnel.
Deuxième constat : les garanties asymptotiques changent la conclusion. Le beam search est souvent présenté comme un coûteux luxe ; la borne Ω(C*²) et la réduction à une dépendance quasi-linéaire sous CF-Beam renversent le raisonnement — ce sont Best-of-N et Best-of-Majority qui souffrent de coefficients exponentiels en l’horizon. De même, l’analyse de « Diversity Combining » explique pourquoi le vote majoritaire sature : ce n’est pas un défaut d’échantillonnage, c’est une corrélation entre chemins. Cela déplace l’effort d’optimisation : plutôt que d’augmenter K — celle de l’argent dépensé sur l’inférence — mieux vaut augmenter la diversité des chemins, ce que la variation des gabarits de prompt réalise dans 96 % des cellules testées.
Troisième constat : les résultats négatifs sont aussi précieux que les positifs. Decode-Latency Feedback Prefill soulage le P99 inter-jeton de 28 % sur un modèle de 0,6B et ne fonctionne pas sur 8B, 32B ou deux GPU — les auteurs tracent explicitement la cause. Budget Boundary Effects conclut que surcoûter des candidats peut dégrader l’exactitude. Reflet Reverse montre qu’un mécanisme d’échec identifié (le facteur aveugle à la tâche) peut être exactement annulé sans entraînement. Dans une industrie portée à surinterpréter tout gain, cette culture du résultat borné mérite d’être signalée.
Quatrième constat : la mesure elle-même devient le produit. Le Open TTS Leaderboard publié sur le blog Hugging Face part d’un constat chiffré : au 30 septembre 2026, le Hub compte plus de 8 000 modèles TTS, et pourtant « seuls 16 des 92 modèles d’Artificial Analysis sont à poids ouverts ». Raison invoquée : une arène doit héberger et servir chaque modèle ouvert, alors qu’un modèle d’API ne demande qu’une clé — et les fournisseurs commerciaux ont plus d’intérêt à se placer que les auteurs open source. La réponse du leaderboard est de remplacer le vote humain par des métriques objectives complémentaires : intelligibilité (WER/CER via Qwen3 ASR, meilleur modèle ouvert du Open ASR Leaderboard), vitesse (RTFx pour l’inférence par lots sur H200 et TTFA pour le streaming batch 1 sur H200 et CPU), et similarité de locuteur (similarité cosinus entre plongements WavLM de l’audio généré et de la référence). Le coût d’évaluation d’un modèle passe d’« une paire de semaines » à « une paire d’heures ». Les auteurs prennent soin de préciser la limite : ces métriques ne remplacent pas la préférence humaine, ne mesurent ni le naturel, ni l’expressivité, ni le plaisir d’écoute — et peuvent tout au plus informer les arènes sur les modèles à inclure. Têtes de classement en WER anglais moyen sur Seed TTS Eval et CV3 Eval : Kokoro-82M, supertonic-3 et s2-pro ; en multilingue, OmniVoice, s2-pro et Fun-CosyVoice3-0.5B-2512.
ArgGYM (arXiv 2609.38409) clôt la journée sur un rappel méthodologique : après le succès des benchmarks à récompense vérifiable en maths, code et logique formelle, il reste incertain que ce succès transfère au raisonnement sous information incomplète et révisable. Le benchmark décompose le raisonnement défaitable en douze tâches, ancrées dans un moteur d’argumentation symbolique qui calcule les états formels servant à évaluer les sorties, avec 1 440 instances vérifiées, quinze configurations de curriculum et deux ordres de préférence d’arguments. Les profils des modèles frontière et ouverts divergent nettement, et la performance décline dans les configurations tardives à dépendances longues. L’ensemble (générateurs + vérificateurs) est libéré, ce qui permet de produire des instances fraîches à la demande.
🎯 À retenir
- Le choix de la divergence de distillation est un choix de biais : la KL inverse retient mieux un expert confiant mais sur-pénalise les professeurs hésitants et peut favoriser des préfixes incorrects sur de longs horizons.
- Le professeur est off-policy pour lui-même : ses performances de continuation se dégradent avec la longueur des préfixes de l’élève — SCOUT corrige en co-entraînant le professeur sur ces préfixes.
- Sous le bit, c’est possible : ShamAN-Q atteint ≈0,8 bpw au niveau de qualité de NanoQuant à 1,0 bpw ; JARQ coupe jusqu’à 36 % de perplexité RTN en 3 bits sur 90 des 96 comparaisons.
- Le vote majoritaire a un plafond structurel : la corrélation entre chemins borne l’échantillon effectif. La réponse est la diversité des gabarits, pas l’augmentation de K.
- Le beam search a une garantie polynomiale là où Best-of-N a une garantie exponentielle : sur des horizons de raisonnement croissants, l’avantage est fondamental, pas marginal.
- Ce qui ne se généralise pas doit être dit : le contrôleur de préremplissage qui gagne 28 % sur 0,6B ne fonctionne pas au-delà, et c’est documenté comme tel.
- La mesure devient un axe de concurrence : 8 000 modèles TTS sur le Hub, 16 modèles ouverts sur 92 dans les arènes — remplacer le vote humain par des métriques objectives fait passer l’évaluation de deux semaines à deux heures.