Distillation on-policy : faire mieux avec moins de calcul, du token suffisant à la mémoire partagée
💡 En résumé
La journée technique du 5 octobre tourne autour d’une seule obsession : faire mieux avec moins de calcul. Une grappe inhabituellement dense de papiers réinvente la distillation on-policy — cette technique où l’élève apprend sur ses propres sorties supervisées par un professeur — en la rendant économe : SR-OPD n’utilise que 3,46 à 5,02 % des tokens de professeur de la méthode vanilla pour une performance comparable, et Seg-OPD apprend à l’élève à réviser ses segments de raisonnement (+5,22 % de précision relative). En parallèle, on apprend à mesurer le calcul par token : une approche Mixture-of-Agents montre que les 10 % de tokens les plus chers absorbent 64 à 80 % des FLOPs, et qu’un agent de 0,5B reproduit déjà 92-95 % des tokens de référence. Et une étude sur six routeurs commerciaux douche l’optimisme : aucun ne bat un routeur qui choisit au hasard entre deux bons modèles à coût égal. Le thème du jour n’est pas la puissance brute, mais l’allocation : où mettre le calcul, où le couper, et comment le vérifier.
🔥 Tendances : la distillation on-policy sort de l’ombre
SR-OPD : dépenser les tokens de professeur là où ça compte
La distillation on-policy (OPD) combine les trajectoires générées par l’élève avec une supervision dense au niveau token fournie par le professeur. Le hic : fournir cette supervision pour chaque trajectoire coûte énormément de calcul de professeur. SR-OPD (Success-Referenced On-Policy Distillation) attaque ce coût par la sélection. Quand l’élève produit à la fois des trajectoires réussies et échouées pour le même prompt, une trajectoire réussie sert de référence naturelle pour choisir les échouées. SR-OPD se concentre donc sur ces prompts et priorise les échouées dont les trajectoires d’états cachés montrent une divergence soutenue par rapport à une référence réussie, tout en tenant compte du coût estimé d’entrée professeur.
Le résultat mérite d’être souligné : sur trois paires professeur-élève et six benchmarks de raisonnement mathématique, SR-OPD n’utilise que 3,46 à 5,02 % des tokens d’entrée professeur requis par l’OPD vanilla en configuration « une passe », tout en maintenant une performance de raisonnement comparable. En configuration contrôlée à 5 % du budget de l’OPD vanilla, les deux choix de conception tiennent : cibler les prompts qui ont à la fois des trajectoires réussies et échouées, et utiliser les réussies pour guider la sélection des échouées. Moralité : le propre comportement réussi de l’élève est une référence utile pour allouer une supervision professeur sous budget fixé.
Seg-OPD : apprendre à réviser, pas seulement à imiter
La distillation token-par-token a un angle mort : elle n’offre pas d’alternative cohérente montrant comment une étape de l’élève pourrait être révisée pour améliorer la suite du raisonnement. Pire, quand l’élève produit un préfixe dégénéré, la supervision professeur reste conditionnée à ce préfixe et risque de renforcer de mauvais schémas. Seg-OPD (Segment-wise OPD) renverse la logique : grâce à des interventions contrôlées, les auteurs constatent que remplacer des segments de l’élève par des réécritures du professeur améliore la précision du raisonnement ultérieur. Seg-OPD sélectionne des segments de l’élève selon une métrique d’incertitude, obtient les réécritures correspondantes du professeur, puis entraîne l’élève à préférer les réécritures à ses propres segments appariés, tout en conservant la supervision dense token-par-token. Sur le raisonnement mathématique et la programmation compétitive, les élèves entraînés atteignent des taux de succès de révision supérieurs aux baselines, avec une amélioration relative moyenne de 5,22 % de la précision à travers des modèles et tâches variés.
MOPD multi-professeurs : préserver les capacités, hiérarchiser les objectifs
Trois papiers prolongent la distillation multi-professeurs (MOPD), qui consolide l’expertise de spécialistes dans un seul élève.
SF-MOPD (Slow-Fast MOPD) identifie le problème central : l’entraînement MOPD éloigne progressivement l’élève de son modèle d’initialisation, et les capacités générales déclinent à mesure que le déplacement grandit — l’interférence de capacités. Contraindre l’élève vers son initialisation supprime l’acquisition d’expertise. La solution couple un modèle rapide (l’élève courant mis à jour directement par chaque professeur) et un modèle lent (une moyenne mobile exponentielle de l’élève). Le modèle lent absorbe le signal progressivement et sert de référence de capacité mobile, fusionnant la fondation générale et l’expertise confirmée. Pour chaque professeur, SF-MOPD calcule la mise à jour induite dans l’espace log-probabilité et retire seulement la composante qui pousse le modèle rapide plus loin du lent, en retenant les composantes alignées et orthogonales. Résultat : moins d’interférence, plus d’expertise multimodale, dégradation moindre des capacités générales.
Latent-MOPD franchit un cap : à la connaissance des auteurs, c’est la première méthode de distillation on-policy multi-professeurs au niveau des représentations pour les LLM. Elle intègre les spécialistes par leurs prédictions et les états cachés qui les calculent, sans entraînement supplémentaire des professeurs. Pour coordonner cette supervision représentationale, elle sélectionne les cibles de couches tardives selon la relation professeur-élève, ponte les largeurs cachées inégales par une projection partagée, et groupe les mises à jour par domaine. Chaque supervision évolue progressivement des états cachés vers les prédictions de token. Dans le cadre « même famille », Latent-MOPD surpasse les baselines token-seul, représentation-seule et moyenne uniforme sur les neuf benchmarks en mathématiques, code et logique ; avec le même nombre de paramètres que chaque professeur, l’élève dépasse même le meilleur professeur par benchmark sur une majorité de ces benchmarks. Un contrôle représentation-seul toutes couches reste stable avec des mises à jour purement domestiques mais s’effondre quand les domaines des professeurs sont entrelacés dans une même mise à jour.
LMOPD (Lexicographic Multi-Objective OPD) traite l’asymétrie des compromis. L’apprentissage par renforcement à récompense vérifiable optimise la justesse, mais un bon comportement de LLM exige aussi un raisonnement de qualité et des réponses concises. Or la concision ne doit pas s’améliorer au détriment de la justesse. LMOPD intègre des politiques spécialisées par récompense sous priorités explicites : pour chaque trajectoire d’élève, il sélectionne le spécialiste du premier objectif dont le portier détecte une déficience, puis projette localement sa correction de log-politique centrée pour retirer les composantes opposées aux spécialistes de priorité supérieure. Sur des transformeurs Mixture-of-Experts 30B-A3B, avec deux experts, les estimations ponctuelles retiennent entièrement les gains de justesse et de qualité de raisonnement tout en acquérant 46,9 % du gain de concision ; avec quatre experts, LMOPD retient ≈90 % des deux gains, contre ≈57 % pour la meilleure baseline évaluée. Le routage lexicographique surpasse le routage aléatoire, et la projection renforce les capacités de plus haute priorité.
Ce quadruplet — SF-MOPD, Latent-MOPD, LMOPD, SR-OPD, auxquels s’ajoute Seg-OPD — raconte une évolution claire : la distillation on-policy cesse d’être un simple transfert de logits pour devenir un problème de contrôle d’allocation, où l’on décide quels professeurs écoutent, à quelle profondeur, sous quelles priorités et pour quels tokens.
Ce que coûte un token : mesurer le calcul suffisant
L’article « What Does a Token Cost? » pose une question que l’on présumait sans jamais la mesurer : combien de calcul un token individuel requiert-il réellement ? Aujourd’hui, un LLM dépense la même quantité de calcul pour chaque token, quelle que soit sa difficulté. La décodification spéculative et le routage de modèles reposent sur la prémisse que beaucoup de ce calcul est inutile — mais ce calcul n’avait pas été mesuré.
Les auteurs le mesurent par une lentille Mixture-of-Agents (MoA) : un panel de quinze modèles de capacité croissante, issus de trois familles, où chaque agent tente de reproduire une séquence de référence token par token, conditionné sur les bons tokens précédents. Le calcul suffisant d’un token est défini comme le coût d’inférence du plus petit agent qui réussit — une borne supérieure de ce que le token requiert. Sur trois benchmarks centraux, un agent de 0,5B reproduit 92 à 95 % des tokens de référence. Et la distribution est extrêmement asymétrique : à travers les panels Qwen, OLMo et R1-distillé, les 10 % de tokens les plus chers absorbent 64 à 80 % des FLOPs estimés. La carte MoA aide ensuite le routage à réduire la latence projetée de 7,59 à 5,12 secondes sur les 500 problèmes de MATH-500, tout en améliorant légèrement la précision par rapport à la meilleure baseline de routage par confiance ; elle aide aussi le drafting à utiliser 32,6 % de tokens de brouillon en moins et environ 20 % de latence projetée en moins à précision comparable.
🤖 Nouveaux outils : compression, mémoire, routage, sciences
Capability Scaling-Down Laws : prédire la perte de capacité
Choisir une méthode et une configuration de compression reste largement empirique, car des réductions de ressources comparables peuvent produire des pertes de capacité très différentes. Les auteurs étudient systématiquement les lois de décroissance de capacité pour la compression de LLM à travers élagage, quantification et distillation, en mesurant la perte en mathématiques, génération de code et questions-réponses, et en la reliant à la taille du modèle, l’étape d’entraînement, les réglages de compression, la disponibilité des données et l’exposition à l’entraînement.
Résultat pratique : partager la réponse de densité entre niveaux d’élagage divise par deux les mesures de configuration nécessaires pour ajuster un prédicteur d’élagage. Sur de nouveaux états Pythia, sur des états de test OLMo-2 pré-enregistrés et sous élagage Wanda, la relation compacte correspond à une régression ajustée avec toutes les mesures sur mathématiques et code à 0,020 nat par token près. Les expériences de distillation contrôlée montrent que le coût du recyclage massif de données réapparaît sur les distributions de questions-réponses, tandis que le bénéfice net dépend de la distribution d’évaluation. Évaluée indépendamment sur deux familles, la sélection par ces prédictions capte l’essentiel du bénéfice inter-méthodes disponible pour les questions-réponses, avec des marges plus faibles en mathématiques et code.
MuLoRA : l’effondrement de la plasticité spectrale
En apprentissage continu, LoRA offre une adaptation paramétriquement efficace — mais son rang nominal peut dissimuler une perte de capacité d’adaptation effective. Les auteurs identifient l’effondrement de plasticité spectrale : lors de l’adaptation séquentielle, l’énergie de mise à jour se concentre dans un petit sous-ensemble de modes singuliers, laissant une large part de l’espace de bas rang sous-utilisée. C’est une limite de la seule évitement d’interférence : protéger les représentations historiques ne garantit pas que la capacité restante réponde aux nouvelles tâches. MuLoRA contrôle conjointement l’allocation et l’utilisation de la capacité : blanchiment historique pour identifier les directions d’entrée à forte réponse à la tâche courante (base adaptative fixée pendant l’entraînement), puis orthogonalisation polaire approchée des mises à jour de momentum pour réduire la concentration spectrale. Sur cinq benchmarks de classification incrémentale et huit réglages, MuLoRA obtient la meilleure précision moyenne dans 15 des 16 métriques rapportées.
Looped Transformers : la mémoire partagée améliore la qualité
Les transformeurs bouclés appliquent les mêmes couches plusieurs fois par token, ajoutant du calcul sans plus de paramètres — mais chaque récursion écrit son propre cache clé-valeur, si bien que la mémoire croît toujours avec le calcul. L’article « The Surprising Effectiveness of Shared Memory in Looped Transformers » pré-entraîne des modèles bouclés à partager la mémoire : seule la première récursion écrit un cache, les récursions ultérieures le lisent tout en gardant une petite fenêtre propre. Contre-intuitivement, ce partage ne coûte pas de qualité et l’améliore. De 150M à 1B paramètres, le Looped Prediction Transformer (LPT) et sa variante hybride établissent une nouvelle frontière qualité-mémoire : avec cinq récursions, l’hybride abaisse la perplexité de validation sur FineWeb-Edu de 1,12 à 1,82 par rapport à un transformeur standard de même taille, tout en utilisant 76 à 79 % de mémoire de contexte en moins. Analyse à l’appui : mémoire partagée et mémoire locale développent des représentations différentes, les récursions tardives portent surtout attention à la mémoire partagée, qui joue aussi le rôle d’autoroute de gradient vers la première récursion.
Le routage : attention aux illusions
Deux papiers douchent l’optimisme sur le routage dynamique.
« Dynamic LLM Routers are Often Misguided » analyse six routeurs commerciaux sur 14 réglages et un benchmark divers couvrant huit catégories de tâches. Verdict : aucun ne surpasse un routeur qui sélectionne aléatoirement entre deux modèles bien choisis à coût égal. Certains sous-performent de plus de 10 points de pourcentage. Quatre schémas expliquent l’écart : cécité à la difficulté, inversion de longueur, appariement sémantique et sous-optimalité du roster. Les trois premiers sont ce que récompense l’objectif standard : l’efficacité de Pareto coût-précision sur les coûts réalisés favorise l’escalade des requêtes modérément difficiles plutôt que les plus difficiles, les requêtes plus courtes plutôt que plus longues, et le routage par source de requête plutôt que par difficulté. Les auteurs soutiennent en outre que les deux hypothèses qui justifieraient de grands rosters — granularité et spécialisation des modèles — ne tiennent pas empiriquement. Un routeur simple à deux modèles évite les quatre schémas, mais son gain sur le routage aléatoire reste limité : un roster bien choisi laisse peu à router.
Threshold-Aware Conformal Routing (TACR) apporte une réponse constructive, pour les décisions déterminées par le franchissement d’un seuil. Les simulations haute-fidélité sont coûteuses, les substituts appris plus rapides mais moins précis, et cette précision relative à un seuil crée un besoin : déterminer si le substitut suffit ou si le simulateur complet reste nécessaire. La prédiction conforme standard construit des intervalles sans référence au seuil de décision — un intervalle étroit près du seuil peut le franchir et déclencher une simulation, alors qu’un intervalle plus large plus loin peut rester entièrement d’un côté. TACR apprend une échelle dépendante de l’entrée, avec un objectif sensible au seuil qui concentre l’étroitesse de l’intervalle près de la frontière de décision ; le calibrage split-conforme exact sur données tenues à l’écart préserve la couverture marginale sans hypothèse de distribution, ce qui borne aussi la probabilité d’une décision de seuil incorrecte non routée. Sur divers jeux de données scientifiques et d’ingénierie, TACR réduit les déférencements au simulateur de 14 à 75 % par rapport à la prédiction conforme standard à couverture égale, et de 10 à 24 % de plus sur quatre jeux contre une variante sans pondération locale au seuil.
Au-delà du LLM : géométrie de l’hésitation, dynamique JEPA, méta-sciences
Trois percées plus discrètes complètent la journée.
HEST (Hyperbolic Entropy Steering) observe que le raisonnement d’un LLM est largement hiérarchique et que la solution se ramifie à quelques tokens où l’entropie du prochain token est élevée ; une telle structure arborescente s’enchâsse dans l’espace hyperbolique avec une distorsion bien moindre que dans l’espace euclidien. Là où le steering d’activation classique ajoute un vecteur euclidien fixe à chaque token, HEST plonge les états cachés dans la boule de Poincaré avec une sonde légère dont l’unique étiquette est l’entropie du modèle ; au-delà d’un seuil, HEST déplace l’état le long de la géodésique de plus grande descente et ramène le changement à l’état caché. Sur trois modèles affinés par instructions (Qwen2.5-Math, Llama-3.1), HEST avec lecture de Busemann améliore la précision gloutonne sur MATH-500 et GSM8K dans cinq des six réglages, de jusqu’à 1,8 point, là où un vecteur de steering contrastif ajouté à chaque token baisse la précision.
« Drive vs. Decay » développe une théorie de stabilité du début d’entraînement des JEPA (Joint-Embedding Predictive Architectures), sujettes à l’effondrement de représentation généralement atténuée par des heuristiques empiriques. La linéarisation du flot de gradient autour du point fixe trivial révèle deux effets concurrents : une force motrice (γ) et un effet de décroissance (σ). Sous découplage spectral approché, un rapport de stabilité par mode μᵢ = γᵢ/σᵢ se factorise en termes indépendants côté données et côté prédicteur, et le nombre de modes instables suit le rang des représentations qui peuvent émerger. Le cadre prédit une frontière de phase, confirmée empiriquement sur plus de 800 configurations Tabular-JEPA, et unifie la mise à l’échelle du prédicteur, le ratio de masquage et l’EMA comme mécanismes distincts déplaçant μ.
« The AI Theorist » franchit un cap scientifique. Le système d’agents autonomes découvre des modèles physiques par génération d’hypothèses, calculs premiers principes et raffinement guidé par preuves, puis l’applique à α-RuCl₃, matériau candidat au liquide de spin quantique de Kitaev. AI Theorist développe une nouvelle interprétation des observations optiques et photocurantes, identifiant des états excitoniques distincts aux règles de sélection optique contrastées. À la connaissance des auteurs, c’est la première démonstration d’un système d’IA développant autonome un modèle physique pour expliquer des observations expérimentales non publiées dans un matériau quantique.
📊 Analyse : l’allocation remplace la performance brute
Si l’on devait résumer la journée technique en un mot, ce serait allocation. Chaque papier déplace la question de « quel est le meilleur modèle ? » vers « où faut-il mettre le calcul, et où faut-il l’enlever ? ». SR-OPD choisit les prompts et les trajectoires qui méritent la supervision professeur ; LMOPD hiérarchise les objectifs pour ne pas sacrifier la justesse à la concision ; SF-MOPD et Latent-MOPD décident quels professeurs écoutent à quelle profondeur ; le partage de mémoire des transformeurs bouclés décide où le cache est réutilisable ; la carte MoA du calcul suffisant décide quels tokens méritent une passe coûteuse.
Ce déplacement a une signification économique directe. La distillation on-policy était une élégance théorique coûteuse : payer un professeur pour chaque rollout. SR-OPD la rend viable à 3-5 % du coût. Pour une équipe qui cherche à produire un modèle spécialisé à budget contraint, cette réduction change la faisabilité, pas seulement l’élégance. De même, la mesure du calcul suffisant — 0,5B reproduit 92-95 % des tokens, mais 10 % des tokens absorbent 64-80 % des FLOPs — donne un objectif quantifié à la décodification spéculative et au routage : il ne s’agit pas d’accélérer uniformément, mais de concentrer l’effort sur la queue lourde.
Mais la journée apporte aussi un avertissement méthodologique salutaire, porté par l’étude des six routeurs commerciaux. Un routeur qui paraît intelligent sur les métriques de Pareto coût-précision peut ne pas battre le hasard entre deux bons modèles. La cause est profonde : l’objectif standard récompense des comportements qui n’ont rien à voir avec la difficulté réelle de la requête. C’est le même thème que dans notre article agentique — la métrique de surface trahit le phénomène réel. Un routeur qui escalade les requêtes modérément difficiles plutôt que les plus difficiles optimise le coût réalisé, pas la compétence.
Un troisième fil, plus discret, relie compression et sciences : la prévisibilité. Les lois de décroissance de capacité promettent de prédire la perte à 0,020 nat par token près, ce qui transforme le choix de compression d’un art empirique en une décision calculable. TACR promet de réduire les appels au simulateur de 14 à 75 % sans affaiblir la garantie conforme. Le message commun : on peut souvent quantifier la perte de confiance au lieu de la subir, et cela suffit à décider.
Enfin, il faut noter la montée d’un genre : les papiers qui mesurent leurs propres hypothèses. Drive vs. Decay confirme sa frontière de phase sur 800+ configurations ; « Fast Models, Slow Evidence » (voir article agentique) audite son propre pipeline et corrige une économie annoncée de 23,9 % en 4,3 % réels. Cette rigueur — publier l’erreur de sa propre évaluation — est peut-être la tendance la plus importante de la rentrée.
🎯 À retenir
- La distillation on-policy devient économe. SR-OPD utilise 3,46-5,02 % des tokens professeur de l’OPD vanilla pour une performance comparable ; Seg-OPD apprend à réviser les segments de raisonnement (+5,22 % relatif).
- L’élève peut dépasser le maître. Latent-MOPD (première OPD multi-professeurs au niveau des représentations) surpasse les baselines sur neuf benchmarks ; avec le même nombre de paramètres qu’un professeur, il le dépasse par benchmark sur une majorité de tâches.
- Hiérarchiser les objectifs préserve la justesse. LMOPD retient ≈90 % des gains de justesse et de qualité avec quatre experts, contre ≈57 % pour la meilleure baseline, tout en acquérant 46,9 % du gain de concision (deux experts).
- Le calcul par token est mesurable. Un agent de 0,5B reproduit 92-95 % des tokens de référence ; 10 % des tokens absorbent 64-80 % des FLOPs ; la carte aide le routage à passer de 7,59 à 5,12 s de latence projetée.
- Méfiance sur les routeurs. Aucun des six routeurs commerciaux analysés ne bat un routage aléatoire entre deux bons modèles à coût égal ; certains perdent plus de 10 points.
- La mémoire partagée améliore la qualité. LPT hybride abaisse la perplexité de 1,12-1,82 sur FineWeb-Edu avec 76-79 % de mémoire de contexte en moins.
- La compression devient prédictible. Partager la réponse de densité entre niveaux d’élagage divise par deux les mesures nécessaires ; la relation compacte tient à 0,020 nat par token près.
- Le routing conforme peut réduire les simulations de 14 à 75 % sans affaiblir la garantie de couverture.
Le fil rouge, en une phrase : en 2026, la performance d’un système d’IA dépend de moins en moins de la taille de son modèle et de plus en plus de la justesse de son budget de calcul. Mesurer le token suffisant, choisir le professeur utile, hiérarchiser les objectifs, router sans se raconter d’histoires : ce sont désormais les vraies compétences d’ingénierie.