Distillation : quand l'alignement parfait dégrade le modèle
💡 En résumé
La distillation de modèles de langage traverse une zone inconfortable, où les intuitions usuelles s’inversent. Deux papiers indépendants sur la distillation on-policy (OPD) documentent le même phénomène sous deux angles : la métrique d’alignement peut s’améliorer pendant que le modèle se dégrade, et le signal de distillation peut rester constant alors que l’information qu’il porte a disparu.
Le cas le plus frappant vient de LastOPD : en distillant Qwen3-4B et Qwen3-8B dans Qwen3-1.7B-Base, la supervision latente seule fait grimper la précision MATH-500 de 25 à 46 en 10 étapes — puis l’entraînement s’effondre à 11, sans reprise. Pendant tout l’effondrement, la métrique d’alignement, elle, continue de s’améliorer. Le modèle le mieux aligné devient le plus mauvais.
Ce n’est pas une curiosité de laboratoire : c’est la démonstration que l’alignement d’états internes entre deux modèles n’est pas un objectif valide en soi, parce qu’une couche du modèle enseignant et la couche « correspondante » de l’élève n’ont pas le même rôle.
🔥 Tendances : le signal dense n’est pas le signal utile
LastOPD : le signal latent doit s’arrêter avant l’effondrement
La distillation on-policy corrige l’élève sur les réponses qu’il produit lui-même, mais son signal est la distribution du prochain token de l’enseignant : ce que le professeur dit, jamais comment il pense. La supervision latente prétend combler ce manque en alignant les états internes.
L’analyse de l’échec est précise : les couches appariées par profondeur jouent des rôles différents dans les deux modèles ; poursuivre l’alignement peut donc tirer l’élève vers des états d’enseignant qu’il n’est pas capable de comprendre. La justification empirique est imparable : « l’alignement s’améliore de façon constante pendant l’effondrement, et le modèle le mieux aligné est le moins performant ».
La correction proposée, LastOPD, est minimaliste :
- appliquer le signal latent uniquement sur l’état de la dernière couche — l’interface commune que lisent les deux têtes de modèle de langage ;
- et uniquement pendant une transition de 10 étapes vers la distillation au niveau token.
Résultat : +5,55 et +4,02 points sur MATH-500 par rapport à l’OPD purement token, avec les enseignants 4B et 8B, en tête sur la plupart des jeux de données retenus, et le score final de l’OPD token atteint en environ un dixième du temps d’entraînement. Autrement dit : garder la partie utile du signal latent, puis passer la main avant que l’effondrement ne s’installe.
S²D-OPD : tous les tokens ne méritent pas d’être distillés
Second volet, sur la Direct On-Policy Distillation (Direct-OPD), qui transfère vers un élève plus grand les gains de politique obtenus par RL sur un petit modèle. Le signal est le ratio de log-probabilités par token entre les points de contrôle post-RL et pré-RL, appliqué densément sur les rollouts de l’élève.
La faille, les auteurs la démontrent par une construction exacte : ce ratio mesure un changement relatif ; il peut rester figé alors même que la masse de probabilité que les deux points de contrôle assignent aux tokens candidats de l’élève tend vers zéro. Dans ce cas, la récompense de Direct-OPD et sa mise à jour sont inchangées, tandis que la divergence de Jensen-Shannon et les deux directions de KL s’annulent.
La parade, S²D-OPD, classe les états échantillonnés par l’élève selon leur JSD vis-à-vis de la référence enseignante, et masque la supervision aux états de faible divergence, ne conservant que le top 10 % des états par réponse. Sur deux paires d’enseignants et quatre élèves de 1,7B à 8B, la méthode améliore la précision hors échantillon face à Direct-OPD dense sur AIME et HMMT dans sept réglages sur huit, et égale dans le huitième — sans passe avant supplémentaire.
La règle générale qui se dégage des deux papiers : dans la distillation, le volume de supervision n’est pas la qualité de la supervision, et une métrique d’alignement qui ne redescend jamais est un signal d’alarme, pas un indicateur de succès.
ℓp-LoRA : allouer les rangs par l’objectif, pas à la main
Sur l’adaptation efficace, la question ouverte reste : quel rang allouer à chaque matrice d’adaptation, puisque le rang contrôle directement capacité et efficience ?
Les méthodes adaptatives existantes allouent les rangs selon des scores d’importance conçus manuellement, donc non dérivés d’un objectif d’optimisation. ℓp-LoRA régularise l’énergie de chaque composant de rang 1 (régularisation ℓp, 0 < p < 1, technique classique d’induction de parcimonie en traitement du signal et en statistique) : les composants redondants s’éteignent, les importants survivent.
L’apport technique est la réduction du sous-problème proximal à un problème bidimensionnel, ce qui donne un critère de seuillage implicite pour identifier les composants redondants — donc une allocation de rang qui découle de l’objectif au lieu d’être posée a priori. Les expériences en compréhension de langage naturel et en réponse à des questions atteignent des performances compétitives face aux baselines LoRA.
Interprétabilité : un modèle conçu pour être analysable
SRM (Stream Recursion Model) prend le problème par l’autre bout. Plutôt que d’attaquer les techniques d’interprétabilité mécaniste pour les faire monter en échelle, les auteurs construisent un modèle plus petit dont la structure se prête à l’analyse : une modification du Hierarchical Reasoning Model qui organise le calcul en flux latents multiples interagissant, mis à jour par raffinement récursif, ce qui permet d’analyser directement la dynamique des flux, la contribution causale et le routage.
SRM atteint des performances comparables à GPT-2 à paramètres égaux, et l’analyse révèle un comportement distinct et cohérent par flux, signe d’une spécialisation structurée. C’est la thèse inverse du courant dominant : au lieu d’ajouter des outils de sondage sur des architectures opaques, concevoir l’architecture pour que le sondage ait un sens.
Thinking Leakage : l’audit causal d’un gain de post-entraînement
Résultat particulièrement inconfortable pour les méthodes de post-entraînement. Le post-entraînement de modèles de raisonnement hybrides en mode NoThink est présenté comme un moyen d’améliorer les performances en gardant l’inférence rapide. Or ces gains peuvent simplement puiser dans un comportement de réflexion déjà accessible via le mode Think du modèle de base.
Formulé comme leakage de réflexion dans un cadre de médiation causale, avec interventions bidirectionnelles le long d’une direction d’activation dérivée du modèle de base, l’audit donne sur trois modèles et trois méthodes de post-entraînement :
- le leakage est réel, causal et substantiel ;
- guider le modèle de base le long de cette direction reproduit la majeure partie du gain de précision du post-entraînement ;
- contre-guider un point de contrôle en retire une part substantielle.
Sur neuf points de contrôle alignés présentant un gain NoThink positif, le ratio de leakage va de 42 % à 79 %. Conséquence méthodologique : l’avantage apparent d’une méthode de post-entraînement peut refléter une dérive vers le mode Think plutôt qu’une amélioration de capacité en NoThink. La question n’est donc pas « la méthode marche-t-elle ? » mais « qu’est-ce qui, exactement, a été amélioré ? ».
Quantifier l’incertitude, pas seulement prédire
Sur les modèles de fondation pour séries temporelles (TSFM), SGA (Slicing-Graphing-Alignment) quantifie l’incertitude des prévisions multi-pas. Le problème structurel : les branches de prévision émergent à chaque pas et se propagent, et les différentes branches n’ont pas la même performance — ce qui mine la crédibilité des prévisions.
SGA caractérise d’abord la topologie de toutes les branches potentielles par un graphe orienté acyclique : la complexité du graphe borne l’incertitude de la prévision multi-pas. La complexité est ensuite mesurée précisément en intégrant information topologique et stochasticité propre au TSFM.
Sur 11 TSFM et 27 jeux de données : SGA classe le mieux les erreurs de prédiction par ses estimations d’incertitude, offre une couverture d’échantillonnage plus large et plus précise que les méthodes existantes, et les modèles de plus grande échelle corrélées à des incertitudes estimées plus faibles — une loi d’échelle empirique de l’incertitude, distincte de la loi d’échelle de la performance.
Modèles du monde et RLVR : deux lectures théoriques
GDM (Graph Dynamics Model) étend les modèles du monde à base de graphes au-delà des cas fixes et déterministes : topologies évolutives, transitions stochastiques, observabilité partielle. Il combine une matrice d’adjacence récurrente creuse pour les mises à jour de topologie et le passage de messages, avec une architecture récurrente d’espace d’état pour les transitions stochastiques. Les auteurs identifient au passage une lacune d’évaluation — aucune méthode ne comparait les distributions prédites et vraies sur l’état conjoint du graphe (topologie, features de nœuds, features de graphe) — et proposent la métrique GDD, fondée sur la divergence maximale moyenne avec un noyau de graphe. Résultat : GDM surpasse les baselines et généralise zéro-shot sur de grands graphes.
RLVR et théorie des verres de spin : la question de savoir si RLVR apprend réellement de nouvelles capacités de raisonnement reste débattue. En projetant le RLVR régularisé par entropie, sur politiques tabulaires myopes, sur un modèle énergétique (verre de spin) couvrant les politiques déterministes, les auteurs obtiennent une borne supérieure de ce que RLVR peut atteindre et caractérisent rigoureusement le paysage : pour une large classe de modèles et de tâches à entrées non corrélées, le paysage est bénin, sans minimum local pouvant piéger l’entraînement.
La difficulté pratique vient donc d’ailleurs : barrières diffusives et erreur d’estimation du gradient en traversant le paysage — de vrais obstacles, mais distincts d’un paysage accidenté. Ces obstacles s’atténuent souvent par le choix du régulateur d’entropie. Cohérent avec la théorie : un transformer entraîné de zéro, avec seulement des récompenses sur le dernier token, apprend une chaîne de pensée algorithmique pour des multiplications de groupe non abéliennes itérées. Conclusion opérationnelle : quand le RLVR échoue, la cause est plus souvent le budget d’échantillonnage et l’estimation du gradient que la géométrie de l’objectif.
🤖 Nouveaux outils
| Outil | Apport | Chiffre clé |
|---|---|---|
| LastOPD | Signal latent limité à la dernière couche + transition de 10 étapes | +5,55 et +4,02 points MATH-500 vs OPD token |
| S²D-OPD | Masquage de la supervision aux états de faible JSD (top 10 %) | 7 réglages sur 8 meilleurs qu’en supervision dense |
| ℓp-LoRA | Allocation de rang dérivée de l’objectif (seuillage implicite) | Sous-problème proximal réduit à 2 dimensions |
| SRM | Flux latents récursifs conçus pour l’analyse mécaniste | Performance comparable à GPT-2 par paramètre |
| SGA | Graphe des branches de prévision pour borner l’incertitude | 11 TSFM, 27 jeux de données ; 87 % de réduction de MSE (design apparenté) |
| GDM + GDD | Modèles du monde à topologies évolutives + métrique de distribution | Généralisation zéro-shot sur grands graphes |
| DSpark VLM (LiquidAI) | Décodeur spéculatif pour LFM2.5-VL-3B | 3,13x sur appareil, 2,66x sur H100 ; +8,9 % de paramètres |
Le dernier mérite un arrêt : le drafter DSpark publié par LiquidAI est un modèle de 279,5 M de paramètres (pile décodeur 4 couches 193,0 M, projection d’états cachés 21,0 M, tête de Markov 65,5 M, normes et tête de confiance 6,4 k) ajouté à LFM2.5-VL-3B, soit +8,9 % de paramètres pour un décodage jusqu’à 3,13x plus rapide sur appareil (MLX sur M5 Max) et 2,66x sur H100, avec des gains de bout en bout de 1,56x à 2,62x et de 1,64x à 2,27x. Taille de bloc recommandée : 8 ou 9. Support de premier jour sur llama.cpp, MLX-VLM et SGLang. Les auteurs documentent aussi la limite : la spéculation vaut moins pour les charges visuelles, l’image passant d’abord par un encodeur vision puis par des centaines de tokens visuels — le préremplissage reste le goulot sur les appareils edge.
📊 Analyse : trois règles qui sortent de la semaine
Ne jamais optimiser une métrique interne sans contrôler la métrique externe. L’effondrement de LastOPD est le cas d’école : l’alignement latent s’améliore sur toute la durée de la dégradation. Toute boucle d’entraînement qui surveille un proxy interne — alignement, perte de distillation, ratio de log-probabilités — a besoin d’un point de contrôle fréquent sur la tâche cible, sinon elle peut optimiser dans le vide pendant des milliers de pas.
Le signal dense est redondant, pas informatif. S²D-OPD jette 90 % des états et fait mieux. Thinking Leakage montre que 42 % à 79 % du gain d’une méthode de post-entraînement est déjà présent dans le modèle de base. Dans les deux cas, la question utile n’est pas « combien de supervision » mais « quelle partie de cette supervision porte une information qui n’existe pas déjà ».
Séparer les obstacles d’optimisation de la géométrie de l’objectif. Le résultat sur les paysages RLVR tranche un débat ancien : le paysage n’est pas accidenté, les difficultés sont des barrières diffusives et de l’erreur d’estimation. Cela déplace l’effort d’ingénierie — plus d’échantillonnage, meilleur gradient, régulateur d’entropie bien choisi — et relativise les diagnostics catastrophistes sur les limites du RLVR.
Un mot enfin sur le contexte matériel : ces gains algorithmiques (distillation mieux ciblée, rangs alloués automatiquement, décodage spéculatif léger) ont tous le même profil — quelques pour cent à quelques fois de mieux pour un coût d’intégration faible. C’est le type d’optimisation qui compte quand on facture à l’usage.
🎯 À retenir
- LastOPD : l’alignement latent seul fait passer MATH-500 de 25 à 46 en 10 étapes, puis s’effondre à 11 — alors que la métrique d’alignement continue de s’améliorer. Le modèle le mieux aligné est le plus mauvais.
- La correction : signal latent sur la dernière couche uniquement, pendant une transition de 10 étapes, avant de passer à la supervision token (+5,55 et +4,02 points).
- S²D-OPD : le ratio de log-probabilités de Direct-OPD peut rester constant alors que la masse de probabilité s’annule ; masquer la supervision aux états de faible JSD (top 10 % conservé) améliore 7 réglages sur 8, sans passe avant supplémentaire.
- ℓp-LoRA alloue les rangs à partir de l’objectif (seuillage implicite, sous-problème à deux dimensions) au lieu de scores d’importance posés à la main.
- Thinking Leakage : sur neuf points de contrôle à gain NoThink positif, 42 % à 79 % du gain est reproduit en guidant simplement le modèle de base — les gains de post-entraînement peuvent être une dérive, pas une capacité nouvelle.
- RLVR : le paysage d’optimisation est bénin (pas de minimum local piégeur) ; les vraies difficultés sont les barrières diffusives et l’erreur d’estimation du gradient, atténuables par le régulateur d’entropie.
- DSpark VLM : +8,9 % de paramètres (279,5 M) pour 3,13x de décodage sur appareil et 2,66x sur H100, support jour un sur llama.cpp, MLX-VLM et SGLang.