Et si la mesure décidait du résultat ? Quantification, compression et le paramètre qu'on croyait neutre

💡 En résumé

Il y a une chose qui revient cette semaine dans presque tous les travaux techniques, et ce n’est pas une architecture. C’est une phrase que les auteurs écrivent pour disqualifier leur propre domaine : « un score moyen peut cacher une classe d’entrées sur laquelle la compression fait passer la précision de 99 % à 0 % ». C’est l’ouverture de PAGE, un papier sur l’éviction de cache KV. Elle résume assez bien la journée.

Ce n’est pas que les modèles progressent moins vite. C’est que l’instrument de mesure est devenu le lieu du progrès. Une nouvelle librairie de tokenisation annonce un facteur 3 à 30 ; un framework de pruning reformule la sélection de blocs en optimisation binaire contrainte et gagne 23 points de MMLU ; une méthode de quantisation réorganise les canaux pour éviter un rassemblement coûteux à l’exécution. Mais à côté, un papier démontre qu’un taux d’apprentissage partagé — le paramètre que toute la littérature traite comme un réglage neutre — fait basculer un verdict comparatif d’un facteur 2. Un autre montre qu’un classement d’architectures transfère parfaitement entre appareils (corrélation de rang 0,951 à 0,996) tout en violant les contraintes conjointes de 33,3 % à 100 % du temps. Un troisième établit que les échecs de comptage de liste ne sont pas un phénomène unique mais sept modes d’erreur distincts selon la famille de modèles.

Cinq résultats qui disent la même chose sous cinq formes : la validité du verdict est devenue le sujet technique.

🔥 Tendances : le protocole est le résultat

PAGE : décider de ne pas compresser

Le point de départ est un constat dérangeant. Les méthodes d’éviction de cache KV décident quels jetons garder, jamais s’il faut évincer du tout. Résultat : une précision moyenne de 99 % peut camoufler une classe d’entrées où la compression est catastrophique. PAGE reformule donc l’éviction comme une décision d’admission par entrée, et montre que les entrées se séparent en deux classes : une classe liée à la capacité, où l’éviction est catastrophique à tout budget, et une classe sujette à la dilution, où l’éviction est sûre ou bénéfique.

L’élégance est dans le détecteur. Un unique scalaire sans étiquette calculé sur l’attention de préremplissage — la chute précoce-tardive de l’accord top-k entre têtes — prédit la classe avant tout décodage. PAGE seuilise cette chute : il applique n’importe quel évinceur de base quand la chute est importante, et conserve le cache complet sinon. Sans entraînement, sans étiquettes d’exactitude. Utilisé en garde-fou, PAGE fait passer le taux de nuisance dans le régime lié à la capacité de 0,75 à 0,026 — une réduction d’un facteur 29 — sur quatre évinceurs, quatre modèles et deux benchmarks, transformant un effondrement de 99 % à 0 % en un plateau à 89 % sans réentraîner l’évinceur.

La limite est énoncée par les auteurs eux-mêmes, et c’est ce qui rend le papier crédible : PAGE est un garde-fou par entrée, pas un compresseur. La compression réalisée est de 1,8 à 3,4× (moyenne 2,9×) contre un budget nominal de 16×, et elle décroît vers 1× à partir du lot 16 en provisionnement statique. À mémoire égale, un évinceur entraîné gagne. Autrement dit : PAGE protège un petit sous-ensemble identifiable d’entrées, et le bénéfice est une sûreté ciblée, pas un gain moyen.

GRRR : les gains du post-entraînement ne sont pas là où on les cherche

Douze chaînes de post-entraînement, SFT puis RL, chacune exprimée dans le repère de la décomposition en valeurs singulières de la matrice pré-entraînée. Cette décomposition sépare trois composantes géométriquement distinctes : les valeurs diagonales, qui redimensionnent les valeurs singulières ; les valeurs hors-diagonale, qui font tourner le couplage entre directions d’entrée et de sortie pré-entraînées ; et les valeurs de l’espace nul, qui routent hors du noyau singulier non nul d’origine.

Le résultat est contre-intuitif : retirer la composante diagonale préserve généralement l’essentiel des gains du post-entraînement. Les gains ne viennent donc pas d’un changement substantiel des valeurs singulières du modèle pré-entraîné, mais d’une reconfiguration et extension des voies pré-existantes. C’est une affirmation forte sur ce que fait réellement le fine-tuning, et elle a une implication pratique directe : si la majeure partie du signal de post-entraînement vit dans la rotation et l’espace nul, alors les techniques qui contraignent le rang ou préservent la structure spectrale ne détruisent pas le gain qu’on croit — et celles qui le cherchent dans les valeurs singulières cherchent au mauvais endroit.

PRQuant : la permutation comme accélérateur matériel

L’exactitude de la quantification basse précision des couches linéaires est dominée par un petit nombre de valeurs aberrantes. Les remèdes existants — lissage, rotation, approches résiduelles — atténuent le problème mais introduisent de nouveaux goulots d’étranglement du côté des poids, et surtout fonctionnent en ligne, ce qui coûte cher à l’exécution.

PRQuant est sans entraînement et à faible surcharge. Après un mise à l’échelle de style AWQ, il identifie les canaux d’entrée qui contribuent le plus à l’erreur de quantification des poids, les permute en blocs de queue contigus, et construit leurs sous-tenseurs résiduels hors ligne. Pendant l’inférence, cette structure contiguë permet au côté activation d’utiliser ces blocs sans l’opération de rassemblement dynamique — et transforme une compensation résiduelle dispersée en une GEMM augmentée par la queue, régulière et rapide. Sur cinq benchmarks en aval, PRQuant dépasse le MXFP4 par défaut et les baselines PTQ évaluées de 1,24 point sur Qwen3-4B-Instruct-2507 et 0,55 sur Qwen3-30B-A3B-Instruct-2507. L’ablation est honnête sur l’attribution : le lissage et la compensation résiduelle sont les moteurs principaux de l’amélioration numérique, la permutation n’apporte qu’un bénéfice numérique marginal — mais elle apporte le layout contigu compatible matériel qui supprime la surcharge de rassemblement. Gain numérique faible, gain d’exécution structurel.

MoE : la frontière des spéculations

Le décodage spéculaire sur les modèles Mixture-of-Experts souffre d’un coût de vérification instable, causé par le chargement d’experts dépendant de l’entrée. Les auteurs formulent la sélection du budget de spéculation comme un problème de plus court chemin stochastique hors ligne sur des séquences de référence, et construisent un oracle diagnostique qui simule contrefactuellement le coût de vérification MoE. L’analyse des décisions de l’oracle sur le couplage Qwen3-Coder × EAGLE-3, dans l’espace des deltas marginaux, montre que les candidats rejetés forment une frontière linéaire stricte. La conséquence est forte : une optimisation globale complexe est localement gouvernée par une condition nécessaire équilibrant coût marginal et progrès espéré. C’est-à-dire qu’il existe un point de référence mathématique rigoureux pour concevoir de futures heuristiques adaptatives en ligne — au lieu de les inventer à l’intuition.

CS-MoE : mutualiser les experts entre couches

Les modèles Transformer souffrent d’une redondance inter-couches où des transformations fonctionnelles sont réapprises à différentes profondeurs. CS-MoE rompt avec l’architecture MoE classique — qui termine chaque bloc par des experts isolés par couche — en combinant des experts indépendants de la couche et un accès concurrent à un pool d’experts globalement partagé. Ce partage permet un contrôle élastique de l’activation de paramètres et des FLOPs par jeton. Résultat : une perplexité inférieure à un Transformer dense d’échelle égale en n’activant que 55 % des paramètres, une progression monotone avec le nombre d’experts activés, et une frontière de Pareto ajustable entre coût de calcul et capacité du modèle.

HRM : les features importantes ne sont pas stables

Étude mécaniste du Hierarchical Reasoning Model sur Sudoku, Maze et ARC-AGI-2, avec comparaison à des baselines Transformer avec et sans modules récurrents, interventions causales sur les états récurrents, sondes linéaires contre ablations de directions aléatoires, et autoencodeurs parcimonieux avec ablations de features. Le résumé des résultats est un avertissement méthodologique :

  • les modèles récurrents surpassent les baselines à une passe, mais un Transformer récurrent à état unique est comparable au HRM ;
  • les contributions causales des états haut niveau et bas niveau varient selon le point de contrôle et l’étape d’inférence ;
  • certaines variables de tâche sont linéairement décodables depuis les états récurrents, mais ablater les directions de sonde produit des effets comparables à des contrôles aléatoires ;
  • les ablations de SAE produisent des changements comportementaux plus importants, mais les features SAE les mieux classées n’ont pas d’avantage stable sur des sous-ensembles aléatoires de taille équivalente à mesure que la taille d’ablation augmente ou selon les tâches.

La conclusion des auteurs : le HRM implémente essentiellement un raffinement itératif conscient des contraintes sur un état de solution propre au puzzle, et les contributions fonctionnelles des composants varient sans reposer sur un ensemble compact de features causalement importantes. Ce qui signifie concrètement que les techniques d’interprétabilité mécaniste actuelles ne sont pas adaptées aux modèles de raisonnement latent et récursifs — et que certaines conclusions tirées sur des modèles non récurrents ne se transposent pas.

Le taux d’apprentissage n’est pas un décoût

C’est le papier le plus désagréable de la journée. La distillation sélective en politique entraîne l’élève uniquement aux positions que le sélecteur note le plus haut, et la littérature compare les sélecteurs sous un taux d’apprentissage partagé — un réglage choisi pour être neutre. Les auteurs démontrent qu’il ne l’est pas.

Sous LoRA sur GSM8K (élève Qwen2.5-1,5B, enseignant 7B), sur une grille de huit taux : la supervision dense est statistiquement plate (amplitude 1,8 pp, p = 0,26) tandis que chaque bras sélectif bouge avec le taux — 5,4 pp pour un sous-ensemble aléatoire de 5 %, 6,7 pp pour un sélecteur de variation totale, jusqu’à 17,7 pp pour un sélecteur de « teachability ». Conséquence directe : le verdict dense contre sélectif affiche 10,1 pp à lr = 1e-4 mais 5,1 pp à 5e-5, un facteur 2 décidé par un paramètre que le protocole traite comme du décor. Et deux des six appels de significativité par paires entre sélecteurs basculent entre taux adjacents sans aucune inversion de rang.

Les auteurs nomment le phénomène enchevêtrement sélecteur-taux et le tracent jusqu’à la sélection elle-même, pas la taille du pas : les magnitudes de mise à jour AdamW suivent le taux à 2,2 % près malgré des différences de norme de gradient de 15,5× entre les bras. Une ablation pré-enregistrée à score gelé montre que le scoring vivant ajoute 3,79 ± 1,69 pp de sensibilité au taux (p = 0,035) tandis que le bras gelé reste significativement enchevêtré (p = 0,015) : la boucle de rétroaction aggrave le phénomène plutôt qu’elle ne le cause. En fine-tuning complet, aux taux réellement utilisés par cette littérature (1e-6 à 1e-5), le motif s’amplifie : dense oscille de 19,8 pp, le bras sélectif de 49,5 pp, et le verdict va d’un +3,6 pp non significatif au point de fonctionnement publié à +34 pp (p = 0,005) un cran plus chaud. Sur MATH-500 la dépendance au taux ne se reproduit pas sous LoRA — ce qui borne la portée du résultat — tandis que le coût d’environ 10 pp du sélectif, lui, survit. Prescription : rapporter la matrice bras × taux, pas une colonne à taux unique, comme condition préalable à toute comparaison de sélecteurs.

Rank portability n’implique pas feasibility portability

L’évaluation matérielle multi-appareils suppose que si les classements d’architectures transfèrent, un appareil proxy peut servir à la sélection de modèle côté cible. Les auteurs testent l’hypothèse sur deux familles publiques. Sur NAS-Bench-201, les corrélations de rang inter-appareils sont modérées, tandis que le recouvrement des ensembles faisables comparables à la cible reste incomplet — et un diagnostic AdaProxy fidèle améliore substantiellement le classement de latence, montrant que les échecs de frontière ne sont pas dus à une faible adaptation. L’analyse exacte par conformal split fini expose par ailleurs un goulot d’étranglement de preuve : un seuil unilatéral à 90 % exige au moins neuf observations de calibration.

La réplication est plus parlante : sur 10 000 architectures GPT et 13 appareils HW-GPT-Bench, face à un proxy RTX3080, la corrélation de rang de Spearman cible va de 0,951 à 0,996 — excellente — tandis que le risque de violation par réutilisation du proxy va de 33,3 % à 100 % sous contraintes conjointes appariées.

Trois objets d’évaluation distincts, donc : la portabilité du rang, la portabilité de la faisabilité, et le support décisionnel spécifique à la cible. Un classement peut être parfaitement transférable et néanmoins inutilisable pour décider.

Les échecs de comptage ne sont pas un seul phénomène

Compter les éléments d’une liste entre crochets semble trivial ; les modèles de chat à poids ouverts se trompent souvent. La littérature blâme habituellement des goulots d’entrée — fragmentation sous-mot, dilution d’attention — ce qui prédit que tous les modèles devraient échouer de la même manière. Sur sept modèles instruct et des invites identiques, les mauvaises réponses forment au contraire des modes distincts : Qwen et Gemma 27B transforment souvent les longueurs impaires en un entier pair voisin ; OLMo concentre ses erreurs sur quelques entiers de taille intermédiaire ; Llama sous-compte. Ces modes sont des étiquettes utiles mais pas une loi de famille — Gemma 9B ne reproduit pas le saut impair-vers-pair de Gemma 27B — et une fragmentation sous-mot plus forte ne rend pas le comptage plus difficile sur ce benchmark.

Plus intéressant : quand le modèle répond faux, une sonde linéaire peut généralement encore récupérer le vrai compte depuis le flux résiduel. Et reproduire la même erreur impair-vers-pair n’implique pas le même remède : mettre à l’échelle une sortie MLP tardive aide modestement Qwen mais est quasi sans effet sur Gemma 27B sous protocole identique, tandis que le pilotage résiduel ne déplace les deux qu’en échangeant des gains impairs contre des pertes paires. Conclusion opérationnelle : ne pas transférer ce remède d’amplitude entre modèles sans test de transfert.

Le reste de la journée, en bref

tokenizers v1 (Hugging Face) mérite une mention pour la rareté du geste : le but était de conserver les identifiants de jetons, l’API, le vocabulaire et les rangs de fusion et d’améliorer tout le reste. Quatre changements portent le gain — une fonction de découpage écrite à la main qui remplace le moteur d’expression régulière par des opérations booléennes sur des flux de bits via SIMD (« bitcannon », 64 octets par opération de registre, comme Parabix ou simdjson) ; un cache de mots local au fil, mémoïsant les octets d’un pré-jeton vers ses identifiants finis ; une boucle de fusion réécrite avec un tampon de travail fourni par l’appelant (les symboles vivent dans un tableau plat lié par positions, chaque paire candidate tenant dans une valeur 64 bits avec le rang de fusion dans les bits hauts, donc « pas de fusion ici » est la plus grande valeur possible et la boucle avance sans branchement) ; et un appel de modèle par lot de pré-jetons au lieu d’un par pré-jeton. Résultat : 3 à 30× plus rapide que la v0.23 sur un fil (bas de gamme t5-base, haut de gamme gpt2) sur Apple M4 Max, 76 % de mise à l’échelle linéaire sur huit workers, identifiants strictement identiques. La méthode de benchmark est elle-même exemplaire, avec un encadré listant les règles (boucle de temps unique, chargement du vocabulaire exclu, vérification FNV-1a des identifiants, cellules communes seulement, épinglage sur cœurs physiques, Jobs indépendants) et l’avertissement que « encoder un document en boucle » et « encoder un flux de documents distincts » sont deux charges différentes qu’on appelle souvent toutes les deux « chaudes ».

Pruning par Ising (Multiverse Computing) propose la reformulation la plus radicale : la sélection de blocs à supprimer n’est pas un problème de classement mais un problème combinatoire à variables binaires en interaction, puisque retirer le bloc 20 dépend de si on a aussi retiré le 19 ou le 24. En développant le lagrangien au second ordre, on obtient un hessien dont la diagonale mesure l’importance isolée et les termes hors-diagonale sont exactement les couplages que les méthodes de champ moyen jettent. Minimiser l’énergie de ce verre d’Ising et maximiser le score devient alors la même recherche. Le hessien se calcule une fois sur un petit jeu de calibration et se réutilise pour tout objectif de compression. À 50 % de compression de Llama-3.3-70B-Instruct, le gain atteint presque 23 points de MMLU sur la meilleure méthode concurrente (32/80 et 40/80 blocs retirés) ; sur Qwen3-14B à 12/40, environ 10 points. Et le détail le plus intéressant : l’énergie étant un proxy fort mais imparfait, le 17e état excité — le premier à proposer de retirer un bloc en début de modèle — finit, après léger réentraînement, meilleur que l’état fondamental sur plusieurs benchmarks. La meilleure configuration est un état excité, pas le minimum.

Multiple latent orderings propose une explication différente de l’intransitivité des préférences des LLM (A préféré à B, B à C, C à A), habituellement traitée comme bruit d’échantillonnage autour d’un ordre latent unique. Les auteurs montrent d’abord que les incohérences observées ne peuvent pas s’expliquer par un ordre unique sous aucune fonction de lien monotone, puis introduisent un modèle Bradley-Terry mélangé augmenté de bruit. Sur sept modèles et quatre tâches, un mélange d’ordres explique souvent mieux les incohérences structurelles — et sur les dilemmes de Moral Machine, des modèles qui divergent en ordre agrégé partagent encore des composantes latentes. Conclusion pour l’alignement : les pipelines qui traitent les préférences d’un LLM comme une fonction unique risquent de moyenner des ordres cohérents que des utilisateurs différents endosseraient différemment.

Contrastive World Models attaque un problème classique des modèles du monde : les objectifs de reconstruction pixel laissent l’information non pertinente dominer. En remplaçant la reconstruction d’observation par une borne inférieure de type Deep InfoMax qui maximise l’information mutuelle entre séquences état-action et caractéristiques de patchs locaux des observations futures, les représentations conservent le prédictif sans reconstruire l’accessoire. Sur des environnements à complexité visuelle croissante, la méthode égale Dreamer par défaut et surpasse largement Dreamer et une baseline de momentum dès que des distracteurs ou des arrière-plans vidéo naturels apparaissent — tout en entraînant plus efficacement, le décodeur pixel ayant disparu.

📊 Analyse : cinq fois le même basculement

Il faut prendre la mesure de ce qui se passe. Sur les treize travaux techniques retenus ici, cinq ne proposent aucun gain de performance principal : ils invalident un protocole de comparaison. PAGE montre qu’une moyenne cache une classe d’entrées catastrophiques. Le taux d’apprentissage partagé montre qu’un verdict comparatif dépend d’un paramètre non déclaré. La portabilité de rang montre que le transfert de classement ne fonde pas la décision. Les échecs de comptage montrent qu’un mode d’erreur ne se transpose pas entre familles. GRRR montre que la composante où l’on croyait trouver le signal de post-entraînement ne le porte pas.

Ce basculement a une cause structurelle identifiable : on est passé de la contrainte de calcul à la contrainte de validité. Tant que l’entraînement et l’inférence coûtaient cher, la question était « est-ce que ça marche mieux ? ». Quand la compression atteint 50 % de blocs, quand un cache KV peut être réduit d’un facteur nominal 16, quand la tokenization est déjà 30 fois plus rapide, le facteur limitant n’est plus le débit, c’est l’aptitude à savoir si l’on mesure la bonne chose. PRQuant le formule à sa manière : le gain numérique de la permutation est marginal, l’intérêt est le layout contigu qui supprime une opération dynamique. Le gain structurel bat le gain numérique.

Il y a un corollaire inconfortable pour la pratique. La plupart de ces pièges sont invisibles dans un tableau de résultats, parce qu’ils vivent dans la définition même de la cellule mesurée. Le cas des échecs de comptage est le plus parlant : la sonde linéaire récupère le vrai compte depuis le flux résiduel alors que le modèle se trompe en sortie. Autrement dit, l’information est présente et le comportement est faux — ce qui veut dire que « le modèle ne sait pas » est une description incomplète ; il faudrait dire « le modèle sait et ne restitue pas ». Les deux formulations mènent à des décisions d’ingénierie opposées.

Le cas HRM ajoute une couche : les auteurs constatent que les features SAE les mieux classées n’ont pas d’avantage stable sur des sous-ensembles aléatoires de même taille, et que les directions de sonde linéairement décodables ont des effets d’ablation comparables à des contrôles aléatoires. C’est un rappel sévère pour l’interprétabilité appliquée : la décodabilité d’une variable n’établit pas sa causalité, et les outils conçus pour les modèles à passe unique ne se transposent pas aux modèles de raisonnement latent récursif.

La bonne nouvelle est que la parade est peu coûteuse et commence à devenir une norme de publication. Enregistrer la matrice bras × taux au lieu d’une colonne. Publier le taux de violation du réglage joint à côté de la corrélation de rang. Rapporter le taux de nuisance à côté de la précision moyenne. Vérifier le transfert d’un remède avant de le généraliser. Comparer les features interprétables à des sous-ensembles aléatoires de taille appariée. Ce sont des lignes de protocole supplémentaires, pas des mois de calcul — et elles décident de la valeur de tout le reste.

🎯 À retenir

  • PAGE transforme l’éviction du cache KV en décision d’admission par entrée, détectée par un scalaire unique sans étiquette : le taux de nuisance passe de 0,75 à 0,026 sur quatre évinceurs, quatre modèles et deux benchmarks. Mais ce n’est pas un compresseur — la compression réelle plafonne à 1,8-3,4× pour un budget nominal de 16×.
  • Un taux d’apprentissage partagé n’est pas un contrôle neutre : sous LoRA sur GSM8K, le verdict dense contre sélectif passe de 10,1 pp à 5,1 pp selon le taux, jusqu’à 17,7 pp d’amplitude pour un sélecteur de teachability, et deux des six appels de significativité basculent entre taux adjacents. Rapporter la matrice bras × taux, pas une colonne.
  • La portabilité du rang n’implique pas celle de la faisabilité : sur 10 000 architectures GPT et 13 appareils, la corrélation de rang atteint 0,951-0,996 face à un proxy RTX3080, mais le risque de violation sous contraintes conjointes monte de 33,3 % à 100 %. Un classement peut être parfaitement transférable et inutilisable pour décider.
  • Les échecs de comptage de liste sont sept phénomènes distincts, pas une loi de famille : Qwen et Gemma 27B transforment les impairs en pairs voisins, OLMo se trompe sur des entiers intermédiaires, Llama sous-compte. Et une sonde linéaire récupère le vrai compte quand la sortie est fausse.
  • Le pruning reformulé en verre d’Ising gagne presque 23 points de MMLU sur Llama-3.3-70B à 50 % de compression, mais l’état fondamental n’est pas la meilleure configuration : le 17e état excité, qui retire un bloc précoce, le bat après réentraînement.
  • GRRR montre que retirer la composante diagonale du post-entraînement préserve l’essentiel des gains : ceux-ci vivent dans la reconfiguration et l’extension des voies pré-entraînées, pas dans un changement des valeurs singulières.
  • tokenizers v1 encode 3 à 30× plus vite sur un fil, à 76 % de mise à l’échelle sur huit workers, avec des identifiants strictement identiques — le bon exemple d’un refactor qui ne change que ce qui doit être changé.
  • La leçon de la journée : à ce stade d’optimisation, les contraintes ne sont plus le débit ni la mémoire mais la validité du verdict. Les paliers suivants s’obtiendront en instrumentant la mesure, pas en ajoutant des FLOPs.

A lire aussi