Efficacité de l'inférence LLM : élaguer les experts, distiller par le jeu, router selon la chaleur du téléphone
💡 En résumé
Après la course à l’échelle, la recherche s’attaque à la facture — et découvre que la mesure fait partie du résultat. Quatre mouvements structurent la production scientifique de ce lundi.
Élaguer mieux, pas moins. RAZOR montre qu’à budget d’élagage fixé, la question pertinente n’est ni l’usage d’un expert ni l’amplitude de sa contribution, mais si le calcul survivant peut remplacer sa fonction. En scorant la « remplaçabilité fonctionnelle » par les résidus de consensus — l’écart des sorties d’un expert à la mixture pondérée d’origine — la méthode dépasse REAP de 2,12 à 5,59 points et gagne 36 comparaisons par paire sur 36, à 25 % et 50 % d’experts retirés sur quatre modèles.
Distiller autrement. La distillation par jeu (SPSD) utilise des réseaux de type MuZero entraînés sur des jeux de plateau pour générer des chaînes de pensée surhumaines : sur Qwen3-4B-Base, la moyenne sur six benchmarks de mathématiques passe de 24,1 à 36,6 et le taux de victoire sur des jeux tenus à l’écart de 15 % à 45 %. TISD, de son côté, force une branche choisie par l’enseignant puis laisse l’élève générer la suite : +1,2 point d’Avg@4 sur les modèles de code.
Router selon la physique du matériel. HybridInfer révèle un échec peu documenté : sur un appareil Snapdragon haut de gamme, la génération soutenue en local déstabilise le runtime d’inférence GPU, qui plante ou se bloque silencieusement après quelques requêtes — le problème vient de la chaîne d’outils actuelle (compilation de noyaux OpenCL, pré-remplissage de longs prompts) et s’aggrave avec la longueur de génération. Le routeur proposé apprend en plus à créditer l’exécution locale, sans quoi la politique optimale décharge toutes les requêtes vers le cloud.
Vérifier la preuve. Enfin, un article de méthode rappelle qu’une statistique publiée sans la grandeur qui la rend interprétable n’est pas une preuve : la similarité cosinus entre une direction d’interprétabilité en pleine précision et son équivalent quantifié se lit contre un plancher de bruit qui dépend d’un nombre non rapporté. À INT4, la direction a tourné au-delà de ce plancher ; à INT8, aucun mouvement n’est détecté — ce qui n’est pas une preuve d’équivalence.
🔥 Tendances : l’efficacité se mesure désormais en contrainte, pas en vitesse
Élagage : la replaceabilité plutôt que l’importance
Les modèles à mélange d’experts n’activent que quelques experts par jeton mais stockent toute la réserve. L’élagage réduit ce coût de stockage, et à budget fixé l’objectif est de préserver au mieux la distribution de sortie d’origine. Or ni le taux d’usage ni l’amplitude de contribution d’un expert ne déterminent les dégâts causés par son retrait. RAZOR introduit donc un score de remplaçabilité fonctionnelle fondé sur les résidus de consensus : des identités exactes de suppression unique à entrée de couche fixée, qui tiennent compte de la renormalisation des survivants et du remplissage choisi par le routeur, fournissent des scores locaux agrégés sur des jetons de calibration — sans gradient ni réentraînement de récupération.
Sur GLM-4.7-Flash, Qwen3.6-35B-A3B, DeepSeek-V4-Flash-0731 et Hy3, à 25 % et 50 % d’experts retirés, RAZOR obtient la meilleure moyenne macro sur neuf tâches dans les huit configurations évaluées. Sur les deux bases disposant de runs REAP appariés, il dépasse REAP de 2,12 à 5,59 points et remporte les 36 comparaisons de tâches par paires ; il réduit aussi la KL inverse dans les quatre configurations modèle-budget appariées. La réserve des auteurs mérite d’être reprise : l’analyse des réponses de Qwen3.6-35B-A3B révèle des changements de diversité, de formatage et de terminaison — conserver les tâches et la fidélité prédictive ne garantit pas la stabilité de la génération.
Distillation : le jeu comme source de données surhumaines
SPSD part d’un constat économique : la rareté des données de raisonnement vient de la faible qualité des données synthétiques et du coût de l’annotation humaine. La méthode génère des données synthétiques « surhumaines » par auto-jeu de réseaux de type MuZero entraînés sur des jeux de plateau, en utilisant des environnements exécutables pour transformer la recherche en problèmes de raisonnement structurés. À chaque état, l’expert identifie une décision préférée, des alternatives plausibles, des réponses d’adversaire plausibles et des estimations de valeur. Converties en chaînes de pensée, ces traces de recherche fournissent une supervision ancrée dans l’environnement. Le résultat notable est le transfert : entraîné uniquement sur des traces d’auto-jeu, le modèle gagne en mathématiques non vues — de 24,1 à 36,6 en moyenne sur six benchmarks, et de 15 % à 45 % de taux de victoire sur les jeux tenus à l’écart, sur Qwen3-4B-Base.
TISD aborde le problème par l’autre bout : la distillation auto-appliquée en politique (OPSD) fournit des cibles denses mais ne les évalue que le long des rollouts échantillonnés par l’élève. Quand l’enseignant privilégié préfère une autre action à un préfixe visité, OPSD supervise la décision de branchement mais pas les contextes successeurs induits par cette action, sauf si l’élève l’échantillonne. Le diagnostic par interventions contrôlées sur les jetons montre qu’un jeton préféré par l’enseignant au pic de désaccord peut améliorer la suite, alors que sa valeur corrective locale est limitée — ce qui déplace le rôle du désaccord : proposer une branche plutôt que réparer localement. L’algorithme branch-regenerate-distill force une action de branche choisie par l’enseignant, rend la génération du suffixe à l’élève et distille la trajectoire complète sous l’enseignant conditionné au contexte privilégié. Gain : +1,2 point d’Avg@4 sur les modèles de code face à SDPO, et +0,8 point d’Avg@128 en sciences à budget d’étapes égal (+0,3 à budget de temps égal).
Composition de LoRA sans entraînement
JevSoup sépare le routage « Système 1 » de l’exécution « Système 2 ». À partir de la seule entrée et des descriptions d’experts, Jev sélectionne deux experts par probabilités structurées ; JevSoup conserve la mise à jour de l’expert principal, projette la seconde sur le complément orthogonal de l’espace des lignes de la première et les combine à poids égaux. Sur 14 tâches PorTAL et trois échelles Qwen3, le gain atteint jusqu’à 1,19 % en exactitude macro-tâche et 1,21 % en micro-échantillon face aux meilleures baselines externes évaluées — sans données auxiliaires, sans entraînement supplémentaire et sans décodage autorégressif.
Décodage spéculatif : quand l’approximation dépasse la cible
Mentored Decoding formalise un phénomène observé expérimentalement : le décodage spéculatif « avec perte » — qui autorise une dérive par rapport au modèle cible pour gagner en vitesse — peut aussi battre la cible en qualité. L’article le prouve en reliant l’inférence à la théorie du boosting, et en généralisant le décodage mentoré à l’ensemble des f-divergences. Propriétés dégagées : la nature géométrique particulièrement élégante du cas de la variation totale ; des approximations simples pour toute f-divergence en relation directe avec la conformité au boosting ; et une structure de données indépendante de la divergence, en espace O(n) et temps O(sort(n)), construite sur les sorties du drafter et de la cible, qui permet d’interroger en O(log n) les paramètres optimaux du problème dual et de construire les distributions mentorées optimales en O(n). L’approximation cesse ici d’être une dette : elle devient une correction.
🤖 Nouveaux outils : routeurs, maillages et bancs d’essai
HybridInfer est le plus concret. Le point de départ est un constat matériel : l’inférence locale avec un petit modèle garde les données sur l’appareil, fonctionne hors ligne et coûte zéro par requête, mais elle est thermiquement contrainte — et la contrainte est plus tranchante qu’un simple ralentissement. Sur un appareil Snapdragon haut de gamme, la génération locale soutenue déstabilise le runtime GPU, qui plante ou se bloque silencieusement après quelques requêtes consécutives ; l’échec réside dans la chaîne d’outils actuelle et s’aggrave sur les générations longues. Le routeur à trois paliers (Llama 3.2 3B en local, Llama 3.1 8B en edge avec récupération, GPT-4o dans le cloud) utilise la marge thermique du téléphone et une estimation de complexité comme état, et choisit un palier par politique Q-learning entraînée hors ligne. La récompense arbitre qualité, latence, coût et une pénalité thermique, plus un bonus de localité — que les auteurs identifient comme la précondition du routage thermique : sans ce bonus, la politique optimale décharge toutes les requêtes. Sur un banc Android réel de 210 prompts, le routeur appris obtient une qualité significativement supérieure à deux heuristiques réglées à la main (Wilcoxon apparié, p < 0,02) au coût le plus bas de toutes les conditions adaptatives. Les conditions « toujours en local » égalent la qualité par requête sur les requêtes servables, mais sont trois à six fois plus lentes et échouent sur les requêtes longues : le routage gagne donc sur la latence, la fiabilité et la couverture, pas sur la qualité.
TalkMesh propose un maillage décentralisé de petits agents qui apprennent quand et quoi communiquer. Chaque agent échantillonne une proposition et la note avec une tête de confiance entraînée ; l’agent le plus confiant diffuse un indice, les agents sous un seuil de confiance révisent leur réponse en conservant toute révision qui surpasse leur proposition ; un consensus de type gossip approxime le vote pondéré par la confiance sans coordinateur. Une politique de « conversation », entraînée par optimisation de politique relative de groupe sur la variation d’exactitude après révision, écrit les indices et les révisions. Résultat frappant : avec trois agents produisant ensemble au plus six sorties, le maillage atteint l’exactitude du vote majoritaire sur 32 échantillons pour chacun des trois modèles testés. Entraîné avec au plus 8 agents et évalué avec 32, il fait passer l’exactitude de 0,568 à 0,705 (Qwen3.5-0.8B, GSM8K) et de 0,492 à 0,722 (SmolLM3-3B, MATH-500). Sa faiblesse est aussi documentée : quand 4 agents sur 8 collusionnent sur une réponse fausse avec confiance fabriquée et indices empoisonnés, le vote majoritaire tombe à 0,000 — un maillage défendu, dont les agents renotent les solutions avec leurs propres têtes de confiance, conserve 0,507.
Cost-Aware Best-LLM Identification formalise un problème très pratique : identifier le meilleur modèle parmi une collection de LLM à coûts d’interrogation hétérogènes, avec retour de duel (comparaisons par paires fournissant des signaux de préférence robustes). Sous hypothèse d’existence d’un gagnant de Condorcet — hypothèse validée empiriquement sur plusieurs jeux de données réels — les auteurs proposent un algorithme de type Track-and-Stop pour l’identification du meilleur bras à confiance prescrite, prouvent qu’il atteint asymptotiquement le coût optimal quand l’erreur tend vers zéro, et observent des améliorations constantes face aux algorithmes classiques non conscients du coût.
In-Context Binding Capacity mesure une limite fondamentale : combien d’assignations un modèle peut-il rappeler avant de perdre la correspondance entre entité et valeur ? Les courbes de rappel continu, sur 12 modèles de 3 milliards de paramètres ou moins, donnent une charge à mi-chemin du hasard suivant K₅₀ = cN^α avec α = 0,820 (R² = 0,73) ; un balayage de seuil sur 30 modèles ouverts jusqu’à 12 milliards montre un facteur huit lié à la recette de pré-entraînement, même si les courbes continues ne révèlent aucun effet détectable de la recette après contrôle de l’échelle. Deux résultats de méthode sont à retenir : l’entraînement direct sur la tâche dépasse la loi zéro-shot extrapolée, mais des critères de mesure différents empêchent d’interpréter cette comparaison comme un gain de capacité ; et les bornes sur le rappel conjoint relient cette mesure à la mémoire de travail et au suivi d’instructions, sans traiter le rappel comme une mesure de l’alignement.
📊 Analyse : la mesure comme partie du résultat
Une similarité sans plancher de bruit n’est pas une preuve
L’article le plus utile méthodologiquement part d’une pratique répandue en sécurité de l’IA : les artefacts d’interprétabilité sont calibrés sur des poids pleine précision, déployés sur des poids quantifiés, puis certifiés comme ayant survécu au changement par des statistiques invariantes d’échelle — similarité cosinus, corrélation, AUROC — rapportées sans leur plancher de bruit. Pour l’estimateur de direction par différence de moyennes, ce plancher entre deux moitiés d’échantillon est gouverné par un seul nombre sans dimension : κ = nρ²/d. La forme fermée E[cos] ≈ (1 + 4/κ)⁻¹ est classique ; il manque l’entrée ρ, la séparation de classes, que les auteurs mesurent sur des activations réelles — et qu’aucune étude de transfert sous compression ne rapporte. Sur Qwen2.5-1.5B-Instruct, ρ vaut 33 à 61 selon la profondeur, si bien que deux exécutions indépendantes de l’estimateur concordent à 0,978-0,994 par simple échantillonnage. Un cosinus publié de 0,996 entre directions de refus en pleine précision et en quantifié ne peut donc pas se lire comme une préservation sans le n auquel il a été calculé, qui n’est pas donné.
Là où n est connu, les auteurs jugent chaque cosinus en basse précision contre le plancher de bruit mesuré à l’intérieur du modèle quantifié — car un plancher calculé en pleine précision suppose que l’estimateur basse précision a la même variance, hypothèse que le plancher existe précisément pour tester. Conclusion nette : à INT4, la direction a tourné et le déficit dépasse le bruit propre de l’estimateur ; à INT8, aucun mouvement n’est détecté, ce qui n’est pas une affirmation d’équivalence. Autre apport : une statistique invariante d’échelle ne peut pas distinguer une translation d’une atténuation d’une variable de décision transférée — alors que les deux appellent des correctifs opposés. Les recommandations de reporting coûtent un seul passage avant.
Le raisonnement à l’inférence n’est pas un gain économique automatique
The Price of Thought pose la question en termes d’économie, pas de score. Sur un an d’actions américaines, trois conditions d’entrée (numérique, actualités identifiables, actualités masquées), plus de 800 000 prédictions d’actifs et des générations répétées, en faisant varier l’effort de raisonnement à information, prompts, formats de sortie et construction de portefeuille constants : sur les trois familles de modèles (DeepSeek, GPT, Gemini), un raisonnement supplémentaire ne produit aucune amélioration fiable du rendement net de portefeuille. Pour DeepSeek, où toute la progression du sans-raisonnement au raisonnement maximal est examinée, la performance est non monotone. Les générations répétées produisent des effets de traitement instables et des sélections de portefeuille instables, même quand les scores globaux restent similaires.
Ce que ces quatre travaux disent ensemble
RAZOR montre qu’un critère bien choisi (la replaceabilité) bat le critère intuitif (l’importance) ; Mentored Decoding montre qu’une approximation mal comprise peut être une amélioration ; HybridInfer montre qu’une contrainte physique ignorée par les routeurs en simulation devient un mode de panne en production ; l’article sur la quantification montre qu’une métrique sans sa référence n’est pas une mesure. Le fil est le même que dans l’actualité des agents : la discipline de mesure progresse plus vite que la capacité. Pour un praticien qui déploie, cela se traduit en trois habitudes — tester l’élagage sur la stabilité de génération et pas seulement sur la rétention de tâches, comparer les routeurs sur du matériel réel, et exiger de chaque statistique de transfert le nombre auquel elle a été calculée.
🎯 À retenir
- Élaguer selon la replaceabilité : le score par résidus de consensus dépasse REAP de 2,12 à 5,59 points et gagne 36 comparaisons par paire sur 36, sur 8 configurations de retrait (25 % et 50 % d’experts) — et sans réentraînement de récupération.
- Rétention de tâches ≠ stabilité de génération : après élagage, la diversité, le formatage et la terminaison des réponses changent — à contrôler séparément.
- Le jeu fournit des données de raisonnement : la distillation par auto-jeu de réseaux MuZero fait passer Qwen3-4B-Base de 24,1 à 36,6 de moyenne en mathématiques et de 15 % à 45 % de taux de victoire, avec transfert hors du domaine d’entraînement.
- Router selon la chaleur : la génération locale soutenue déstabilise le runtime GPU mobile (blocages silencieux) ; un bonus de localité est la condition nécessaire pour qu’une politique thermique n’expédie pas tout vers le cloud.
- La communication remplace l’échantillonnage : 3 agents pour ≤ 6 sorties égalent un vote majoritaire sur 32 échantillons ; mais 4 agents faussaires sur 8 suffisent à faire tomber le vote à 0,000, contre 0,507 pour un maillage défendu.
- Cosinus sans plancher de bruit n’est pas une preuve : κ = nρ²/d, ρ = 33-61 mesuré ; à INT4 la direction tourne au-delà du bruit, à INT8 aucun mouvement — et une statistique invariante d’échelle ne distingue pas translation d’atténuation.
- Le raisonnement à l’inférence ne se paie pas tout seul : sur 800 000+ prédictions et un an d’actions américaines, aucun gain fiable de rendement net, avec des effets instables à générations répétées.