Inférence LLM : l'atlas Pareto, la réparation des caches KV et les MoE servis depuis le SSD
💡 En résumé
Le gisement d’optimisation de l’inférence n’est plus dans l’algorithme miracle mais dans l’arbitrage documenté. Un atlas Pareto mesure 54 configurations réelles sur trois GPU et montre que la quantification gagnante change selon la contrainte — et qu’une mauvaise configuration de cache KV peut anéantir le bénéfice. Un second travail établit que réparer un cache KV après édition de document tient à la contiguïté, pas à l’importance attentionnelle. Un troisième sert un MoE de 35B paramètres depuis un SSD sur une machine de 24 Go à 20 jetons/seconde, en 3 GiB de mémoire active.
À côté de ces résultats d’infrastructure, deux inflexions de produit : Anthropic fusionne enfin chat, Cowork et Artifacts dans une seule surface avec routage automatique, et Google ouvre un serveur MCP pour Google Home — n’importe quel agent compatible, Claude, Hermes, OpenClaw, ChatGPT ou Antigravity, peut piloter la maison.
🔥 Tendances : l’inférence passe du « speedup » au « régime »
L’atlas Pareto : 54 configurations mesurées, trois GPU, un simulateur calibré
L’argument de départ de l’Inference Engineering Pareto Atlas (arXiv 2609.17863) est méthodologique : les optimisations d’inférence annoncent leurs gains sur des modèles, GPU, prompts et métriques de qualité différents, ce qui les rend incomparables et non combinables. La réponse est un atlas coût-qualité-latence construit sur 54 configurations de Qwen2.5-7B-Instruct sous vLLM 0.12, sur L4, A100 et H100, servant d’ancres pour calibrer un simulateur qui reproduit les mesures aux tailles de lot ancrées avec une dérive inter-campagnes inférieure à 1,5 %.
L’évaluation qualité sépare FP16, AWQ 4 bits, poids FP8 et cache KV FP8 sur 200 questions GSM8K à cinq exemples par prompt ; l’attention parcimonieuse n’est évaluée qu’en simulation. Résultats :
- 18 des 36 configurations de la grille calibrée atteignent la frontière de Pareto.
- Les méthodes combinées y arrivent plus souvent que les méthodes isolées : 9 sur 15 combinaisons contre 9 sur 21 méthodes seules.
- AWQ 4 bits réduit la latence par jeton à 0,34× la référence sur L4, mais perd 5,9 % d’exactitude GSM8K stricte — manquant de peu le plancher de qualité fixé à 95 %, dans l’incertitude d’échantillonnage. Indice intéressant : une extraction de réponse plus souple retrouve la précision FP16, ce qui suggère que la perte vient du formatage, pas de l’arithmétique.
- Les poids FP8 conservent 99,4 % de la précision de référence à 0,61-0,65× la latence sur les trois GPU, et apparaissent dans trois des quatre gagnants de régime.
- Un cache KV FP8 naïf maintient un débit normal sans préserver la qualité des réponses : le gain de débit ne survit pas à l’usage réel.
La leçon opérationnelle est qu’il n’existe pas de « meilleure configuration » : il existe une frontière, et le choix dépend du régime de déploiement. FP8 sur les poids apparaît comme le pari le plus robuste ; la quantification agressive du cache KV est le pari le plus dangereux.
Réparer un cache KV : la contiguïté, pas l’importance
La réutilisation de cache KV réduit le coût d’inférence en RAG et dans les systèmes agentiques — mais le contexte mis en cache devient périmé dès que la connaissance récupérée, la mémoire de travail ou l’état utilisateur est édité. Sous attention causale, une édition locale affecte les états KV en aval. Un re-prefill complet restaure la cohérence de manière fiable mais coûte cher ; rafraîchir seulement le segment édité laisse les dépendances aval périmées.
« Contiguity, Not Importance » (arXiv 2609.17983) formule la réparation en place comme un problème de recalcul sous budget et compare des politiques de sélection de positions sans entraînement, sur un benchmark RAG factuel avec éditions directes et dérivées appariées. Sur trois familles de modèles, toutes les politiques réparent les cas directs, mais les cas dérivés les départagent nettement. Au budget principal, une fenêtre contiguë locale à l’édition récupère au moins 0,94 de la marge de réponse post-édition et surpasse substantiellement les sélecteurs fondés sur l’attention, la déviation KV et la structure.
L’analyse mécaniste explique pourquoi les heuristiques intuitives échouent : des ensembles de positions efficaces en transplantation depuis un état propre peuvent échouer en recalcul réel, parce que les positions dispersées héritent de la péremption environnante. L’avantage du local dépend de l’adjacence et disparaît largement quand le texte porteur de la réponse se déplace en aval. Comme les éditions pertinentes pour la réponse corrompent presque toujours le comportement du modèle et que la gravité de l’échec est difficile à prédire, et comme la réparation est 13 à 21 fois plus rapide qu’un re-prefill complet, la conclusion est un soutien à la réparation locale inconditionnelle tant que le texte dépendant reste adjacent à l’édition. Autrement dit : une règle conditionnelle précise vaut mieux qu’un optimiseur de positions.
Servir un MoE 35B depuis le SSD : le prerouter comme clé
L’inférence MoE sur matériel grand public est bornée par la mémoire de poids : un modèle de classe 35B pèse 19,5 Go en 4 bits, et la parcimonie réduit le calcul par jeton, pas les octets qu’il faut détenir. Le déport naïf vers SSD ne suffit pas, parce que les experts de la couche N+1 doivent être choisis avant que la sortie de la couche N existe : les lectures ne peuvent pas démarrer assez tôt pour se cacher derrière le calcul.
Edge0 (arXiv 2609.18063) referme l’écart avec un prerouter : une tête par couche prédit le routage de la couche suivante avec un jeton d’avance, et la prédiction est consommée comme le routage lui-même, de sorte que l’ensemble d’experts chargé est exactement l’ensemble routé et que rien n’est écarté. Un LoRA de récupération non fusionné, entraîné sur le chemin étudiant, rembourse la qualité perdue par la quantification int4 et le remplacement du routage. Sur une seule machine de 24 Go, Edge0 sert un MoE 35B à 20 jetons/seconde dans 3 GiB de mémoire active maximale, à quelques points de son professeur FP16 en moyenne sur cinq benchmarks publics. Un palier 8B tourne sur le même cadre — et le cadre, les checkpoints et les adaptateurs sont open source.
Décodage spéculatif : désynchroniser le lot, et lire moins de bits
Deux travaux attaquent le même goulot — la lecture répétée du cache KV qui rend le décodage limité par la mémoire.
ASPIRE (arXiv 2609.17943) part d’un constat de gaspillage : les méthodes spéculatives par lots restent synchronisées, toutes les requêtes partageant un même calendrier brouillon-vérification, alors que la longueur optimale de brouillon varie fortement d’une requête à l’autre et à l’intérieur de chaque requête. Trois composants : un forward mixte unifié qui laisse requêtes en brouillon et en vérification cohabiter dans la même passe de lot ; un ordonnanceur de spéculation en ligne léger, utilisant des estimations de taux d’acceptation par requête et un modèle de coût conscient du lot, pour que chaque requête choisisse indépendamment quand vérifier ; et une couche de rafraîchissement intra-brouillon qui exécute l’attention complète à une seule couche désignée pendant le brouillon, réduisant la péremption. Sur trois modèles et cinq benchmarks de raisonnement et de contexte long : 1,70 à 4,58× d’accélération du débit de décodage par rapport aux références autorégressives, et environ +27 % de gain moyen sur les meilleures références spéculatives antérieures.
Fathom (arXiv 2609.17652) déplace le curseur du côté de l’index. Quand les sessions agentiques atteignent le million de jetons avec de nombreuses sessions résidentes, le cache KV et l’index qui le classe vivent en mémoire hôte, et le balayage qui ordonne les n clés devient le trafic qui borne le décodage. Fathom permet à chaque requête de décider combien de bits de chaque canal de clé lire : le cache K 4 bits est stocké canal-majeur en plans de bits, si bien qu’un préfixe de t plans est exactement le quantifieur t bits du canal, et la requête dépense son budget de bits par remplissage d’eau inversé sur l’importance pondérée par la variance de ses canaux. À un million de jetons sur Qwen3-8B, une étape de décodage est 1,67× plus rapide en temps GPU que les balayages à 136 bits de Double Sparsity, Loki et SparQ r=32. Fait notable pour la précision : 92 bits suffisent à Fathom pour égaler l’accord d’étape du balayage 136 bits le plus précis sur de vraies sessions d’agents de codage. Le stockage requis est la copie K 4 bits qu’une pile de service quantifiée détient déjà — et la méthode n’est pas plus rapide quand l’index est résident en mémoire GPU.
Le reste du peloton
TabPFN-3.5 (arXiv 2609.17895) pousse le modèle de fondation tabulaire : nouvel état de l’art sur TabArena, extension aux données non i.i.d. avec découpages temporels ou groupés, tables avec chaînes, texte et images, caractéristiques catégorielles à forte cardinalité et tables larges. La variante Fast tourne jusqu’à 3× plus vite que TabPFN-3 en gardant l’essentiel des gains, et le mode Thinking gagne jusqu’à 12× de vitesse face à TabPFN-3-Thinking. C’est la brique qui intéresse directement quiconque fait du tabulaire en production sans vouloir entraîner.
Colla-Q (arXiv 2609.18131) attaque la quantification des MoE par une allocation de largeur de bits fondée sur l’entropie d’activation, avec un objectif d’équilibrage minimax de la précision entre experts. L’argument : un MoE fonctionne comme un ensemble, et la dégradation marquée d’un expert particulier nuit à l’ensemble. En encourageant les experts à opérer collaborativement après quantification, la méthode améliore la performance globale et réduit la dépendance au jeu de calibration — donc gagne en robustesse quand on change de données de calibration. Code publié.
Câblage sparse rotatif sur l’hypercube (arXiv 2609.18145) pose la question la plus radicale : jusqu’où aller avec un câblage fixe, sparse, simplement tourné d’une couche à l’autre ? En traitant les n positions d’une séquence comme les sommets d’un hypercube de dimension log₂n et en connectant chaque position, à la couche ℓ, à son voisin selon la dimension ℓ mod log₂n, toute l’information atteint toute position en log₂n couches avec 2n liens par couche au lieu de n². Sur une tâche synthétique insoluble sans atteindre toutes les positions, la rotation égale le câblage tout-à-tout avec 1/32 des liens — alors que le même motif sparse maintenu fixe entre les couches échoue : ce qui compte est que chaque dimension soit touchée, pas l’ordre. En modélisation de langage au niveau caractère sur les 12 premiers millions de caractères d’enwik8, un hybride gardant deux couches d’attention parmi seize couches sparses obtient 0,06 bit par caractère de moins en perte tenue à l’écart qu’un modèle pleinement attentif de même largeur au même budget d’étapes — avec 1/7 des liens, 42 % de paramètres en moins et 2,4× moins de temps horloge. Sur un second corpus mêlant japonais, anglais et code, l’écart passe à 0,16. La fenêtre de taux d’apprentissage utilisable est quatre à huit fois plus large que celle de l’attention.
Deux compléments utiles aux équipes qui servent des modèles : Beyond the Previous Layer (arXiv 2609.17940) explore la structure prédictive résiduelle dans le routage sparse des MoE — au-delà de la couche précédente —, ce qui intéresse directement les stratégies de préchargement d’experts ; Pay Only for Disagreement (arXiv 2609.17560) propose des verdicts de non-régression certifiés pour les mises à jour de modèle, avec bornes de complexité d’étiquetage appariées : on ne paie l’évaluation que là où les deux modèles divergent. Enfin, The Attention Within (arXiv 2609.17997) analyse la dynamique de consensus dans les modèles à espace d’états sélectifs, autrement dit ce que « l’attention » devient à l’intérieur d’une récurrence.
Le coût structurel : ce que la structure de graphe doit rapporter
Reste un arbitrage d’architecture, souvent non mesuré : la structure dans un RAG vaut-elle son coût ? « When Is Graph Structure Worth Its Cost? » (arXiv 2609.18099) répond par la tarification. La construction d’un graphe exige de nombreux appels de modèle à l’ingestion, et la question posée est celle du rapport qualité/coût. EffiRAG utilise le graphe pour localiser les passages pertinents mais génère la réponse depuis le texte original — ce qui préserve l’information source tout en gardant construction et interrogation légères. Sur UltraDomain (120 questions ouvertes, quatre domaines), face à LightRAG-hybrid : EffiRAG produit la réponse préférée sur 93 questions, LightRAG sur 7, 20 à égalité. Coût total du système réduit de 57 %, de 0,952 à 0,408 dollar. À 10 et 20 documents par domaine, un filtre léger non-LLM écarte les segments à faible saillance, et l’écart de coût passe à 4,2× et 4,5× en faveur d’EffiRAG. La conclusion méthodologique mérite d’être reprise telle quelle : un système RAG à base de graphe doit être évalué sur la qualité de réponse et sur le coût, pas sur le seul score de qualité.
🤖 Nouveaux outils : deux surfaces qui changent les usages
Anthropic unifie chat, Cowork et Artifacts dans une seule fenêtre, avec Claude Design utilisable partout. Le problème visé est explicitement un problème d’interface : avant ce déploiement, les clients « avaient souvent du mal à choisir le bon onglet pour la bonne tâche ». Désormais Claude route automatiquement les requêtes sans changement d’onglet ni de fenêtre. S’ajoutent des fonctions de présentation et de documents : création, édition et présentation de diapositives téléchargeables en PDF ou PowerPoint, travail collaboratif section par section avec questions et commentaires, partage par lien et édition depuis téléphone. Le suivi d’une tâche lancée sur ordinateur de bureau est possible depuis l’application mobile. Déploiement d’abord sur les offres Pro et Max, web, bureau et mobile, puis gratuit et équipes. À noter : cette mise à jour suit de peu une amélioration de la couche mémoire de Cowork, qui aide Claude à se souvenir du contexte utilisateur d’un chat à l’autre.
Google ouvre un serveur MCP pour Google Home. En accès anticipé, tout agent compatible MCP — Claude, Hermes, OpenClaw, ChatGPT, Google Antigravity — peut travailler avec les appareils de la maison et accéder à l’historique d’événements. Concrètement : consulter les résumés de caméra, surveiller l’activité, contrôler les appareils, construire ses propres tableaux de bord domotiques en langage naturel. La mise en place suppose de créer un projet Google Cloud, de le configurer pour Home MCP, puis de fournir les détails de configuration à l’agent choisi, qui demande ensuite la connexion et les permissions. Le système couvre tout l’écosystème Google Home, y compris les sonnettes et thermostats Nest et les appareils « Works with Google Home » ou Matter. Le déploiement vise d’abord les abonnés à Google Home Premium Advanced aux États-Unis, palier à 20 dollars par mois. Google a déjà pris en charge MCP sur Google Cloud et ses plateformes de données, ses outils de développement et Google Workspace ; cette ouverture est la première franchement orientée consommateur.
📊 Analyse : le vrai sujet est le régime, pas l’optimisation
Trois enseignements se dégagent de l’ensemble.
Premièrement, la qualité n’est pas un scalaire qu’on peut reporter après coup. L’atlas Pareto montre que l’extraction de réponse change le verdict sur AWQ 4 bits : la perte apparente de 5,9 % d’exactitude GSM8K serait en grande partie un effet de formatage. Toute décision d’optimisation qui ne mesure pas la qualité avec le harnais de production réel mesure autre chose que ce qu’elle croit mesurer.
Deuxièmement, les heuristiques intuitives de gestion du cache KV sont fausses. L’importance attentionnelle est le sélecteur naturel, et c’est précisément lui que la contiguïté bat en réparation réelle — parce que sous recomputation, des positions dispersées héritent de la péremption de leur voisinage. Le même motif apparaît chez Fathom : ce qui marche, c’est un budget de bits par requête, pas une politique globale fixe. La granularité du contrôle compte plus que la sophistication du critère.
Troisièmement, le facteur limitant se déplace sans cesse, et la réponse est structurelle. Edge0 ne gagne pas en supprimant la lecture SSD — il gagne en prédisant le routage un jeton à l’avance, ce qui rend l’ensemble chargé identique à l’ensemble routé. ASPIRE ne gagne pas en allongeant les brouillons — il gagne en désynchronisant les requêtes du même lot. Le câblage hypercube ne gagne pas en approchant l’attention — il gagne en garantissant la couverture de toutes les dimensions en log₂n couches. Dans les trois cas, la solution consiste à transformer une propriété coûteuse en propriété structurelle, et le résultat est mesurable en mémoire active, en temps horloge et en paramètres.
Un mot enfin sur la manière de choisir ses briques. Quand EffiRAG réduit le coût total de 57 % face à LightRAG-hybrid tout en produisant la réponse préférée sur 93 questions sur 120, la décision n’est plus un débat de principe sur les graphes de connaissances : c’est un calcul. Et quand Pay Only for Disagreement permet de certifier une absence de régression en n’évaluant que les zones de divergence entre deux modèles, la mise à jour de modèle cesse d’être un pari sur un score global.
🎯 À retenir
- Il n’y a pas de meilleure configuration d’inférence, seulement une frontière. 18 des 36 configurations calibrées sont sur la frontière Pareto ; les combinaisons y arrivent plus souvent (9/15) que les méthodes isolées (9/21).
- FP8 sur les poids est le pari robuste : 99,4 % de la précision de référence à 0,61-0,65× la latence sur L4, A100 et H100, présent dans trois des quatre gagnants de régime. La quantification agressive du cache KV est le pari risqué : débit normal, qualité non préservée.
- AWQ 4 bits reste piégeux : 0,34× la latence par jeton sur L4, mais 5,9 % d’exactitude GSM8K stricte en moins — une perte au moins partiellement attribuable au formatage de réponse.
- Pour réparer un cache KV périmé, la contiguïté bat l’importance. Fenêtre locale à l’édition : au moins 0,94 de marge de réponse récupérée, 13 à 21× plus rapide qu’un re-prefill — à condition que le texte dépendant reste adjacent.
- Un MoE 35B peut tourner sur 24 Go. Prerouter (routage prédit un jeton à l’avance, consommé comme routage réel) plus LoRA de récupération : 20 jetons/seconde dans 3 GiB de mémoire active, code et adaptateurs ouverts.
- Désynchroniser et contrôler finement rapporte plus que forcer. ASPIRE : 1,70-4,58× sur les références autorégressives, +27 % sur l’état de l’art spéculatif. Fathom : 1,67× sur un million de jetons, accord d’étape du meilleur balayage 136 bits atteint à seulement 92 bits.
- La structure doit se tarifer. EffiRAG face à LightRAG-hybrid : réponse préférée sur 93 questions sur 120, coût total −57 %, jusqu’à 4,5× moins cher à corpus croissant. Un système RAG à graphe s’évalue sur la qualité et le coût.