Inférence LLM : KV cache compressé, décodage spéculatif et mémoire récurrente

Inférence LLM : KV cache compressé, décodage spéculatif et mémoire récurrente

Veille IA du mercredi 5 août 2026 — le batch arXiv cs.LG du 5 août (50 papiers) est dominé par l’optimisation de l’inférence, complété par la sortie LFM2.5-2.6B de Liquid AI et les annonces Gemini de Google.

💡 En résumé

Le nerf de la guerre de l’IA en 2026 n’est plus seulement l’entraînement : c’est l’inférence à grande échelle, et le goulot d’étranglement numéro un s’appelle le KV cache — la mémoire qui stocke les clés et valeurs d’attention de chaque token, et qui explose avec la longueur des contextes. Le batch arXiv cs.LG du 5 août 2026 attaque le problème sur tous les fronts : AnchorKV compresse le cache de 20× sans jeter un seul token (99 % du score du cache complet à l’échelle 70B), ATFlash taille les fenêtres d’attention selon la longueur d’onde de RoPE pour accélérer jusqu’à 1,31× à 1M de tokens, Output-Aware Rotation pousse la quantification INT2 du KV cache en optimisant la sortie réelle, et AcceptMoE rend le décodage spéculatif des modèles MoE 2,06× plus rapide en offloading. Côté architectures, Maglev propose une mémoire récurrente à taille fixe qui généralise l’attention à fenêtre glissante. Et côté produit, Liquid AI sort LFM2.5-2.6B, un petit modèle capable de faire tourner des agents outillés sur un laptop ou un téléphone — tandis que Google détaille ses trois nouveaux Gemini pensés pour l’agentique en production.

🔥 Tendances

1. Le KV cache : le champ de bataille n°1 de l’inférence longue-contexte

Les cinq papiers les plus significatifs du batch convergent vers le même constat : le KV cache est « le principal goulot d’étranglement mémoire de l’inférence LLM longue-contexte ». Les approches existantes attaquaient le problème par deux bouts opposés : l’éviction (on jette des tokens définitivement, au prix d’une dégradation quand un token jeté se révèle essentiel) et la quantification (on garde tout en basse précision, mais la compression est limitée).

AnchorKV (arXiv:2608.02901) propose une troisième voie : la compression anchor-résiduelle. Le principe en trois étapes : (1) stocker un petit ensemble d’ancres en précision exacte ; (2) exprimer chaque autre token par sa similarité à l’ancre la plus proche (représentation résiduelle) ; (3) ne raffiner sélectivement que les tokens dont l’approximation affecte le plus la sortie du modèle. Le résultat : une compression de 20× sans aucun token écarté, qui préserve 99 % du score du cache complet à l’échelle 70B, de manière constante à travers modèles et jeux de données.

Dans la même veine, Output-Aware Rotation for INT2 KV-Cache Quantization (arXiv:2608.02691) corrige un défaut des méthodes de rotation existantes : elles optimisent les statistiques du cache ou des erreurs proxy avant la lecture complète de l’attention, alors que le modèle est en réalité affecté par l’erreur propagée à travers l’attention et la projection de sortie W_O. En rendant la rotation « consciente de la sortie », la quantification INT2 (2 bits par valeur) devient viable sans pénalité de précision démesurée.

2. ATFlash : des fenêtres d’attention calibrées sur la physique de RoPE

ATFlash (arXiv:2608.02947) part d’une observation élégante : le score d’attention avec rotary position embeddings (RoPE) se décompose exactement en une somme sur ses paires de fréquences de rotation 2D, et la longueur d’onde de chaque paire limite la distance à laquelle elle peut discriminer la position. ATFlash exploite cette structure avec une fenêtre de distance par longueur d’onde : elle élague les termes produit scalaire query-key au-delà d’une distance proportionnelle à la longueur d’onde.

Contrairement à une fenêtre glissante classique, chaque clé reste atteignable — au minimum via les paires basse fréquence. Et contrairement aux méthodes dynamiques-sparse comme MInference, le taux de réduction est indépendant de l’entrée, avec une forme fermée logarithmique en la longueur de séquence N. Les résultats : 37-48 % des termes QK élagués sur Qwen2.5-0.5B et Llama-3.2-3B dans leur longueur de contexte native, avec un taux de match top-1 de 96-98 % par rapport à l’attention complète et une KL de distribution de sortie à 10⁻³ nat sur LongBench-v2. Implémentée en « slices » de l’axe de contraction QK dans FlashAttention-4 (prefill) et FlashInfer (decode), elle accélère jusqu’à 1,29× à 128K sur RTX PRO 6000 avec Llama, et 1,31× à 1M de tokens en bout en bout sur Qwen2.5-7B-1M avec 57 % des termes élagués.

3. AcceptMoE : le décodage spéculatif MoE sans budget d’experts

Le décodage spéculatif vérifie un arbre de tokens draftés en un seul passage avant du modèle cible. Mais pour une cible mixture-of-experts (MoE), la vérification parallèle active l’union de tous les experts sélectionnés par les nœuds de l’arbre — alors que seule une petite fraction de ces nœuds atteint la sortie acceptée. AcceptMoE (arXiv:2608.02989) identifie trois coûts distincts qui ne se réduisent pas proportionnellement : le nombre de tokens, la taille de l’union d’experts activés, et le trafic de poids d’experts (qui dépend aussi de la résidence en cache en cas d’offloading).

La solution : un sélecteur d’experts côté vérificateur qui combine les scores du routeur cible avec des probabilités d’engagement estimées hors ligne, et qui auto-dimensionne le nombre d’experts éligibles par bloc de vérification — éliminant le besoin d’un budget d’experts défini par l’utilisateur. En offloading, il conditionne l’éligibilité des experts sur la résidence en cache plutôt que de prédire les routes naturelles et de préfetcher les poids correspondants. Le compromis assumé : contraindre l’éligibilité des experts change la distribution du modèle, mais sur 12 paires modèle-tâche (3 cibles MoE, 4 benchmarks), la précision moyenne n’est que de 0,27 point de pourcentage inférieure à EAGLE-3 en routage naturel — pour un débit 1,29× avec tous les poids en mémoire GPU, 2,06× en offloading physique, et une réduction du trafic hôte-à-périphérique de 73,6 à 77,1 %.

4. Maglev : la mémoire récurrente glissante

Maglev (arXiv:2608.02870) est une architecture de Transformer récurrent avec mémoire à taille fixe qui généralise l’attention à fenêtre glissante tout en restant parallélisable à l’entraînement. Le design couple deux modèles : un prefiller Q qui exploite l’attention complète pour produire des cibles de mémoire m’_t, et un décodeur P qui n’utilise que l’attention à fenêtre glissante plus une injection récurrente de K/V pour produire les mémoires de décodage m_t. Une perte de cohérence mémoire aligne m_t sur m’_t, ce qui permet à l’inférence de n’utiliser que P.

L’intérêt : découpler l’expressivité à l’entraînement (via le prefiller à attention complète) de l’efficacité à l’inférence (via le décodeur récurrent à fenêtre glissante). Maglev améliore la loss de validation et les benchmarks de pré-entraînement par rapport aux baselines à fenêtre glissante et aux Transformers latents récurrents — et le partage de paramètres entre P et Q réduit la mémoire tout en préservant l’essentiel des gains.

5. LFM2.5-2.6B : l’agent local de Liquid AI

Sur le versant produit, Liquid AI publie LFM2.5-2.6B, un petit modèle (2,6 milliards de paramètres) conçu pour faire tourner des agents IA capables sur du matériel courant : tool calling, workflows multi-étapes, sur laptop comme sur téléphone — avec l’argument de la confidentialité (données sur l’appareil) et de l’économie (zéro coût d’inférence cloud).

Le modèle a été pré-entraîné sur ~34T tokens, avec une extension de contexte à 128K, puis transformé en agent en quatre étapes : SFT en deux rounds orientés données agentiques, spécialisation d’un enseignant par domaine (maths, code, tool use), distillation multi-domaine on-policy (MOPD), et Agentic RL — de l’apprentissage par renforcement multi-tours exécuté dans de vrais harnesses d’agents (OpenClaw, Hermes Agent), avec un proxy qui traite les harnesses comme des boîtes noires tout en capturant les trajectoires token par token pour reconstruire les échantillons d’entraînement RL.

Les benchmarks sont remarquables pour la taille : le modèle est compétitif avec des modèles 4× plus grands (jusqu’à 9,7B), et bat tous les benchmarks d’instruction following (IFBench 59,17, Multi-IF 80,07, IFStruct 85,49) ainsi que la plupart des benchmarks d’outils (ToolSandbox 77,83, τ³-Bench Banking 5,67). Côté vitesse : 220 tokens/s sur Apple M5 Max, 113 tokens/s sur AMD Ryzen AI Max+ 395, ~30 tokens/s sur téléphone — et près de 15K tokens de sortie/s en concurrence élevée sur GPU (~1,3 milliard de tokens par jour sur un seul H100). Support dès le jour 1 : llama.cpp, MLX, vLLM, SGLang, ONNX.

6. Google : trois Gemini pour l’agentique de production

Google a publié le récapitulatif de ses annonces de juillet, avec un focus agentique assumé : Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber, trois modèles « conçus pour les agents IA de production » — meilleure efficacité token, latence réduite, fiabilité accrue, pour « passer à l’échelle les workflows agentiques ». À noter aussi : Gemini Robotics ER 2, le modèle de « raisonnement incarné » le plus capable de Google ; AlphaEvolve (l’agent d’optimisation de code) désormais en disponibilité générale sur Google Cloud ; et le retour d’expérience du Kaggle AI Agents Intensive353 000 personnes ont suivi le cours gratuit de vibe coding, un signal fort sur la démocratisation de la construction d’agents.

🤖 Nouveaux outils

  • AnchorKV (arXiv:2608.02901) : compression anchor-résiduelle du KV cache, 20× sans éviction, 99 % du score plein cache à 70B.
  • ATFlash (arXiv:2608.02947) : fenêtres d’attention par longueur d’onde RoPE, 1,31× à 1M de tokens, porté dans FlashAttention-4 et FlashInfer.
  • AcceptMoE (arXiv:2608.02989) : sélecteur d’experts auto-dimensionné pour le décodage spéculatif MoE, 2,06× en offloading, -77 % de trafic hôte-à-périphérique.
  • Output-Aware Rotation (arXiv:2608.02691) : quantification INT2 du KV cache optimisée sur la sortie réelle du modèle.
  • Maglev (arXiv:2608.02870) : Transformer récurrent à mémoire fixe généralisant l’attention glissante, parallélisable à l’entraînement.
  • LFM2.5-2.6B (Liquid AI) : agent local 2,6B, 220 tok/s sur M5 Max, outillé, RL agentique multi-tours dans de vrais harnesses.
  • Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber : trois modèles Google orientés agents de production (efficacité token, latence, fiabilité).
  • SP3O (arXiv:2608.02951) : RL par préférences de segments sans modèle de récompense — une avancée méthodologique pour les MDP stochastiques généraux.

📊 Analyse

La convergence vers le même objectif : le token par watt et par dollar

Le batch du 5 août illustre une tendance de fond : l’optimisation de l’inférence est devenue le sujet de recherche le plus actif du machine learning. Il y a deux ans, la recherche portait sur la capacité brute ; aujourd’hui, elle porte sur le coût marginal — chaque token économisé, chaque octet de mémoire évité, chaque expert non activé compte.

Les approches sont remarquablement complémentaires : AnchorKV et Output-Aware Rotation compressent la mémoire ; ATFlash réduit le calcul en exploitant la structure fréquentielle de RoPE (et se superpose aux méthodes token-level existantes) ; AcceptMoE optimise le trafic de données entre hôte et GPU — les trois goulots d’étranglement de l’inférence longue-contexte. Le fait que ATFlash et AcceptMoE soient livrés avec des implémentations dans FlashAttention-4, FlashInfer et SGLang montre que la recherche académique et l’écosystème d’inférence open source avancent désormais de concert.

L’agent local comme contre-mouvement

La sortie de LFM2.5-2.6B est le pendant « produit » de cette tendance : si l’inférence coûte cher à l’échelle, alors déplaçons-la sur l’appareil. Un modèle de 2,6B capable de tool calling et de workflows multi-étapes à 220 tok/s sur un laptop, entraîné par RL dans de vrais harnesses d’agents, c’est la promesse d’agents personnels qui ne dépendent pas d’un cloud. Le détail technique le plus intéressant est méthodologique : l’Agentic RL avec « harness proxy » — traiter les plateformes d’agents comme des boîtes noires tout en capturant les trajectoires token par token — est une recette que d’autres équipes vont imiter, car elle rend l’entraînement d’agents reproductible sans modifier les harnesses eux-mêmes.

Le KV cache, indicateur avancé de l’économie de l’IA

Un dernier point de contexte : le KV cache n’est pas qu’un sujet technique. C’est le poste de coût dominant de l’inférence conversationnelle et agentique — les données de production (cf. l’analyse Agentic Coding de Copilot en juillet) montrent que le cache représente l’essentiel de la mémoire GPU en service continu. Chaque amélioration du ratio compression/précision se traduit directement en capex évitée et en capacité de contexte vendable. Les chiffres d’AnchorKV (20×) et d’ATFlash (1,31× à 1M) ne sont pas des curiosités académiques : ce sont les briques du prochain cycle de baisse des prix des API.

🎯 À retenir

  1. Le KV cache est le nouveau champ de bataille : AnchorKV compresse 20× sans éviction (99 % de précision à 70B), Output-Aware Rotation rend l’INT2 viable.
  2. ATFlash exploite la physique de RoPE : fenêtres par longueur d’onde, 37-48 % de calcul QK élagué, 1,31× à 1M de tokens, compatible avec FlashAttention-4/FlashInfer.
  3. AcceptMoE rend le décodage spéculatif MoE 2× plus rapide en offloading, avec seulement -0,27 pp de précision — et -77 % de trafic hôte-à-périphérique.
  4. Maglev réconcilie récurrence et parallélisme : une mémoire récurrente à taille fixe qui bat les baselines fenêtre glissante et latente.
  5. LFM2.5-2.6B généralise les agents locaux : 2,6B, 220 tok/s sur laptop, outillé, entraîné par RL agentique dans de vrais harnesses — compétitif avec des modèles 4× plus gros.
  6. Google muscle l’agentique de production : Gemini 3.6 Flash/3.5 Flash-Lite/3.5 Flash Cyber, AlphaEvolve en GA, et 353 000 apprenants au cours de vibe coding.

Sources : arXiv cs.LG (2608.02901, 2608.02947, 2608.02989, 2608.02870, 2608.02691, 2608.02951), HuggingFace/Liquid AI, Google Blog — 5 août 2026.

A lire aussi