Efficacité à tous les étages : KV-cache dynamique, inférence sur mobile, RL frugal et mémoire des agents

Efficacité à tous les étages : KV-cache dynamique, inférence sur mobile, RL frugal et mémoire des agents

💡 En résumé

La recherche publiée cette semaine dessine une direction claire : l’efficacité est devenue la nouvelle frontière de l’IA, à tous les étages de la pile. Côté serveur, le KV-cache — ce goulot d’étranglement devenu critique avec les modèles de raisonnement à longue sortie — cesse d’être un budget fixe alloué par requête pour devenir une ressource gérée dynamiquement (GrowPage), tandis qu’une analyse fine des mécanismes d’éviction agressive montre que la règle d’agrégation temporelle importe plus que le scoreur choisi. Côté appareil, LeanStream attaque le problème inverse : comment faire tourner des LLM sur mobile quand les poids dépassent la DRAM, grâce à une exécution spéculative « speculate-and-refine » qui masque les accès SSD. Côté entraînement, la course au RL sans gaspillage s’accélère : récompenses alignées sur les gradients (moins de 9 % de surcoût), réutilisation des rollouts en RL par diffusion, budgets d’annotation actifs. Côté agents enfin, mémoire et exécution deviennent des sujets de première classe : Funes donne aux coding agents une mémoire locale indexée, Speculative Macro Commit prédit et exécute les chaînes d’actions futures, et PlanFence empêche l’exécution de plans obsolètes dans les équipes d’agents distribués. Sans oublier les modèles : l’encodeur multimodal NeoMME (260M/800M) et le modèle météo WeatherNext 3 de Google.

🔥 Tendances

Le KV-cache, ressource dynamique plutôt que budget fixe

Les modèles de raisonnement qui génèrent de longues sorties ont transformé le KV-cache en bottleneck mémoire n°1 du serving LLM. Jusqu’ici, les méthodes de compression du KV-cache partageaient un même postulat : un budget prédéfini par requête, et tout l’effort porte sur quels états conserver. Or les charges de raisonnement sont très variables : deux requêtes n’ont pas les mêmes besoins, et les besoins d’une requête individuelle évoluent pendant la génération.

GrowPage (arXiv 2609.03494) inverse le problème : il traite la capacité KV comme une ressource d’exécution allouée à la demande. Le framework maintient des résumés de requêtes légers à double échelle temporelle (comportement d’attention récent et à long terme), et utilise leur attention relative pour décider quand augmenter ou réduire la capacité allouée à chaque requête au fil du décodage. L’idée — des budgets qui grandissent et rétrécissent en fonction de la demande d’attention réelle — pourrait sembler naturelle, mais elle butait sur un verrou technique : estimer la demande future sans alourdir le serving. GrowPage montre qu’un résumé léger suffit.

De l’autre côté du spectre, What Matters for Aggressive Decoding-Time KV Eviction? (arXiv 2609.03515) pose une question de fond : quand on comprime de façon agressive pendant le décodage, qu’est-ce qui compte vraiment ? Réponse surprenante : la règle temporelle qui agrège les scores entre les étapes de décodage — souvent traitée comme un détail d’implémentation — domine largement le choix du scoreur. Avec une agrégation par moyenne mobile exponentielle (EMA), des scoreurs aussi différents que la norme de valeur ou l’entropie deviennent quasi indistinguables au niveau des ensembles évincés, tandis que KeyDiff, la norme de clé ou la récence dégradent significativement les résultats. Une leçon de modestie pour la recherche sur les scoreurs : sans une agrégation temporelle adaptée, les gains se volatilisent.

L’inférence on-device passe au « speculate-and-refine »

Les LLM sur mobile ou en edge restent un casse-tête systémique : les poids dépassent la DRAM disponible, et les systèmes existants qui exploitent la sparsité d’activation en déchargeant les poids sur SSD/flash butent sur un dilemme fondamental — les décisions d’exécution sparse précises exigent le contexte le plus récent, alors qu’un chevauchement efficace calcul/E-S exige de décider tôt. Résultat : exécution sérialisée ou fetchs redondants.

LeanStream (arXiv 2609.03079) casse ce dilemme avec un cadre spéculatif « speculate-and-refine » : le système affine progressivement le calcul, le chargement et la rétention en cache, au lieu de figer ses choix. La spéculation permet de chevaucher les accès SSD et le calcul sans sacrifier la justesse des décisions sparse — une architecture qui rappelle, transposée à l’inférence, les techniques de prédiction/exécution spéculative des processeurs modernes. L’enjeu est de taille : c’est la condition pour des assistants réellement privés et réactifs sur téléphone.

🤖 Nouveaux outils

Encodeurs et modèles : NeoMME et WeatherNext 3

  • NeoMME (blog Hugging Face, 3 septembre) — Hcompany publie une famille d’encodeurs multimodaux multilingues de 260M et 800M qui casse le moule des VLM génératifs : pas de tour de vision pré-entraînée séparée, pas de décodeur causal — un seul Transformer bidirectionnel traite texte et patches image, entraîné from scratch avec un objectif de diffusion discrète masquée. Fine-tuné pour la recherche documentaire visuelle façon ColPali, NeoMME-Retriever renvoie en un seul passage des embeddings denses et late-interaction, et se place sur la frontière de Pareto ViDoRe v3 (nDCG@10 vs taille). Les chiffres impressionnent : à 2048×2048 sur un L40S, le 260M encode ~51 pages/seconde, environ deux fois le débit de ColModernVBERT, et le pooling hiérarchique + quantification asymétrique réduisent le stockage d’index late-interaction de ~1,5 Mo à 6 ko par page (255× plus petit) en conservant plus de 95 % du nDCG de référence. Apache 2.0, disponible dans Transformers.
  • WeatherNext 3 (Google DeepMind / Google Research) — la nouvelle génération du modèle météo de Google se distingue sur les trois faiblesses historiques des modèles IA de prévision : résolution descendue à 5 km (contre 15-25 km), prévisions horaires (contre 6 heures), et pluie améliorée de 60 % par rapport à WeatherNext 2. Le modèle, 2,4× plus gros que son prédécesseur, est le premier à intégrer directement des observations brutes (données satellite en temps réel) plutôt que les seules analyses des supercalculateurs météo — et il est calibré sur des stations au sol, ce qui permet de l’évaluer contre des vérités terrain. Il alimentera Search, Maps et Gemini. Sur Operational WeatherBench, il bat les modèles de Microsoft, Nvidia et ECMWF, ainsi que les prévisions classiques du National Weather Service américain.

Mémoire et agents : Funes, Speculative Macro Commit, PlanFence

  • Funes (blog Hugging Face, David Corvoysier) — le constat de départ : les coding agents produisent déjà la trace de ce qu’ils font et pourquoi — mais une trace n’est pas une mémoire, on ne « grep » pas 10 000 tours de session pour retrouver une décision. Funes est une couche de mémoire durable, locale et propriétaire pour Claude Code, Codex, pi et Hermes : un binaire unique, indexation incrémentale des sessions, embedding et reranking sur machine, et une commande (funes add claude) qui donne à l’agent des outils recall/get — il retrouve seul les sessions pertinentes et cite celle derrière sa réponse. Optionnellement, la mémoire peut voyager vers un dataset Hugging Face privé.
  • Speculative Macro Commit (arXiv 2609.03236) — les agents à outils perdent du temps non pas en inférence mais en allers-retours action→observation sérialisés. SMC met en place un système à deux niveaux : un modèle acteur autoritaire produit la trajectoire officielle, pendant qu’un draftor spéculatif plus rapide prédit et exécute des chaînes d’actions futures sur un instantané isolé de l’environnement. Les squelettes d’actions multi-étapes récurrents sont minés depuis les traces d’entraînement et stockés dans une « macro library » ; quand l’acteur atteint une action prédite, l’historique spéculé est validé en bloc — un peu comme un commit atomique appliqué par anticipation.
  • PlanFence (arXiv 2609.03340) — dans une équipe d’agents distribués, un agent peut lire les derniers faits partagés et agir quand même sur un plan obsolète : l’exécuteur reçoit le fait $r_4$ sans remplacer le plan dérivé de $r_3$. PlanFence est un protocole de validation d’action par portée de dépendances : chaque plan cite les enregistrements publics exacts qu’il a utilisés, et l’exécuteur ne valide que ceux qui peuvent affecter l’action externe en attente — replanification ou blocage si la validation est incomplète. Sur 30 workflows contrôlés avec révision post-plan, un exécuteur « freshness-only » agit sur des plans périmés dans une proportion significative des cas — que PlanFence élimine.

RL frugal : GAR, DE-Venus, LeanGRPO, RecurTrace

  • Gradient-Aligned Rewards (GAR) (arXiv 2609.03342) — le RLVR classique donne une récompense binaire (correct/incorrect) qui ne distingue pas les trajectoires correctes entre elles. GAR opère dans l’espace des gradients du modèle : une rétropropagation tronquée à la couche de projection extrait un vecteur de gradient compact pour chaque rollout, dont la similarité cosinus avec un gradient « ancre expert » produit une récompense dense et sensible au raisonnement — avec moins de 9 % de surcoût en temps mur, et une garantie théorique sur la préservation de l’ordre.
  • DE-Venus (arXiv 2609.03324) — cadre unifié de RLVR data-efficient qui traite la supervision comme un état évolutif : sélection active de données (budgets d’entraînement et d’annotation), construction de supervision faible, et désentrelacement de la logique de supervision du training distribué — pour comparer proprement les méthodes et réutiliser les pipelines.
  • LeanGRPO (arXiv 2609.03528) — en RL par diffusion (post-entraînement d’image/vidéo), les méthodes type DanceGRPO/FlowGRPO recalculent les timesteps sélectionnés avec suivi de gradient après le rollout. Or, sous entraînement on-policy avec le même backend, ce recalcul est mathématiquement redondant. LeanGRPO restructure le layout data-parallel et introduit deux schémas d’entraînement sans recalcul — le même backbone feed-forward sert au rollout et à la mise à jour.
  • RecurTrace (arXiv 2609.03379) — la récurrence latente (répéter un petit bloc de couches intermédiaires) augmente la profondeur d’inférence effective sans paramètres ni tokens supplémentaires — mais chaque itération ne voyait que la sortie précédente, et un nombre de boucles fixe gaspillait du calcul. RecurTrace ajoute une Loop Memory Attention : chaque couche bouclée peut assister ses propres états des itérations antérieures le long de l’axe loop-time, avec un nombre de boucles adaptatif selon la difficulté.

Structured outputs : 100 steps de GRPO sur un 350M

Le tutoriel publié par Liquid AI et l’équipe TRL sur le blog Hugging Face montre un cas d’école d’alignement frugal : fine-tuner LFM2.5-350M sur le benchmark IFStruct (conformité de schéma JSON/YAML) en seulement 100 étapes de GRPO avec TRL, servi en local via llama.cpp sur MacBook. Le modèle de base plafonne à ~22 % de sorties valides (18 % en JSON, 27 % en YAML) ; l’article détaille le pipeline complet (génération, récompenses de validité, 100 steps) pour montrer qu’un petit modèle spécialisé rattrape des modèles beaucoup plus gros sur une tâche métier critique — la sortie structurée étant souvent ce qui décide si un modèle peut être câblé dans un système de production. Dans le même esprit « l’IA apprend à faire de l’art », le projet aquarelle TRL/OpenEnv (35 upvotes, 1,5 M de vues pour la vidéo originale) reproduit en open source — dataset pool noté à la main, environnement RL, scripts, modèles — l’entraînement d’un modèle de code (Qwen3.5-35B-A3B en LoRA) à peindre des aquarelles via p5.brush avec GRPO et récompenses visuelles, en comparant trois mix de récompenses.

📊 Analyse

Quatre vecteurs pour une même bataille : faire plus avec moins

Mis bout à bout, ces résultats ne sont pas une collection de micro-optimisations : ils dessinent une stratégie industrielle convergente. Premier vecteur, la mémoire comme ressource pilotable : budgets KV dynamiques (GrowPage), compréhension fine de l’éviction (l’étude EMA), mémoires d’agents locales et propriétaires (Funes) — la mémoire cesse d’être un sous-produit du calcul pour devenir une couche d’infrastructure qu’on dimensionne, qu’on indexe et qu’on monétise. Deuxième vecteur, l’adaptativité : allouer le calcul (et les boucles de raisonnement, RecurTrace) selon la difficulté réelle, plutôt que de manière uniforme — c’est la même philosophie que les budgets de calcul à la demande. Troisième vecteur, le RL sans gaspillage : réutiliser les rollouts (LeanGRPO), extraire des récompenses des gradients déjà calculés (GAR), sélectionner activement les données (DE-Venus), et montrer qu’un 350M fine-tuné 100 étapes peut suffire pour une tâche de production. Quatrième vecteur, le local-first : LeanStream pour le mobile, Funes pour la mémoire privée, NeoMME qui encode 51 pages/seconde sur un seul GPU — l’efficacité est la condition technique des promesses de confidentialité que les assistants personnels (voir l’actualité Ollie et Meta Muse Spark) commencent à faire au grand public.

Le parallèle avec l’actualité industrielle

Cette semaine technique n’est pas déconnectée de l’actualité chaude : Meta offrait hier une remise de ~95 % sur Muse Spark en échange des données d’usage — parce que la matière première de l’amélioration des agents, ce sont précisément ces trajectoires d’outils, de mémoire et de raisonnement que les papiers ci-dessus cherchent à rendre moins coûteuses à produire. Et pendant que Nvidia rachète le hub des modèles ouverts, la recherche ouvre la voie à des modèles assez efficaces pour tourner là où les données vivent — sur l’appareil, dans l’entreprise, derrière le firewall. L’efficacité n’est pas qu’une affaire de coûts : c’est ce qui détermine qui contrôlera la prochaine génération d’agents.

🎯 À retenir

  • GrowPage transforme le KV-cache en ressource allouée à la demande (double échelle temporelle) — le serving des modèles de raisonnement en dépendra.
  • L’éviction KV agressive : la règle d’agrégation temporelle (EMA) compte plus que le scoreur — les comparaisons de scoreurs sans elle sont trompeuses.
  • LeanStream apporte l’exécution « speculate-and-refine » pour faire tourner des LLM sur mobile avec poids dépassant la DRAM.
  • NeoMME (260M/800M, Apache 2.0) : encodeur multimodal natif sans tour de vision, ~51 pages/s sur L40S, index late-interaction 255× plus compact.
  • GAR extrait des récompenses denses des gradients (< 9 % de surcoût), LeanGRPO élimine les recalculs redondants du RL par diffusion, DE-Venus rend le RLVR data-efficient.
  • Funes donne aux coding agents (Claude Code, Codex, pi, Hermes) une mémoire locale indexée et privée ; PlanFence empêche l’exécution de plans périmés dans les équipes d’agents distribués.
  • WeatherNext 3 passe la météo IA à 5 km de résolution, en horaire, avec +60 % sur la pluie — et entre dans Search, Maps et Gemini.

A lire aussi