Ternarisation de Qwen3-4B, KV cache budgeté, préfill sparse : l'inférence LLM optimisée sous tous les angles

Ternarisation de Qwen3-4B, KV cache budgeté, préfill sparse : l’inférence LLM optimisée sous tous les angles

💡 En résumé

Le cru arXiv du 3 septembre 2026 est dominé par une préoccupation unique : faire tourner les LLM avec moins de mémoire, moins de calcul et moins de décisions. Cinq papiers techniques majeurs attaquent le problème à cinq niveaux différents de la pile : la ternarisation post-entraînement de Qwen3-4B (avec un bilan honnête de ce que 1,64 bits effectifs coûtent réellement en capacités), HeadWiseKV qui budgetise la résidence du cache KV par tête pour les modèles hybrides long-contexte, CRISP qui rend le préfill sparse adaptatif au contenu avec un routage structurel, XMerge qui comprime la profondeur des transformeurs en fusionnant des couches, et hLLM qui découpe le reranking génératif en une seule passe via un algorithme hongrois. À l’autre bout du spectre, la fiabilisation des systèmes qui utilisent ces modèles progresse aussi : WMLLM apprend aux agents d’optimisation à prédire avant d’agir, CAPTURE démêle l’évolution des préférences de l’empoisonnement de mémoire chez les agents personnalisés, et SPACE apprend aux agents long-horizon à agir par blocs au lieu de décider à chaque étape. IBM, de son côté, met ses modèles de séries temporelles directement dans le flux Confluent.

🔥 Tendances : l’optimisation d’inférence, nouveau champ de bataille

La pression économique sur l’inférence ne se relâche pas : chaque token économisé, chaque octet de cache évité, chaque couche supprimée se traduit en coût d’exploitation et en latence. Les cinq approches publiées ce jour illustrent la diversité des stratégies — et surtout une maturité nouvelle : les auteurs publient désormais des bilans honnêtes, y compris quand les résultats sont décevants.

Ternarisation de Qwen3-4B : un bilan sans fard

Le papier sur la ternarisation post-entraînement de Qwen3-4B (arXiv 2609.01962) est un modèle du genre en matière d’honnêteté scientifique. L’équipe a converti un modèle instruction-tuné de 4B paramètres en utilisant la rotation KOTMS, la ternarisation E2M-ATQ et une compensation d’erreur de style GPTQ. Résultat annoncé : 1,641 bits effectifs par poids pour les poids linéaires quantifiés, représentant 81,62 % des paramètres du modèle — un format nominalement « 1,58-bit ». Mais les auteurs prennent soin de détailler ce que cela coûte :

  • La précision moyenne sur dix comparaisons de capacités chute de 64,5 % à 54,7 % ;
  • La dégradation est très inégale : BoolQ conserve 84,6 % de la performance du teacher (corrigée du hasard), tandis qu’ARC-Challenge ne retient que 43,8 % ;
  • La perplexité grimpe de 13,639 à 18,748 sur WikiText-2 ;
  • Un packing ultérieur (qui préserve les plans ternaires) réduit la taille annoncée du modèle de 8,29 GiB à 3,96 GiB avec une perplexité quasi inchangée ;
  • Mais le microbenchmark Triton GEMV préliminaire est 4,6 fois plus lent que le FP16 cuBLAS sur une forme testée.

La conclusion est rafraîchissante : « nous ne prétendons pas que la compression seule produit une inférence plus rapide ». Un rappel précieux que l’étiquette « 1,58-bit » ne dit rien du stockage réel, de la capacité conservée ni du comportement à l’exécution.

HeadWiseKV : budgetiser la résidence du cache par tête

Avec l’allongement des contextes, le cache KV (les paires clé-valeur accumulées pendant le décodage) devient le principal gouffre mémoire des modèles hybrides long-contexte — y compris ceux dotés de chemins locaux, récurrents ou linéaires, car leurs couches d’attention globale résiduelles dominent la demande de cache. HeadWiseKV (arXiv 2609.02029) propose un framework sans entraînement qui compresse ces caches globaux résiduels tout en préservant les chemins natifs du modèle : chaque tête physique KV reçoit une fenêtre d’historique statique multi-niveaux, rendant la demande de cache prévisible avant le service. L’allocation est formulée comme un problème de rate-distortion opérationnel restreint, résolu par l’algorithme SeqCalib, qui traite les couches dans l’ordre d’exécution et conditionne chaque décision sur la politique des couches inférieures. Sur Qwen3.6-27B, HeadWiseKV conserve une qualité quasi identique au cache complet sur RULER et LoCoMo, réduit la mémoire de pointe de 8,59 % à 112K de contexte et repousse le plus long contexte vérifié de 114K à 161K. Un gain modeste mais obtenu sans entraînement, et surtout un changement de paradigme : le cache devient une ressource budgetisée par conception, pas un sous-produit subi.

CRISP : un préfill sparse qui lit la structure de l’attention

Le préfill — la phase où le modèle ingère le prompt — a un coût quadratique en longueur de contexte. Les méthodes d’attention sparse classiques utilisent des motifs fixes ou un profilage hors ligne ; les méthodes dynamiques récentes routent les têtes vers des motifs sparses en temps réel, mais s’appuient sur des proxies indirects coûteux. CRISP (arXiv 2609.01925) identifie deux problèmes structurels : la décision de routage peut être lue directement sur la structure de la carte d’attention proxy (via un proxy structurel C_struct qui élimine les calculs de divergence JSD), et les seuils de couverture cumulative stricte accumulent un bruit de fond O(n) à long contexte — contourné par un seuil « sink-aware » fondé sur le plancher de bruit. Résultats : sur InfiniteBench, RULER et LongBench, CRISP est la méthode sparse la plus solide, égale ou dépasse l’attention dense exacte sur les benchmarks orientés retrieval (jusqu’à +28,0 points), avec un speedup d’attention allant jusqu’à 5,30× à 512K tokens.

XMerge : comprimer la profondeur sans effondrement

Supprimer des couches entières de transformeur préserve l’architecture de service standard, mais les méthodes existantes perdent beaucoup en qualité — de façon imprévisible selon les modèles. XMerge (arXiv 2609.02083) combine une sélection cross-axis (identifier un bloc dont le changement d’état caché est faible en magnitude relative et en angle) et une reconstruction de frontière locale (réajuster le bloc survivant adjacent pour reproduire la sortie du bloc d’origine). Sans labels de tâche, sans fine-tuning de bout en bout, sans changement d’architecture ni paramètres d’inférence supplémentaires. Sur sept backbones Llama et Qwen (0,5B-8B), cinq baselines publiées et trois niveaux de réduction, XMerge est le plus performant aux niveaux d’élimination les plus agressifs : à k=4, il est premier sur six des sept backbones sur CORE et sur MMLU — et c’est le seul opérateur évalué qui ne s’effondre jamais sur les 14 cellules (modèle, régime) testées. Le surcoût de construction est amorti par les économies de décodage après quelques dizaines de milliers de requêtes.

hLLM : le reranking en une seule passe

Le reranking génératif par LLM atteint l’état de l’art en qualité, mais le décodage auto-régressif coûte une passe avant par token émis. hLLM (Hungarian LLM, arXiv 2609.01807) observe que les seuls tokens qu’un ranker doit émettre sont les N ordinaux nommant les éléments dans l’ordre — un format de sortie étroit et structuré en permutations qui se prête à un décodage bien plus efficace. L’architecture lit une matrice score item-position N×K depuis les états cachés du préfill avec une tête d’attention légère, puis décode les ordinaux comme l’assignation bipartite optimale de cette matrice via l’algorithme hongrois — une permutation valide par construction, non par réparation. Avec un fine-tuning LoRA et une distillation du ranking du teacher, hLLM atteint 28 ms d’inférence de bout en bout, soit 64× plus rapide, avec une qualité de ranking au niveau du teacher. Le papier ouvre la voie à d’autres mécanismes de décodage O(1) pour le ranking temps réel, reliant le ranking génératif à l’optimisation combinatoire.

🤖 Nouveaux outils : fiabiliser les systèmes qui tournent sur ces modèles

L’optimisation ne concerne pas que la couche d’inférence : les systèmes agentiques qui consomment ces modèles doivent aussi apprendre à dépenser moins de décisions et à protéger leur mémoire.

SPACE : agir par blocs plutôt que décider à chaque étape

Les agents LLM pour tâches long-horizon suivent généralement un protocole de type ReAct : une action primitive par tour de LLM. Efficace pour re-planifier souvent, mais dispendieux quand des séquences d’actions routinières s’étirent sur des dizaines de tours. SPACE (arXiv 2609.02042) apprend aux agents à émettre des blocs d’actions de longueur variable, en distillant la supervision des frontières de blocs depuis des compétences programmatiques induites des trajectoires réussies. L’entraînement hybride on-/off-policy avec credit assignment « chunk-aware » évite les deux échecs classiques (effondrement vers l’action unique ou sur-engagement dans des séquences trop longues). Sur ALFWorld et ScienceWorld, SPACE améliore les taux de succès de 7,0 % à 31,3 % par rapport aux meilleures baselines tout en réduisant le nombre de tours de décision LLM de jusqu’à 78,9 %. Moins de décisions = moins d’appels d’inférence = moins de coût et moins de latence.

CAPTURE : démêler l’évolution des préférences de l’empoisonnement de mémoire

Les agents personnalisés utilisent une mémoire persistante pour s’adapter à leurs utilisateurs — mais ce même mécanisme crée une surface d’attaque : quand une nouvelle information entre en conflit avec des préférences stockées, l’agent doit distinguer une véritable évolution des préférences d’un changement contextuel temporaire, d’une ambiguïté, ou d’un empoisonnement de mémoire adversarial. CAPTURE (arXiv 2609.02265) formalise le problème comme un processus de décision partiellement observable en temps continu sur un état utilisateur latent, et montre pourquoi les règles fondées uniquement sur la récence et la provenance sont insuffisantes. Sa solution combine un tracker de croyances par équations différentielles neuronales, un registre de mémoire multi-échelles, des clarifications déclenchées par l’incertitude et un audit contrefactuel des mémoires citées. Sur 480 épisodes tenus de côté issus de 96 utilisateurs, CAPTURE atteint 71,5 % de win rate, limite le succès de l’empoisonnement à politique fixe à 11,5 % tout en acceptant 83,5 % des mises à jour de préférences légitimes. Face à un attaquant adaptatif (qui a accès aux poids publiés), le succès d’attaque monte à 24,7 % — exposant un vrai compromis adaptation-sécurité. Un résultat important alors que la mémoire persistante devient le cœur de la personnalisation.

WMLLM : prédire avant d’agir pour optimiser

Les problèmes d’optimisation boîte noire restent difficiles pour les grands espaces de recherche faiblement structurés. WMLLM (arXiv 2609.01608) propose des agents d’optimisation auto-évolutifs fondés sur le world modeling « predict-then-act » : l’agent prédit d’abord les directions prometteuses, puis agit pour générer des candidats — en exploitant la capacité des LLM à prédire les résultats de candidats avec une précision non triviale grâce à leur connaissance implicite. Combiné à un raffinement multi-tours agentique, une recherche populationnelle et de l’apprentissage par renforcement, WMLLM affine à la fois son modèle du monde implicite et sa stratégie d’optimisation pendant la recherche. Sur l’optimisation moléculaire multi-objectifs, il atteint l’état de l’art sous budget d’évaluation limité — une approche qui réduit drastiquement le nombre d’évaluations coûteuses.

📊 Analyse : IBM met les modèles de séries temporelles dans le flux

Hors arXiv, l’annonce du jour côté industrie vient d’IBM et Confluent : les modèles fondation de séries temporelles (TSFM) d’IBM sont disponibles en Early Access sur Confluent Cloud, avec Confluent Platform à suivre. L’argument est économique : jusqu’ici, les décisions sur les données en flux (combien commander, quel paiement stopper, quand la pompe va tomber en panne) reposaient sur « un modèle bespoke à la fois et des mois de travail d’experts » — obligeant les équipes à ne modéliser que les quelques centaines de séries critiques et à couvrir le reste par des marges de sécurité. Un TSFM, entraîné une fois sur des signaux vastes et variés, généralise à une série qu’il n’a jamais vue : donne-lui une fenêtre de mesures, il prédit la suite, détecte l’anomalie, retrouve les précédents historiques similaires. L’exemple de la ligne de tempérage dans une chocolaterie — température, vitesse, débit échantillonnés toutes les quelques secondes — illustre le propos : prévision de la production du soir, détection de la dérive lente, recherche du run historique le plus proche, fine-tuning quand les derniers points de précision valent le coup. Sans équipe de data science dédiée, et le même modèle déployé sur chaque ligne de chaque usine.

Ce mouvement est le miroir industriel des papiers arXiv du jour : d’un côté, la recherche comprime, budgetise et accélère l’inférence des modèles de langage ; de l’autre, l’industrie déplace l’intelligence directement dans les flux de données temps réel — avec des modèles fondation spécialisés qui démocratisent le forecasting et la détection d’anomalies là où se prennent les décisions opérationnelles.

🎯 À retenir

  • La ternarisation de Qwen3-4B publie un bilan honnête : 1,641 bits effectifs par poids, 3,96 GiB après packing, mais une précision qui chute de 64,5 % à 54,7 % (43,8 % sur ARC-Challenge) et un microbenchmark 4,6× plus lent que FP16 — la compression seule ne garantit pas la vitesse.
  • HeadWiseKV budgetise la résidence du cache KV par tête pour les modèles hybrides long-contexte : -8,59 % de mémoire de pointe à 112K et contexte vérifié étendu de 114K à 161K sur Qwen3.6-27B, sans entraînement.
  • CRISP rend le préfill sparse adaptatif au contenu avec un routage structurel : jusqu’à 5,30× de speedup d’attention à 512K tokens, et des performances au niveau de l’attention dense sur le retrieval.
  • XMerge comprime la profondeur des LLM en fusionnant des couches (sélection cross-axis + reconstruction locale) : premier sur 6 des 7 backbones à k=4, et seul opérateur qui ne s’effondre jamais.
  • hLLM décode le reranking en une seule passe via l’algorithme hongrois : 28 ms de bout en bout, 64× plus rapide, qualité au niveau du teacher.
  • Côté agents : SPACE réduit les tours de décision LLM de 78,9 % en agissant par blocs ; CAPTURE limite l’empoisonnement de mémoire à 11,5 % (24,7 % face à un attaquant adaptatif) tout en acceptant 83,5 % des évolutions légitimes de préférences.
  • IBM et Confluent mettent les modèles fondation de séries temporelles en accès anticipé directement dans le flux — le forecasting et la détection d’anomalies deviennent des capacités « stream-native » sans armée de data scientists.

A lire aussi