Inférence LLM : DSpark accélère le décodage jusqu'à 3,2×, FleetSieve profile les flottes SLO-aware, Ramp lance Router

💡 En résumé

La journée du 21 août 2026 est celle de l’inférence. Liquid AI a publié les checkpoints DSpark de sa famille LFM2.5 — des modèles draft de ~300 M de paramètres qui accélèrent le décodage spéculatif jusqu’à 3,18× sur H100 et 2,87× sur MacBook M4 Max, avec un support day-one dans llama.cpp et SGLang, et une latence de function-calling réduite de 57 % en moyenne. En parallèle, un papier arXiv (FleetSieve) attaque un problème d’ingénierie qui devient critique : choisir les degrés de parallélisme tensoriel et le nombre de réplicas d’une flotte LLM sans profiler des centaines de configurations inutiles — avec une méthode qui économise 6,9 % de GPU-seconds en moyenne et, surtout, évite de choisir une config qui viole le SLO de latence. Enfin, Ramp lance Router, son service de routage de modèles façon OpenRouter (OpenAI, Anthropic, DeepSeek, Moonshot, Nvidia, xAI, Z.ai), gratuit jusqu’à fin 2026. Trois signaux d’une même bascule : l’inférence est devenue le champ de bataille économique et technique de l’IA.

🔥 Tendances : la guerre de la vitesse d’inférence

DSpark : le décodage spéculatif devient grand public

Le décodage spéculatif repose sur une idée simple : la phase de décodage d’un LLM est memory-bound — le goulot d’étranglement est le streaming des poids depuis la DRAM vers la SRAM, pas le calcul. Un petit modèle draft propose des tokens candidats, et le modèle cible les vérifie en un seul passage avant, mutualisant le coût de chargement des poids.

DSpark combine trois composants, comme l’explique le blog de Liquid AI :

  1. Un backbone parallèle style DFlash conditionné sur les features de contexte du modèle cible, qui produit les hidden states de tous les tokens draft en un seul forward.
  2. Une tête séquentielle légère, modélisée comme une chaîne de Markov entre tokens voisins, qui ajoute la dépendance inter-tokens et augmente le taux d’acceptation sur les positions tardives.
  3. Un vérificateur à confiance programmée qui prédit la probabilité de survie de chaque token et élague les suffixes à faible confiance quand la vérification coûterait plus qu’elle ne rapporte.

Les draft models publiés sont des modèles attention-only de 5 couches (bloc de 9), entraînés 15 épochs sur un mix SFT/chat/code/function-calling, en sélectionnant l’époch au meilleur taux d’acceptation (pas à la loss la plus basse). Les chiffres parlent d’eux-mêmes :

ModèleAcceptation (moy.)Speedup H100Speedup M4 Max
LFM2.5-2.6B4,81/102,67× (323→864 tok/s)2,27× (61→139 tok/s)
LFM2.5-1.2B-Instruct5,02/102,10× (656→1384 tok/s)2,54× (138→350 tok/s)
LFM2.5-8B-A1B (MoE)6,95/103,18× (428→1362 tok/s)1,18× (90→106 tok/s)

Deux enseignements notables. D’abord, la parité de qualité est garantie par construction : un token draft n’est accepté que s’il correspond à la distribution du modèle cible (greedy) — la séquence émise est donc identique à la baseline. Ensuite, le cas du 8B-A1B montre la limite actuelle : le MoE n’obtient que 18 % d’amélioration sur appareil à cause de l’implémentation Metal de llama.cpp et du fait que vérifier k tokens active plus d’experts (donc plus de trafic de poids). Le point le plus stratégique pour l’edge : sur MacBook, le LFM2.5-2.6B atteint ~140 tok/s, au-delà de la plupart des modèles cloud propriétaires — et la latence de function-calling baisse de 57 % en moyenne, un argument direct pour l’inférence agentique sur appareil.

Router de Ramp : l’intermédiation de l’inférence se généralise

Ramp, la plateforme de gestion de dépenses (44 Md$ de valorisation en juin), lance Router : un service API qui permet de basculer entre modèles d’OpenAI, Anthropic, DeepSeek, Moonshot, Minimax, Nvidia, xAI et Z.ai. La société dit l’utiliser en interne depuis trois ans. Les fonctionnalités : stratégies de routage par préférences (tiers flex des fournisseurs), routage selon jusqu’à trois benchmarks choisis par l’utilisateur, ou envoi des problèmes difficiles uniquement vers les modèles chers. Un dashboard suit spend, coût, latence et fallbacks. Gratuit jusqu’à fin 2026 (avec 26 $ de crédit), le service a une politique de rétention par défaut d’un an — avec PII retirées avant usage d’amélioration. Ramp suit Stripe (dont le rachat d’OpenRouter est évalué à 7,5 Md$) : l’inférence est en train de se doter de péages — places de marché, routeurs, couches de billing — exactement comme le cloud computing dans les années 2010.

🤖 Nouveaux outils : profilage, incertitude et optimisation

FleetSieve : profiler juste ce qu’il faut pour choisir une flotte SLO-aware

Configurer une flotte de serveurs LLM est un cauchemar d’ingénierie : la performance n’est pas monotone dans le degré de parallélisme tensoriel (TP), et la configuration faisable change avec la charge. Le profilage exhaustif résout l’incertitude mais gaspille des GPU-seconds sur des configurations qui ne changent rien à la décision finale.

FleetSieve (arXiv 2608.19659) sélectionne les mesures selon leur effet attendu sur la décision de flotte : il modélise conjointement capacité et latence de queue, compare des allocations conservatrices et optimistes, et s’arrête quand l’écart de décision restant passe sous une tolérance donnée. Sur une grille H100 fixe pour un modèle open-weight de 31B : 22 200 GPU-seconds pour atteindre la décision oracle, soit 6,9 % de moins que le profilage aléatoire uniforme (moyenne sur 200 ordres de révélation : 5,4 %, IC 95 % [3,5-7,2 %] ; 21,5 % sur le workload Chat). Surtout, la modélisation conjointe capacité/latence évite de sélectionner une configuration dont le p99 de 46,4 s viole un SLO de 30 s — le genre d’erreur qu’un profilage sparse naïf commet, avec des pertes allant jusqu’à 1,93 requêtes/s et 12,4 points de fulfillment max-min sur une allocation de 16 GPU. Un papier à lire par toute équipe qui dimensionne des serveurs LLM à la main.

Incertitude black-box à coût quasi nul

Le papier Improved Confidence Estimates (arXiv 2608.19323) attaque la quantification d’incertitude (UQ) des LLM : les méthodes existantes (confiance verbalisée, multi-générations) sont zero-shot et produisent des scores sans données labelisées — mais en pratique, il faut toujours évaluer la performance sur le dataset cible avant déploiement. L’idée : exploiter ce dataset en entraînant de simples classifieurs qui prédisent la correction de la réponse du LLM à partir des scores existants et de la correction de requêtes similaires. Le surcoût computationnel est minimal, et la performance dépasse systématiquement les scores bruts — une amélioration cheap et directe pour la UQ en production.

Et aussi : DeltaMomentum, Mechanistic Tomography, BoN distillation

Trois papiers complètent la palette : DeltaMomentum (2608.19491) propose une mise à jour de momentum anisotrope basée sur une règle delta en Key-Value — une optimisation d’optimiseur pour la formation ; Mechanistic Tomography (2608.19338) introduit des mesures conçues pour l’interprétabilité orientée contrôle, une approche « tomographie » du fonctionnement interne des modèles ; Truncate Bad, Upweight Good (2608.19748) revisite la distillation style Best-of-N par classification basée sur le rang — tronquer les mauvaises réponses et surpondérer les bonnes plutôt que de tout distilliser uniformément.

📊 Analyse : l’inférence, nouveau champ de bataille

Trois signaux convergents dessinent une même bascule stratégique. La vitesse devient un produit : DSpark démontre qu’on peut gagner 2-3× sur du matériel existant avec des drafts de 300 M de paramètres — une alternative économique à l’achat de GPU supplémentaires, et un accélérateur pour l’edge (où le function-calling à 57 % de latence en moins change l’expérience des agents locaux). Le dimensionnement devient une science : FleetSieve formalise ce que les équipes MLOps font à l’instinct — mesurer moins, décider mieux, ne jamais violer le SLO — et chiffre le coût des erreurs (1,93 req/s perdus). L’intermédiation devient un business : après Stripe/OpenRouter à 7,5 Md$, Ramp entre sur le marché du routage de modèles, avec une rétention de données d’un an qui pose déjà la question du privacy washing dans l’inférence.

Pour les équipes techniques, les implications pratiques sont immédiates : tester le décodage spéculatif sur ses workloads (les intégrations llama.cpp/SGLang sont upstream), adopter une méthode de profilage décision-critique plutôt qu’exhaustive, et surveiller l’émergence des routeurs comme nouvelle couche d’infrastructure — avec les questions de gouvernance des données qu’ils introduisent.

🎯 À retenir

  • LFM2.5-DSpark : drafts ~300 M, 3,18× sur H100 (8B-A1B), 2,87× sur M4 Max (1.2B), parité de qualité garantie par construction, day-one llama.cpp + SGLang.
  • Function-calling edge : −57 % de latence sur LFM2.5-2.6B — un argument direct pour l’inférence agentique sur appareil (~140 tok/s sur MacBook).
  • FleetSieve : profilage SLO-aware décision-critique, −6,9 % GPU-seconds, et surtout évite les violations de SLO (p99 46,4 s vs SLO 30 s).
  • Ramp Router : un nouvel acteur du routage de modèles (gratuit en 2026, rétention 1 an par défaut) — l’intermédiation de l’inférence s’industrialise.
  • UQ black-box : des classifieurs simples sur le dataset cible battent les scores zero-shot à coût minimal — à intégrer avant déploiement.

A lire aussi