FP4, élagage MoE, SSM non abéliens et modèles de décision : l'inférence se spécialise

💡 En résumé

Deux mouvements opposés animent la recherche technique du 2 octobre 2026. D’un côté, faire tenir plus de capacité dans le même matériel : pré-entraînement en FP4 natif, élagage structuré de MoE, formats de précision réduite (MXFP8), remplacement des fonctions transcendantales par des polynômes courts. De l’autre, restreindre le modèle pour qu’il fasse une seule chose de façon fiable : les « modèles de décision » à la Jev, qui ne génèrent pas de texte mais rendent un choix calibré parmi des options figées. Entre les deux, une infrastructure MoE ouverte franchit le cap du billion de paramètres, des SSM non abéliens cassent des plafonds théoriques vieux de 1884, et une méthode de distillation en pire cas corrige le reward hacking du raisonnement.

🔥 Tendances

Le FP4 natif devient une discipline d’ingénierie complète

Format-Aware Fusion for Fast FP4 Pretraining (arXiv 2610.00053) adresse un problème rarement dit tout haut : les Tensor Cores FP4 accélèrent la multiplication matricielle, mais le calcul des échelles, l’emballage des opérandes, la construction de la disposition mémoire et l’état sauvegardé pour la rétropropagation peuvent effacer le gain. La réponse des auteurs est une fusion consciente du format : chaque producteur de quantification est co-conçu avec son domaine d’échelle et la disposition mémoire de son consommateur, pour le mxfp, le nvfp global et le nvfp local au cooperative thread array. Résultats sur du pré-entraînement Llama-3 8B jusqu’à 160 milliards de tokens : en sondes appariées sur le même accélérateur, bfloat16 et Transformer Engine nvfp atteignent 18,8K et 27,6K tokens/s/GPU, tandis que la route custom la plus rapide atteint 37,9K. La recette mxfp avec arrondi stochastique du gradient de ligne et préconditionnement Hadamard à signe fixe sur 32 valeurs atteint 37,2K tokens/s/GPU (86,3 % d’utilisation FLOP modèle en bfloat16) et termine 2,11 % au-dessus de la perte de référence bfloat16. Un détail crucial : les classements en aval diffèrent des classements par perte d’entraînement — la qualité FP4 dépend conjointement du contrat d’échelle, de l’opérande et du chemin d’exécution.

Même logique côté fonctions : Fast Polynomial Transcendentals for LLMs (arXiv 2610.00049) remplace sigmoïde, tanh et SiLU natifs par des programmes polynomiaux de degré 3-4 en BF16, avec symétrie analytique, arrondi au format cible et arithmétique compactée à l’intérieur des noyaux consommateurs. En isolé, les gains vont de 1,19-2,19× en L2 et 1,00-1,70× en HBM. En intégration sur GB200 : +2,7 % sur le pas complet avec SiLU dense, +2,9 % avec l’attention tanh-softcapped, +8,0 % avec le SwiGLU routé des experts, et +7,4 % sur le forward complet de l’attention sigmoïde. Sur des horizons d’entraînement proches de 100 milliards de tokens, les écarts de perte lissée finale restent entre −0,107 et +0,079. Le message : à mesure que les générations GPU accélèrent différemment les pipelines matriciels, spécials et mémoire, le goulot se déplace dans le noyau d’attention — et des réécritures ciblées rapportent sans casser le modèle.

Olmo-core 3 : le MoE ouvert franchit le billion de paramètres

Côté infrastructure, la sortie la plus notable est Olmo-core 3 (Allen AI, blog HuggingFace), une refonte du système d’entraînement MoE. Le chiffre d’entrée donne le ton : en passant d’un pool de 8 à 128 experts tout en ne sélectionnant que 4 experts par token (≈3,2B de paramètres actifs constants), la capacité totale bondit de 4,6B à 47B pour une chute de débit inférieure à 5 %. Le changement structurel clé est le passage de FSDP (qui rassemblait et re-fragmentait les poids) à un DDP distribué gardant les experts résidents sur les GPU et routant les données vers eux. Sur huit GPU NVIDIA B300, un MoE de 47B traite 52 000 tokens/s/GPU contre 19 400 avec l’implémentation précédente — 2,7× le débit. Trois techniques de découpage (parallélisme expert, pipeline, optimiseur distribué) et trois optimisations de routage (rowwise expert parallelism, routage résident GPU, grouped GEMM) composent la recette. En MXFP8, sur quatre B300 avec charge distribuée uniformément, le débit d’entraînement gagne ≈21 % par rapport au BF16, et le pic de mémoire active baisse de 103 à 95 GiB — l’essentiel du gain venant du feed-forward et du déplacement de données entre experts, pas de l’attention seule. L’infrastructure est benchmarkée au-delà de 1 000 milliards de paramètres : un modèle de 1,2 T avec 58,36B actifs par token sur 512 GPU, à 858 TFLOP/s/GPU, et une configuration à 2,38 T explorée avec DeepEP v2 (test de capacité courte, pas un entraînement complet). Allen AI documente aussi, avec une honnêteté méthodologique, qu’un score destiné à équilibrer le routage peut être contourné.

Élaguer intelligemment plutôt que retirer au hasard

MoRA (arXiv 2610.00367) attaque l’élagage structuré des MoE : déployer un MoE oblige à charger tout le pool d’experts en mémoire, et les méthodes existantes soit classent les experts selon des critères mal alignés avec la performance, soit cherchent des sous-ensembles coûteux, tout en ignorant la redondance de routage entre experts conservés. MoRA apprend un biais de routeur par expert, optimisé en minimisant la perte de modélisation du langage plus un régularisateur de diversité de routage : les biais appris affûtent les distributions et identifient les experts critiques tout en encourageant des préférences de routage diverses. S’ajoute un mécanisme d’approximation d’expert post-élagage, qui reconstruit la sortie des experts retirés par transformation affine à partir des experts restants. Évalué sur Qwen3-30B-A3B, DeepSeek-V2-Lite et Moonlight-16B-A3B, en retirant 25 % et 50 % des experts routés par couche, MoRA dépasse les meilleurs algorithmes d’élagage sur neuf benchmarks zero-shot.

Modèles de décision : l’intelligence qui ne parle pas

La tendance la plus disruptive de la journée n’est pas un gros modèle, c’est son inverse. Amazon Web Services a publié son propre clone de Jev, Strands Decider 2B, sous licence ouverte et assez petit pour tourner localement (via TechCrunch). Le modèle, inspiré de l’approche de TypeSafe, ne génère pas de texte : il trie entre des options prédécidées et rend une mesure de confiance calibrée. Il repose sur le « torse » d’un LLM — ici Qwen3.5-2B — et l’ingénieur distingué d’Amazon, Marc Brooker, raconte l’avoir construit après avoir vu Jev, jusqu’à atteindre brièvement la première place du classement Jevbench pour sa taille, avant qu’Amazon ne le nettoie et le publie via Strands Labs. La justification est pragmatique : les workflows agentiques n’ont pas toujours besoin de la capacité — ni du coût — d’un LLM complet à chaque étape ; un décideur à domaine fermé et scores de confiance offre un pas de workflow plus fiable, moins latent et moins cher.

La recherche académique du jour documente à la fois le potentiel et les limites de cette classe. A First Glance at Jev for Network Traffic Classification (arXiv 2610.00376) mesure : 40 exemples étiquetés font passer Jev de 9,80 % à 28,42 % d’exactitude, et 150 exemples donnent 34,50 % — mais Random Forest et Extra Trees entraînés sur 8 000 enregistrements atteignent 69,95 % et 66,80 % et battent Jev chaque semaine. Sur un sous-ensemble apparié de 100 enregistrements, Jev à 40 exemples donne 29 % en 0,750 s médiane, contre 37 % et 6,036 s pour GPT-5.6 Sol en effort de raisonnement élevé — Jev coûtant aussi moins cher. Le papier refuse de trancher l’avantage d’exactitude (budgets de supervision inégaux), mais l’argument économique est net.

Benchmarking System One decision models (arXiv 2610.00346) enfonce le clou avec une rigueur inhabituelle : huit points de contrôle de modèles de décision de six familles (dont Jev hébergé) et deux comparateurs génératifs reçoivent les mêmes requêtes sémantiques, et le classement dépend des conditions. Avec les étiquettes de la tâche, de petits classifieurs entraînés sont les plus exacts sur les intentions ; sans étiquettes, tous les modèles de décision sauf les points encoder dépassent un classifieur d’implication zero-shot. Deux résultats de sécurité opérationnelle méritent l’attention : l’inversion oui/non fait basculer 50,5 réponses sur cent pour Jev, et un seuil de risque en-scope à 5 % laisse néanmoins Jev accepter 0,310 des requêtes hors-scope. Conclusion : des règles de conception conditionnelles pour les portes décisionnelles automatisées — et un avertissement pour quiconque déploierait un décideur comme filtre de sûreté sans valider sa calibration par direction.

🤖 Nouveaux outils

  • SSM non abéliens. Beyond Diagonal State Space Models (arXiv 2610.00329) établit que les SSM sélectifs (Mamba, S4D, LRU) sont bornés par la commutativité de la matrice de transition et les groupes affines résolubles. Conséquence : les réseaux diagonaux empilés s’effondrent sur les groupes simples non résolubles comme A₅ (baseline 3 couches : 6,60 %). Les auteurs proposent NC-SSM, SO(3)-SSM et Cayley-SSM via des cartes Euler-Rodrigues et des transformations de Cayley, avec isométrie exacte (‖Uₜ‖=1), lectures projectives par fibration de Hopf, et scans de quaternions (9,06× à T=2048). Résultats : 100 % de suivi sur S₃, D₄, Q₈ et A₅ ; Cayley-SO(5) casse le plafond de Klein (1884) sur S₅ (50,92 % contre 5,25 %) ; SO(3)-SSM préserve les variétés riemanniennes sur 300 pas (<3,12×10⁻⁶ de dérive) ; 74,36 % sur Dyck-2.
  • Attention Manifolds. (arXiv 2610.00257) Ajouter des surfaces B-spline 2D apprises S_d(q_d, k_d) qui modulent chaque dimension de valeur selon l’interaction requête-clé réduit la perplexité WikiText-2 de 2-2,5 points avec 0,3 % de paramètres supplémentaires sur LLaMA 3.2 (1B et 3B). Les surfaces changent la sortie gloutonne sur 69-83 % des 112 prompts, avec un effet maximal sur les entrées ambiguës (94-100 %). Elles sont mécaniquement éditables : inverser les coefficients change la sortie sur 9/10 prompts, et mettre les coefficients à −1 crée des « murs d’attention » qui bloquent le flux de valeur — une piste exploratoire de sûreté par mise en forme géométrique.
  • Distillation en pire cas. The Weakest Link (arXiv 2610.00332) reformule la distillation du raisonnement comme un RL contraint : maximiser la récompense de tâche sous contrainte sur la log-vraisemblance du professeur le long de chaque préfixe. L’argument : une chaîne de pensée ne vaut que par son maillon le plus faible, et la régularisation KL lisse permet à l’élève de compenser une violation logique sévère par un accord ailleurs. La méthode étend le front de Pareto exactitude-fidélité et atteint le meilleur taux de succès de raisonnement rigoureux.
  • Credit assignment par trajectoire. T2SPO (arXiv 2610.00388) dérive des cibles de distance-au-succès depuis les trajectoires réussies et les apparie à des représentations d’états ; un régresseur TabPFN pré-entraîné estime la distance restante à chaque état, et ses variations fournissent un crédit auxiliaire aux pas. Sur ALFWorld et WebShop avec des modèles 1,5B et 7B, T2SPO améliore le succès global face à GRPO.
  • Récompense par matrice de rubriques. MatrixReward (arXiv 2610.00389) construit la récompense depuis une matrice rollout × rubrique de taux de victoire par comparaisons par paires. La dispersion d’une colonne mesure le pouvoir discriminant d’une rubrique ; les corrélations révèlent la redondance — d’où des poids dépendants des données. Sur Qwen3-8B et quatre benchmarks ouverts, score moyen 63,02, soit ≈+2,0 % sur le meilleur baseline.
  • Replay aligné sur l’utilité. FAER (arXiv 2610.00385) formalise l’écart sélection→apprentissage : les sélecteurs classent souvent les trajectoires en cache par retour de format, confiance, fraîcheur ou longueur, alors que l’exactitude en cache et l’utilité pour l’apprenant sont des objectifs distincts. FAER-UTILITY atteint 0,6624 (contre 0,6329 fixe, 0,5482 uniforme, 0,6037 format-feedback) sous 128 mises à jour, avec un contrat d’audit qui fige les champs observés et les traces de replay avant la jointure des étiquettes.
  • Mémoire récurrente constante. Constant-Memory Recall (arXiv 2610.00232) : une variante DeltaNet à biais de clés fixes, avec 32 KiB d’état matriciel récurrent, atteint 99,95 % d’exactitude moyenne sur trois graines pour 32 paires clé-valeur par séquence, et reste quasi parfaite avec un contexte rempli jusqu’à 1 798 tokens. Une baseline Transformer appariée en paramètres reste proche du hasard — ce qui empêche, honnêtement, toute comparaison d’efficacité mémoire.
  • Le nul est la partie difficile. The Null Is the Hard Part (arXiv 2610.00251) montre que les audits de mémorisation lisent des scores de similarité contre des seuils sans distribution nulle, et que leurs conclusions peuvent être fausses : lue contre son propre nul, le test de copie de données phare de la littérature signale dix générateurs sur vingt-quatre qui ne reproduisent rien. Les auteurs fournissent deux nuls exacts (test de permutation, et contrôle apparié par image) et, calibré, certifient 36 images sur 61 à 5 % de taux de fausses découvertes.
  • Attention-head ablations : attention au confond. (arXiv 2610.00373) Une implémentation naturelle « post-projection » de la mise à zéro d’une tête est presque non corrélée (r = 0,057) avec une ablation pré-projection corrigée, et sélectionne un top-5 d’attention totalement disjoint. L’exactitude binaire cache des effets aux planchers et plafonds comportementaux ; l’intervention corrigée est stable (ρ = 0,974) mais la spécificité de tâche ne tient pas sur GPT-2.
  • Adam vs descente de gradient naturel. (arXiv 2610.00004) Trajectoire géométrique d’Adam dépendante du contexte : déviation faible en paysage bien conditionné, mais désalignements jusqu’à ≈10³ sur un petit réseau non convexe. Le drift géométrique corrèle à une optimisation initiale plus lente sans dégrader la minimisation finale — l’efficacité d’Adam viendrait d’un équilibre entre erreurs d’approximation structurelles et lissage par momentum, plutôt que d’un suivi fidèle du gradient naturel.
  • AutoSynthData (ServiceNow AI, blog HuggingFace) industrialise la génération de données d’entraînement pour agents d’entreprise, avec une abstraction nette tâche = (spécification système, prompt utilisateur, vérificateur) et des critères explicites de faisabilité, réalisme et difficulté. Le pipeline part des échecs d’un modèle cible et des succès d’un professeur plus fort pour construire des cartes de capacités désinfectées, génère de nouvelles tâches exécutables et validées, puis fait glisser le curriculum vers ce qui reste difficile.
  • L’incertitude linguistique n’est pas la nôtre. (arXiv 2610.00083) Les LLM encodent « possible », « likely », « very likely » à des niveaux numériques substantiellement différents de ceux des humains ; un algorithme d’optimisation apprend un profil marqueur→incertitude directement depuis les sorties du modèle, permettant une comparaison marqueur par marqueur des sémantiques de confiance.

📊 Analyse

Le fil rouge de ces travaux est un changement d’objectif. Pendant la phase d’échelle, l’unité de progrès était le paramètre ; aujourd’hui, c’est le rendement par unité de quelque chose — token par GPU-seconde, capacité par octet de mémoire active, exactitude par dollar d’inférence. Olmo-core 3 quadruple la capacité totale en perdant moins de 5 % de débit. Le FP4 fusionné gagne 16 points de débit par seconde et par GPU en payant 2 % de perte. Les polynômes courts rapportent 8 % sur les experts routés sans bouger la perte. Dans chaque cas, l’ingénierie ne consiste plus à ajouter de la capacité, mais à retirer un coût caché : calcul d’échelle, emballage d’opérandes, fonctions transcendantales, re-fragmentation de poids.

Ce basculement a une conséquence que peu d’équipes anticipent : le classement par perte d’entraînement ne prédit plus le classement aval. Le papier FP4 le dit explicitement, et c’est un avertissement pour les pipelines de sélection de checkpoints. Autrui —T2SPO, MatrixReward, FAER, la distillation en pire cas — dit la même chose sous un autre angle : le signal d’apprentissage (outcome final, format, confiance) est mal aligné avec ce qu’on veut réellement, et il faut reconstruire la récompense pour qu’elle le soit. La récompense devient un objet d’ingénierie au même titre que l’architecture.

Deuxième bascule : la spécialisation. Les modèles de décision à la Jev ne sont pas des LLM ratés : ce sont des LLM volontairement amputés de la génération pour gagner en latence, coût et calibration. Amazon les industrialise, la recherche les mesure, et le verdict du jour est nuancé mais net — utiles là où la tâche est un choix fermé, insuffisants face à des ensembles entraînés sur des données étiquetées, et dangereux si mal calibrés par direction. La polarisation « un modèle géant polyvalent » contre « une constellation de petits modèles spécialisés » se déplace : les deux coexistent, avec un harnais qui route selon la tâche.

Troisième bascule, plus discrète mais profonde : les plafonds théoriques redeviennent des objets d’actualité. Casser le plafond de Klein de 1884 sur le groupe symétrique S₅ avec Cayley-SO(5), ou atteindre 100 % de suivi sur A₅ là où une pile diagonale s’effondre à 6,60 %, rappelle que les architectures actuelles sont bornées par des propriétés algébriques, pas seulement par le calcul disponible. Le même soupçon méthodologique revient partout : les tests de mémorisation sans nul, les ablations de têtes non corrélées (r = 0,057), les comparaisons de mémoire sans baseline fonctionnelle. La communauté technique du jour est moins occupée à battre des records qu’à vérifier que les records mesurent la bonne chose.

Enfin, pour les praticiens : ce n’est probablement pas un hasard si Amazon publie un décideur open source la même semaine où OpenAI en annonce un. Le coût d’entrée d’un modèle utile dans cette classe se compte en centaines ou milliers de dollars, pas en millions. C’est la définition d’une commodité en formation — et un argument de plus pour que la différenciation se joue dans le harnais, le routage et la vérification, pas dans le seul modèle.

🎯 À retenir

  • FP4 natif = fusion, pas conversion : co-concevoir producteur de quantification et disposition du consommateur donne 37,9K tokens/s/GPU contre 18,8K en bfloat16, pour +2,11 % de perte — et les classements aval ne suivent pas ceux de l’entraînement.
  • Olmo-core 3 : 8→128 experts, 4,6B→47B de capacité, <5 % de débit perdu, 2,7× de débit sur B300, +21 % en MXFP8, benchmarké à 1,2 T de paramètres sur 512 GPU.
  • MoRA élague 25-50 % des experts MoE en apprenant un biais de routeur et en approximant les experts retirés.
  • Modèles de décision : Amazon publie Strands Decider 2B ; Jev progresse avec les exemples (9,80→28,42 %) mais reste sous les forêts aléatoires (69,95 %), et 50,5 % de ses réponses basculent si l’on inverse oui/non.
  • SSM non abéliens : 100 % de suivi sur A₅, plafond de Klein cassé sur S₅, isométrie exacte — les plafonds algébriques redeviennent un terrain de progrès.
  • La récompense s’ingénierie : pire cas contraint, matrice de rubriques, replay aligné sur l’utilité — le signal d’entraînement est le nouveau goulot.

Le matériel suit une loi de Moore ; les modèles, une loi de rendement décroissant. La journée du 2 octobre 2026 montre où se déplace la valeur : dans les coûts cachés qu’on supprime, les décisions qu’on restreint, et les mesures qu’on apprend enfin à calibrer.

A lire aussi