Compression LLM : des modèles 10× plus légers, une facture énergétique qui ne disparaît pas
💡 En résumé
La compression des modèles de langage franchit un palier visible : PrismML compresse Qwen3.8 27B — un modèle de raisonnement — jusqu’à 5,9 Go, soit 9 à 10 fois moins de mémoire, en conservant 98 % des scores agrégés de l’original. Un modèle de raisonnement tenant sur un PC, bientôt sur un smartphone. Mais la semaine de recherche dit aussi l’inverse de la bonne nouvelle facile : la compression a un coût de structure (les mémoires compressées répondent juste aujourd’hui et faux demain), la génération multiple a un coût énergétique invisible (jusqu’à 4,86× d’énergie selon l’ordonnancement), et la complexité d’un prompt se lit avant la génération, pas dans le code produit. Autrement dit : moins de paramètres ne veut pas dire moins de dépense — cela déplace la dépense.
🔥 Tendances : le petit modèle redevient une thèse d’investissement
Bonsai 2 : 27B de raisonnement en 5,9 Go
PrismML fait partie de ces laboratoires qui ne devraient pas être sur le radar — et qui le seront. La startup n’a levé qu’un seed de 22,25 M$, mais elle réunit des profils lourds : fondée par un groupe de chercheurs de Caltech, dirigée par Babak Hassibi, professeur à Caltech et spécialiste de la compression, avec Ion Stoica comme conseiller — cofondateur de Databricks et directeur du Sky Computing Lab de Berkeley, d’où sont sortis Letta et SGLang.
Le pari de PrismML est simple à énoncer et difficile à tenir : un modèle de raisonnement performant n’a pas besoin d’être gros. Jeudi, la société a publié Bonsai 2 27B, qui compresse le Qwen3.8 27B d’Alibaba en 5,9 Go — assez petit pour tenir sur un PC et, potentiellement, sur un smartphone haut de gamme. La réduction mémoire est de 9× à 10× par rapport à l’original.
Le chiffre qui compte n’est pas la taille mais la rétention : Bonsai 2 atteint 98 % des scores de benchmark agrégés de Qwen, contre 95 % pour le premier Bonsai, sorti quelques mois plus tôt. Pour le PDG, c’est ce qui distingue la technologie de PrismML de la concurrence — notamment de Multiverse Computing, beaucoup mieux capitalisée. Des rumeurs évoquent des discussions avec Apple ; Hassibi a refusé de commenter.
Les investisseurs au tour : Khosla Ventures, Cerberus Capital et Caltech. Un tour modeste pour une thèse qui, si elle tient à l’échelle, redistribue la carte de l’inférence : le raisonnement cesse d’être un service loué à l’heure pour devenir une capacité locale.
Base Labs : bâtir la sûreté dans les modèles ouverts
En parallèle, Baseten a lancé une infrastructure de sûreté pour les modèles open-weight via son bras de recherche Base Labs, avec Hugging Face et Goodfire AI. Le cadrage est explicite : « Nous pensons que l’ouverture est un avantage pour la sûreté de l’IA. L’ouverture donne plus de visibilité sur le comportement des modèles et, surtout, davantage de moyens de transformer la recherche en sûreté en contrôles actionnables et transparents que le closed-source. »
Le problème est réel et massif : Hugging Face héberge plus de 6 000 modèles « abliterated » — des modèles dont les garde-fous ont été retirés par ablation, une technique en pleine croissance. Base Labs veut publier des méthodes d’entraînement et de surveillance, et faire de cette approche un standard intégré au modèle dès l’entraînement, plutôt qu’ajouté après coup. Goodfire, spécialisé dans l’ouverture de la « boîte noire » des modèles, est le candidat logique pour la partie « intégrée ».
Les moyens sont là : Baseten a levé une série F de 1,5 Md$ en juin, valorisant l’entreprise à 13 Md$ ; Goodfire a levé 150 M$ en série B menée par B Capital.
🤖 Nouveaux outils et recherche : ce que la compression coûte vraiment
Compresser plus vite : le curriculum couche par couche
« Layer-wise Curriculum Learning for Efficient LLM Compression » introduit une méthode de transfert de connaissances qui partitionne le modèle en segments de couches et applique un curriculum — d’abord les tâches d’optimisation faciles, puis les difficiles. L’analyse théorique du phénomène d’erreur cumulée explique pourquoi cette progressivité accélère la convergence et stabilise le transfert. Un cache de caractéristiques en multi-threading traite le problème du désalignement entre couches et maximise l’occupation GPU.
Résultats : sur BERT et GPT-2, une réduction de plus de 50 % de la mémoire GPU et des heures d’entraînement par rapport aux méthodes comparables, tout en atteignant l’état de l’art. Sur les familles LLaMA et Qwen, la méthode dépasse les autres approches d’élagage à budget d’entraînement identique, avec une empreinte mémoire plus faible.
Entraîner du long contexte : le block parallelism
Les block diffusion language models (BDLM) combinent une dépendance autorégressive entre blocs et un débruitage parallèle à l’intérieur des blocs. Le contexte long y est bridé par la communication d’attention distribuée et la mémoire d’activation. Plutôt que de découper la séquence par position (context parallelism classique), les auteurs observent que l’objectif BDLM se sépare par bloc cible et introduisent le block parallelism : chaque calcul de bloc corrompu est assigné à un rang. La variante CSBP fragmente aussi la séquence propre partagée.
Gains mesurés : sur 16 GPU H200 en contexte 256K, une accélération de 1,18-1,45× en fine-tuning supervisé et 1,27-1,33× pour la conversion de modèles autorégressifs en BDLM, à mémoire de pointe égale ou inférieure. Le gain atteint 1,61× à 512K en modèle complet. Sur 8 H100, CSBP accélère l’entraînement du décodeur spéculatif DFlash2 de 2,48× à 512K et 7,59× à 1M. Enfin, sur des runs appariés de 12 heures de SFT DiffusionGemma 26B-A4B, CSBP obtient de meilleurs taux de réussite à chaque point de contrôle sur SWE-bench Verified et Terminal-Bench Lite.
Le détail géométrique qui décide de l’optimiseur
« Stiefel Attention » pose une question inhabituelle : et si la géométrie des matrices de projection d’attention décidait plus que le choix de l’optimiseur ? Les auteurs contraignent WQ et WK à la variété de Stiefel et les optimisent avec un Adam riemannien portant un seul second moment scalaire par frame, borné par une région de confiance et rétracté polairement. Quatre propositions démontrent que la mise à jour est une descente de plus forte pente dans la métrique plongée, indépendante de l’échelle du gradient, bien conditionnée et exactement équivariante O(d) — chacune certifiée numériquement en float64.
Le mécanisme mis au jour est élégant : le weight decay a un gradient riemannien identiquement nul sur la variété, car W = W I_r appartient à l’espace normal — la géométrie d’attention apprise survit donc aux cycles d’effondrement que le decay provoque ailleurs dans le modèle.
Les chiffres : sur le grokking arithmétique modulaire, un run unique tient 97,0 % de précision de validation à l’époque 20 000, contre 61,1 % pour la ligne de base. Sur les patchs CIFAR-10, la règle gagne +8,98 points sur 12 départs appariés (t = 60,6 ; 12/12), et l’écart s’élargit avec les données. Le détail qui nuance tout : une mise à jour riemannienne à pas fixe est de degré un en gradient, donc elle bouge 24 à 40× moins par pas qu’une matrice AdamW de forme identique — les frames quittent à peine leur initialisation, et les geler coûte seulement 0,28 point. L’ablation attribue tout le gain au fait d’avoir libéré l’échelle du pas, et rien de mesurable au projecteur ni à l’équivariance.
Auditer la compression de contexte : juste aujourd’hui, insuffisant demain
« Correct Now, Insufficient Later » attaque un angle mort majeur de la compression de contexte : une mémoire peut répondre correctement à la requête courante tout en ayant jeté les distinctions nécessaires à une mise à jour future. L’audit apparie deux historiques qui ont la même réponse actuelle, reçoivent une mise à jour commune, et requièrent ensuite des réponses différentes.
Le pilote couvre 24 paires d’historiques, six mécanismes synthétiques, 12 conditions de mémoire, deux répétitions et deux backends. Un sélecteur de frontière déterministe atteint une précision de révélation stricte de 96/96 sur DeepSeek et 82/96 sur GLM ; un writer structuré obtient 62 succès (un cas non résolu) et 56/96. L’audit au niveau de l’enregistrement distingue l’adéquation de l’état retenu, la livraison de la réponse et la conformité au schéma — et trouve 26 et 25 mémoires structurées bien formées mais sémantiquement fausses, tandis que les 14 échecs GLM contiennent tous la bonne valeur dans le mauvais conteneur. Le retrait des tombstones produit 16/16 échecs de replay exact, et le renommage des identifiants fait chuter l’adéquation tardive de 8/8 à 94/320 instances transformées. La réparation équivariante au label ne préserve que 2/8 des réponses d’origine : éliminer un raccourci de nommage ne résout pas le problème de la pertinence future inconnue. Les auteurs sont prudents — méthode d’évaluation et analyse d’échec reproductible, pas supériorité générale.
Le budget d’inférence ne se compte pas en candidats
Une contribution directement exploitable en production : le nombre de candidats N ne décrit pas le coût système de l’inférence. Sur Phi-3-mini et Qwen2.5-1.5B, 500 prompts GSM8K, passer de N = 1 à N = 8 améliore la précision de 8,4 points (Phi-3-mini) et 18,4 points (Qwen2.5-1.5B) — conformément aux attentes. Mais à N fixé à 8, les auteurs comparent quatre ordonnancements : 1×8, 2×4, 4×2 et 8×1 (a appels de b candidats).
Sur GPU A100, huit appels sériels consomment 4,64 à 4,86× plus d’énergie GPU brute et affichent une latence P95 5,77 à 6,12× supérieure à un seul appel par lots de huit candidats. Le motif se reproduit sur trois nœuds A100 indépendamment ordonnancés par modèle, et sur les expériences courtes SciQ/V100. La recommandation est directement actionnable : quand les candidats sont indépendants et que la mémoire le permet, moins d’appels avec des lots plus grands est plus efficace — et toute évaluation de test-time scaling devrait reporter l’ordonnancement de génération et les métriques système GPU, pas seulement le nombre de candidats et la précision.
Lire la complexité du prompt, pas celle du code
« The Complexity Kink » part d’un biais méthodologique répandu : la complexité mesurée sur le code généré dépend de l’échec — un prompt difficile peut produire un programme court qui échoue et se voir attribuer une faible complexité. Les auteurs proposent un index structurel en six dimensions, côté prompt, noté avant la génération et tenu séparé de la correction.
Le protocole : 5 000 prompts Python répartis en six bandes d’une grille préliminaire, renotés par quatre évaluateurs LLM hors panel (19 997 lignes de score, ICC = 0,872 sur les 4 998 prompts avec les quatre notes), puis 21 modèles par prompt, soit 105 000 générations. L’analyse non ajustée montre un point de rupture non monotone au composite 13,75 : 79,9 % de réussite en dessous, 87,6 % au-dessus. Point crucial, ce n’est pas un seuil universel d’échec : les effets fixes de type de tâche déplacent le point de rupture à 10,75 et réduisent l’écart de régime de 7,6 à 2,1 points ; une construction de contrôle le déplace à 8,50 avec un écart brut de −3,5 points ; et les ajustements par modèle comprennent 16 changements à la hausse et cinq à la baisse. Autre observation utile aux équipes : parmi les générations à zéro réussite dont la complexité de sortie est calculable, 28,5 % associent un composite de prompt supérieur à 8 à une complexité de sortie inférieure ou égale à 10 — le code produit est simple, le prompt ne l’était pas. Les auteurs traitent le composite comme un index et refusent toute interprétation causale.
📊 Analyse : la dépense se déplace, elle ne disparaît pas
1. La compression déplace la charge du serveur vers le poste de travail — et vers la spécification. Un Qwen3.8 27B à 5,9 Go sur un PC, c’est une capacité d’inférence qui sort du cloud. Mais l’audit de compression de contexte montre la contrepartie : compresser, c’est choisir ce qu’on jette. Deux mémoires peuvent donner la même réponse aujourd’hui et des réponses différentes demain, et aucune métrique d’exactitude instantanée ne détecte ce défaut. Pour les systèmes en production — agents à mémoire longue, RAG d’entreprise, assistants à contexte persistant — cela signifie qu’il faut auditer la suffisance pour la mise à jour future, pas la justesse du moment. Le protocole d’appariement d’historiques est directement réutilisable.
2. Le coût énergétique est un choix d’ordonnancement, pas une fatalité matérielle. Le résultat 1×8 contre 8×1 est le plus immédiatement rentable de la semaine : à nombre de candidats identique, une décision d’ordonnancement change la consommation GPU brute d’un facteur proche de 5 et la latence P95 d’un facteur proche de 6. Pour un pipeline qui génère huit candidats par requête — échantillonnage multiple, best-of-N, vérification par vote — c’est une économie qui ne demande ni nouvelle carte ni nouveau modèle. Dans le même esprit, le block parallelism convertit des gains d’architecture en gains de temps d’entraînement (7,59× à 1M de contexte sur H100) sans dégrader la mémoire de pointe.
3. La géométrie des poids bat le réglage d’optimiseur — mais pas pour la raison qu’on croit. Stiefel Attention est un cas d’école de rigueur méthodologique. Le gain est spectaculaire (97,0 % contre 61,1 % sur le grokking), et l’ablation démonte l’explication intuitive : ni le projecteur, ni l’équivariance n’expliquent quoi que ce soit de mesurable. Tout vient du fait d’avoir rendu l’échelle du pas libre — au point que geler purement les frames ne coûte que 0,28 point. Le résultat négatif est tout aussi instructif : la suppression de jauge ne peut pas motiver la méthode, parce qu’une direction selon laquelle la perte est invariante ne porte aucun gradient. C’est exactement le type de résultat — positif bruyant, explication réfutée, ablation propre — dont les équipes d’infrastructure ont besoin pour arbitrer.
4. Les modèles ouverts sont devenus un problème de chaîne d’approvisionnement. Avec plus de 6 000 modèles abliterated hébergés chez Hugging Face, la question n’est plus de savoir si un modèle ouvert peut être dégradé, mais si le standard de sûreté arrive avant ou après la diffusion. Base Labs, Hugging Face et Goodfire misent sur l’intégration à l’entraînement ; le budget des trois acteurs (Baseten à 13 Md$, Goodfire à 150 M$) indique que le sujet est désormais traité comme une infrastructure commercialisable, pas comme une clause de bonne conduite.
Ce que cela change pour une équipe qui construit : la compression de modèle est une décision de conception de la mémoire, pas seulement de coût. Vérifiez la suffisance sur les mises à jour futures ; batchez vos générations multiples au lieu de les sérialiser ; mesurez l’énergie GPU et la latence P95, pas seulement le nombre de candidats ; et si vous évaluez la difficulté, lisez le prompt avant la génération plutôt que le code après.
🎯 À retenir
- PrismML Bonsai 2 27B : Qwen3.8 27B compressé à 5,9 Go, une réduction mémoire de 9-10× avec 98 % des scores agrégés conservés (contre 95 % pour la version de mars). Seed de 22,25 M$ seulement, fondateurs Caltech, Ion Stoica conseiller.
- Base Labs (Baseten) + Hugging Face + Goodfire construisent un standard de sûreté pour les modèles open-weight, alors que Hugging Face compte plus de 6 000 modèles abliterated.
- Curriculum par couches (compression LLM) : −50 % de mémoire GPU et d’heures d’entraînement sur BERT et GPT-2, au-delà de l’élagage classique sur LLaMA et Qwen à budget égal.
- Block parallelism (CSBP) : 1,61× à 512K de contexte sur 16 H200, jusqu’à 7,59× à 1M sur 8 H100 pour l’entraînement du décodeur spéculatif, avec de meilleurs taux de réussite sur SWE-bench Verified.
- Audit de compression de contexte : des mémoires « bien formées mais sémantiquement fausses » (26 et 25 cas détectés) et une chute de 8/8 à 94/320 après renommage d’identifiants — la justesse du moment ne prouve rien sur la suffisance future.
- Test-time scaling : à 8 candidats identiques, huit appels sériels coûtent 4,64-4,86× l’énergie GPU et 5,77-6,12× la latence P95 d’un seul appel par lots. L’ordonnancement est une variable de coût de premier ordre.
- Stiefel Attention : la contrainte de variété sur WQ/WK vaut +8,98 points sur CIFAR-10 (12/12) et 97,0 % contre 61,1 % sur le grokking — le gain vient de l’échelle de pas libre, pas de la géométrie, comme le démontre l’ablation.
- Complexité côté prompt : la difficulté se mesure avant la génération (ICC 0,872 sur 5 000 prompts) ; le point de rupture n’est pas universel et 28,5 % des échecs totaux associent un prompt complexe à un code produit simple.
Le fil rouge de la journée : le petit modèle n’est pas le modèle bon marché. Chaque gain de compression, de parallélisme ou de géométrie crée une nouvelle variable à surveiller — suffisance de la mémoire, ordonnancement des appels, spécification de ce qu’on mesure. Ce sont ces variables, et non le nombre de paramètres, qui détermineront la facture réelle de l’inférence en 2027.