L'échelle n'améliore plus l'efficacité : ce que montrent les mesures
💡 En résumé
Une étude empirique de la famille DeepSeek-R1-Distill apporte la mesure qui manquait au débat sur le scaling : la probabilité de résoudre correctement un problème décroît approximativement de façon exponentielle avec la difficulté, et l’échelle de cette décroissance progresse sous-linéairement avec la taille du modèle. Traduction : les grands modèles sont plus capables, mais les gains diminuent. Plus gênant encore, la longueur de sortie suit une loi de puissance en fonction de la difficulté dont les paramètres ne varient pas systématiquement avec la taille du modèle — autrement dit, les modèles plus grands ne deviennent pas plus efficaces.
Ce constat arrive exactement au moment où la recherche technique propose plusieurs sorties de secours : agrandir un modèle sans dégrader son cache KV (KITE), apprendre la taille du réseau comme un comptage différentiable (NGN), transformer un LLM en autoencodeur continu (LLMAE), apprendre couche par couche sans rétropropagation globale (le contrat de dérive), ou entraîner des équations différentielles hybrides sur un microcontrôleur de 61 kilo-octets. Le fil commun : on arrête d’ajouter des paramètres, on commence à instrumenter ce qu’on a.
🔥 Tendances : ce que la mesure dit du scaling
Une décroissance exponentielle à pente sous-linéaire
L’étude utilise des modèles bayésiens hiérarchiques pour évaluer conjointement capacité et efficacité sur quatre classes de problèmes de raisonnement arithmétique et algorithmique, en utilisant la chaîne de pensée pour résoudre des problèmes de difficulté contrôlée. Trois résultats structurent le raisonnement :
- À taille de modèle fixée, la probabilité de résoudre une instance décroît à peu près exponentiellement avec la taille de l’instance (le substitut retenu pour la difficulté).
- L’échelle de décroissance croît sous-linéairement avec la taille du modèle : la capacité progresse, les gains s’amenuisent.
- La longueur de sortie croît en loi de puissance avec la difficulté, mais les paramètres de cette loi ne varient pas systématiquement avec la taille du modèle.
Le troisième point est le plus inconfortable. Si un modèle plus grand dépensait proportionnellement moins de jetons pour un même niveau de difficulté, on pourrait parler de gain d’efficacité. Ce n’est pas ce qu’on observe : à difficulté égale, le profil de dépense de jetons est essentiellement invariant. Les auteurs concluent à des limites potentielles du scaling naïf comme stratégie : la capacité s’améliore avec des rendements décroissants, l’efficacité ne s’améliore quasiment pas.
Cela ne signifie pas que l’échelle est inutile, mais que l’échelle seule ne réduit pas le coût par problème résolu. C’est précisément ce que les papiers d’optimisation de la même nuit cherchent à corriger.
Caché : agrandir sans toucher au KV
KITE (KV-Invariant Transformer Expansion) part d’un constat économique : monter en taille ne pose pas seulement une question de qualité finale, le choix architectural détermine combien de calcul est dépensé à l’entraînement, au traitement du prompt et au décodage autorégressif pour atteindre une qualité donnée. L’idée est d’entraîner de petit vers grand — en économisant sur l’entraînement par upcycling — tout en plaçant les paramètres nouvellement ajoutés dans des régions qui n’affectent pas le KV de l’attention. Conséquence à l’inférence : le préremplissage du KV ne dépend que de la petite partie du modèle.
L’instanciation concrète est le Step Scale Transformer (SST), un décodeur à deux tours : une tour produit les KV, l’autre les lit. À budget de calcul d’entraînement cumulé comparable, SST, un modèle MoE de 67 milliards de paramètres avec 2,15 milliards de paramètres actifs par jeton de décodage, atteint une perte d’entraînement inférieure à des transformeurs MoE de 47 et 63 milliards (1,48 et 2,02 milliards actifs respectivement), tout en réduisant le coût d’inférence estimé de 6,7 % et 31,6 %.
C’est une démonstration que l’architecture reste un levier de coût aussi puissant que le nombre de paramètres.
Apprendre la taille du réseau
NGN (Neurogenesis Network) attaque une convention rarement interrogée : la taille d’un réseau est choisie avant l’entraînement, ce qui sépare la sélection d’architecture de l’optimisation des poids. Les auteurs introduisent une paramétrisation différentiable qui apprend combien de composants structurels ordonnés un modèle doit utiliser. Pour chaque groupe de composants ordonnés, une frontière apprenable sélectionne un préfixe actif pendant que les paramètres s’entraînent. La frontière peut grandir depuis une initialisation compacte, et le déploiement consiste simplement à jeter les composants au-delà de la frontière apprise.
Le mécanisme est appliqué aux MLP, aux réseaux convolutifs et sur graphes, aux transformeurs, aux modèles à espace d’état, à LoRA et aux adaptateurs. Résultat : déployer uniquement le préfixe appris change peu la performance, et les architectures sélectionnées se comportent comme des modèles fixes entraînés à la même taille. La capacité structurelle devient une variable optimisable à part entière, au même titre qu’un poids.
Repurposer un LLM en autoencodeur
Le troisième papier s’attaque à une asymétrie : la génération d’images s’appuie depuis longtemps sur des autoencodeurs haute fidélité opérant dans un espace latent continu, alors que le texte n’a pas de représentation continue comparable — la prédiction du jeton suivant ne représente la structure globale qu’indirectement, par factorisation séquentielle.
LLMAE expose un goulot d’étranglement latent de longueur fixe au sein des activations internes d’un LLM décodeur pré-entraîné. Instancié avec un Gemma 3 de 270 millions de paramètres, le procédé combine masques d’attention structurés, adaptation LoRA et régularisation KL pour apprendre une interface d’autoencodage qui exploite le prior génératif du modèle d’origine. Entraîné à reconstruire des séquences jusqu’à 1 024 jetons, il obtient une reconstruction quasi parfaite. La démonstration d’utilité aval est concrète : un modèle de diffusion textuelle latent entraîné sur cet autoencodeur produit des légendes d’images détaillées. Le texte acquiert ainsi le substrat continu qui manquait à la génération multimodale.
🤖 Nouveaux outils et savoir-faire
Le contrat de dérive : l’apprentissage local redevient praticable
L’apprentissage local — chaque couche entraînée avec sa propre perte auxiliaire, sans passe arrière globale, donc structurellement parallèle — est resté marginal pour deux raisons : la précision se dégrade avec la profondeur et les hyperparamètres sont fragiles. Le « contrat de dérive » applique une géométrie de mise à jour spectrale de type Muon (orthogonalisation du momentum avec mise à l’échelle spectrale du pas) aux mises à jour locales par couche, une intersection jamais étudiée.
Les mesures sont nettes sur des bancs CIFAR-10 à têtes locales linéaires : un seul réglage de pas de mise à jour est la meilleure valeur des grilles testées, de la largeur 128 à 2 048 et de la profondeur 12 à 48. Adam local, lui, exige un réajustement sur les deux axes et s’effondre encore à profondeur 48 : 19 % avec son réglage de profondeur 12 transféré, contre 42,7 % pour la mise à jour spectrale à réglage inchangé. À cinq graines et largeur 512, l’avantage est franc : 48,9 ± 0,5 contre 46,6 ± 0,3. Des contrôles spécifiés prospectivement attribuent le transfert et l’essentiel de la robustesse à la profondeur à la géométrie spectrale elle-même, non à une règle de pas surajoutée.
Le contrat formalise ensuite le pas comme lr = ε / RMS(entrée), ce qui borne le changement de pré-activation induit par les poids à chaque étape, conditionné à l’entrée courante. Gain modeste sur le meilleur pas fixe, mais interprétabilité et borne de dérive par couche qu’aucun optimiseur standard ne fournit. Le papier rapporte aussi un résultat négatif honnête : avec RMSNorm et weight decay dans le tronc, le bénéfice de stabilité des mises à jour spectrales revient à l’entraînement global plutôt qu’au local — l’avantage local se concentre précisément là où la normalisation est absente.
Smoothing à covariance pleine pour l’adaptation en ligne
Traiter les couches d’un réseau comme les pas de temps d’un modèle d’espace d’état transforme l’entraînement bayésien en problème de lissage : une passe avant propage les moments gaussiens à travers le réseau, une passe arrière de Rauch-Tung-Striebel met à jour les postérieurs des poids en forme close. Ces méthodes apprennent d’une seule passe sur chaque observation, de manière consciente de l’incertitude, sans itérations de gradient ni rejeu — idéal pour l’adaptation en ligne et l’apprentissage économe en données. Leur limite historique : elles se restreignent à des covariances diagonales à travers les activations, jetant les corrélations entre neurones.
Une identité de covariance croisée permet désormais la propagation à covariance pleine à travers les activations non linéaires. Le lissage retenu n’approxime comme gaussienne que la sortie affine de chaque couche, et s’applique aussi bien aux systèmes déterministes à observations bruitées qu’aux systèmes stochastiques décrits par des statistiques de sortie. Démonstrations en classification non stationnaire, apprentissage en ligne de dynamique, et adaptation de politique d’un modèle vision-langage-action, avec une précision généralement supérieure aux autres méthodes de lissage.
Des équations différentielles universelles sur microcontrôleur
TinyUDE s’attaque à un obstacle matériel : l’entraînement d’équations différentielles universelles repose traditionnellement sur la rétropropagation à travers un solveur numérique, ce qui produit une empreinte mémoire très au-delà des capacités d’un microcontrôleur d’extrémité. La méthode proposée, l’appariement de jets de Lie-Taylor, se passe de solveur : elle ajuste un champ vectoriel hybride directement sur les dérivées premières et secondes des états observés, estimées en ligne par filtrage de Savitzky-Golay, ce qui donne des gradients entièrement analytiques sans logiciel de différenciation automatique.
Face à une référence classique (intégration RK4 à pas fixe, tir multiple, adjoints discrets exacts, Adam) partageant dynamique, modèles de bruit, architectures et métriques, l’appariement naïf de dérivées se dégrade sous bruit de capteur — puis les mécanismes d’adaptation au bruit (échantillonnage déphasé à pleine cadence, tampon réservoir, optimisation à recuit cosinus avec moyennage de poids, estimation du bruit embarquée, portes de qualité par écart polynomial) referment et inversent l’écart. Sur un pendule amorti et un pendule double chaotique, la méthode égale ou dépasse la référence à fenêtres de données appariées et récupère des coefficients d’amortissement non modélisés. De 0 % à 5 % de bruit, elle atteint une erreur relative de champ en moyenne géométrique de 0,65× celle de la référence, dans 108 kilo-octets de mémoire statique, contre des mégaoctets de bande de solveur. Sur un ESP32, l’exécution embarquée atteint une erreur de champ de 0,0020 et récupère le coefficient d’amortissement à c = 0,400 (valeur vraie 0,400) dans 61,3 kilo-octets de mémoire statique et 7,24 millisecondes par mise à jour — 18,1 % de cycle de service à 25 hertz. L’entraînement en temps réel sans solveur numérique est faisable sur un composant à quelques euros.
Empiler sans s’effondrer : CORE-STACK+
L’empilement de backbones de vision hétérogènes (CNN, ViT, hybrides) est la recette de facto pour la précision, la calibration et la robustesse, mais deux pathologies couplées limitent le rendement : la multicollinéarité dans l’espace de prédiction mal conditionne la matrice de Gram du méta-apprenant et gonfle la variance des poids ; l’effondrement de calibration propage la mauvaise calibration des constituants par empilement linéaire naïf, si bien qu’ajouter des modèles peut dégrader l’erreur de calibration attendue. Les remèdes existants — régularisation ridge, sélection gloutonne, soupes de modèles, SWAG — n’en traitent qu’un seul, aucun ne vise conjointement le conditionnement et la calibration.
CORE-STACK+ combine un filtre de redondance à noyau qui retire les dépendances non linéaires invisibles à la corrélation de Pearson (via l’alignement de noyaux centrés), une porte de méta-caractéristiques différentiable de moins de 15 000 paramètres qui apprend une attention par échantillon sur les statistiques d’ensemble, une pénalité ridge adaptée au spectre dérivée d’une décomposition signal-bruit de Marchenko-Pastur (λ* = λmax/SNR, ce qui élimine la validation croisée imbriquée), et un mélangeur bayésien par approximation de Laplace remplaçant les heuristiques d’erreur quadratique inverse. Une borne PAC-Bayes d’excès de risque tient conjointement compte de la redondance dans l’espace de prédiction et de la capacité du méta-apprenant.
Sur six bancs : +1,8 % de top-1 sur ImageNet-1K, −4,2 de mCE sur ImageNet-C, +0,9 de mIoU sur ADE20K, +1,3 de PA sur COCO, en réduisant les modèles conservés de 35 à 57 % et les FLOPs d’inférence jusqu’à 41 %. L’erreur de calibration attendue s’améliore d’un facteur 2,1 par rapport aux ensembles profonds, sans mise à l’échelle de température a posteriori.
Graphiques relationnels et prévision multi-échelle
QUARTET s’attaque à deux limites du modèle de référence RelGT sur les bases multi-tables modélisées comme graphes temporels hétérogènes : un échantillonneur local aléatoire qui produit des sous-graphes faiblement connectés, et un module d’attention globale reposant sur une mémoire unique fondée sur les caractéristiques de graine, aveugle aux dynamiques macro. La réponse combine un échantillonneur à marche aléatoire causale fondé sur un PageRank personnalisé tronqué par récence (sous-graphes compacts, robustes aux hubs, densément connectés, sans fuite temporelle) et un module d’attention croisée à quatre branches intégrant le contexte global depuis les caractéristiques de graine, la topologie de graine, la dynamique temporelle et la dynamique collaborative. Sur les tâches de classification de RelBench v1, QUARTET égale ou dépasse les transformeurs de graphes de référence.
HARN, de son côté, traite la prévision financière multi-échelle en maintenant des représentations persistantes par niveau temporel et en ne mettant à jour un niveau que lorsque sa barre complète devient disponible — encodage temporel multi-échelle causal, mémoire associative à portes, résonance inter-niveaux, agrégation hiérarchique de preuves, prévision en points de base reconstruite à l’échelle de prix. Les auteurs sont explicites sur la portée : le résultat positionne HARN comme un cadre de prévision multi-échelle persistant, pas comme une preuve de supériorité prédictive universelle.
Le calcul seul ne caractérise pas le scaling
Une étude contrôlée sur les modèles de fondation en IRM fonctionnelle apporte un contre-point précieux. Avec des données de préentraînement issues de plus de 200 jeux de données sources et plus de 10 000 heures-GPU d’expériences, à cadre de préentraînement et protocole aval fixés, les auteurs font varier taille des données, taille du modèle et durée d’entraînement. Trois enseignements :
- La performance aval s’améliore généralement avec le calcul, mais des modèles utilisant un calcul similaire peuvent performer très différemment.
- Les données supplémentaires apportent des gains plus grands aux modèles plus grands : données et taille de modèle doivent être mises à l’échelle ensemble.
- À calcul égal, augmenter les données de préentraînement bénéficie à plus de tâches qu’augmenter la taille du modèle, avec des variations selon les tâches.
La suite est méthodologiquement instructive : les combinaisons sont sélectionnées sur la performance aval en distribution, puis verrouillées avant l’évaluation hors distribution. Les modèles obtenus atteignent la meilleure performance moyenne sur les tâches hors distribution parmi les modèles de fondation IRM comparés, avec moins de calcul de préentraînement. Conclusion : le calcul seul ne caractérise pas le scaling — la performance dépend de la manière dont données, taille et durée sont combinées.
Deux corrections aux hypothèses sur les représentations
Enfin, deux papiers corrigent des formulations trop rapides sur la similitude des représentations apprises. Le premier soutient que l’hypothèse de représentation linéaire n’est pas une hypothèse mais une famille de revendications, distinguées par la notion d’équivalence de représentation retenue : différentes notions d’équivalence préservent des structures différentes, si bien que des métriques, sondes et interventions qui semblent étudier la même représentation peuvent en réalité correspondre à des hypothèses différentes. Le formalisme proposé utilise des actions de groupe pour spécifier l’objet de représentation, le procédé qui le produit et la propriété finalement affirmée, en tenant compte des équivalences imposées par l’architecture.
Le second réexamine l’hypothèse dite platonicienne — la convergence des modèles capables vers des représentations partagées — en montrant que les comparaisons locales-globales antérieures confondent l’échelle structurelle avec la nature de ce qui est comparé : la structure relationnelle (quels échantillons sont liés) d’un côté, la géométrie métrique (distances, similarités, corrélations) de l’autre. Un cadre contrôlé 2×2 évaluant les deux à l’échelle locale et globale, avec un recouvrement de squelette H₀ comme contrepartie globale des k plus proches voisins mutuels, donne un résultat net : après calibration, la structure relationnelle présente une convergence robuste aux deux échelles, tandis que l’accord de distance se dégrade et aplatit progressivement la tendance liée à la capacité. Le motif se reproduit sous approximation d’une métrique riemannienne, et sur des représentations vidéo-texte. Ce qui converge entre modèles, c’est la structure des relations, pas la géométrie.
📊 Analyse : trois façons de sortir du scaling naïf
Les travaux de la nuit dernière ne forment pas un front unique, mais ils se rangent en trois catégories claires.
1. Déplacer le calcul plutôt que l’augmenter. KITE est l’illustration la plus directe : en isolant les paramètres qui n’affectent pas le cache KV, on paie l’entraînement de la grande taille mais pas l’inférence correspondante. Le gain de 31,6 % face à un MoE de 63 milliards vient de l’architecture, pas d’une approximation. De même, CORE-STACK+ réduit les FLOPs d’inférence jusqu’à 41 % en retirant de la redondance plutôt qu’en ajoutant de la capacité.
2. Apprendre la structure au lieu de la fixer. NGN rend la taille différentiable, le contrat de dérive rend le pas de mise à jour interprétable par une borne de dérive, LLMAE apprend un goulot latent fixe. Dans les trois cas, un choix d’ingénierie qui était figé avant l’entraînement devient une variable optimisée pendant l’entraînement.
3. Changer d’instrument de mesure. Le résultat sur l’efficacité des modèles de raisonnement n’est intéressant que parce qu’il distingue capacité et efficacité comme deux dimensions séparées, évaluées par un modèle hiérarchique bayésien. De même, l’étude IRM f explique l’écart de performance entre modèles à calcul égal par la composition du budget (données, taille, durée) et verrouille les choix avant l’évaluation hors distribution. Sans ces protocoles, on aurait continué à lire les mêmes courbes en croyant y voir deux choses à la fois.
Reste la question économique, qui n’est pas traitée par ces papiers mais que leurs chiffres éclairent : si l’efficacité par jeton ne progresse pas avec la taille du modèle, alors la baisse du coût par tâche dépend entièrement de l’architecture, de la compression et de la sélection d’outils. C’est cohérent avec ce qui se passe côté industrie : les annonces récentes de prix des labos attribuent explicitement les baisses au cache et à l’inférence, pas à un modèle plus petit qui serait miraculeusement aussi bon.
🎯 À retenir
- La capacité progresse avec des rendements décroissants et l’efficacité ne suit quasiment pas : la probabilité de résoudre un problème décroît exponentiellement avec sa difficulté, l’échelle de décroissance croît sous-linéairement avec la taille du modèle, et les paramètres de la loi de puissance de la longueur de sortie ne varient pas systématiquement avec cette taille.
- KITE / Step Scale Transformer place les paramètres ajoutés hors des régions qui affectent le KV attention, obtient une perte inférieure aux MoE de 47 et 63 milliards à calcul d’entraînement comparable et réduit le coût d’inférence estimé de 6,7 % et 31,6 %, avec 2,15 milliards de paramètres actifs par jeton.
- NGN apprend la taille du réseau comme un comptage différentiable sur MLP, CNN, GNN, transformeurs, modèles à espace d’état, LoRA et adaptateurs : le préfixe appris se déploie en jetant le reste, presque sans perte.
- LLMAE transforme un Gemma 3 de 270 millions de paramètres en autoencodeur textuel continu à goulot fixe, avec reconstruction quasi parfaite jusqu’à 1 024 jetons, et alimente une diffusion textuelle latente pour la légende d’images.
- TinyUDE entraîne des équations différentielles hybrides sans solveur sur un ESP32 : erreur de champ 0,0020, coefficient d’amortissement récupéré à 0,400, 61,3 kilo-octets de mémoire statique, 7,24 ms par mise à jour.
- Le contrat de dérive rend l’apprentissage local robuste à la profondeur : un seul pas de mise à jour reste optimal de profondeur 12 à 48, là où Adam local s’effondre à 19 % contre 42,7 %.
- Le calcul seul ne caractérise pas un scaling : à calcul égal, augmenter les données de préentraînement bénéficie à plus de tâches qu’augmenter la taille du modèle, et les combinaisons verrouillées avant évaluation hors distribution battent des modèles comparables avec moins de calcul.