Post-entraînement, fusion de modèles et inférence : Data-DPO, GUPO, CORAM, Abra et les checkpoints Q4 de Liquid AI
💡 En résumé
La journée du 20 août 2026 sur le plan technique est dominée par une même obsession : faire plus avec moins — moins de données, moins de calcul, moins de mémoire, moins de paramètres. Le flux arXiv cs.LG (50 nouveaux papiers) et le blog Hugging Face convergent vers cinq chantiers. (1) Sélection de données consciente du modèle cible : Data-DPO transforme les différences d’activation du modèle en préférences appariées pour construire des sous-ensembles d’entraînement qui surpassent l’entraînement sur la totalité des données. (2) Stabilisation du post-entraînement RL : GUPO traite les conflits entre gradients de groupes dans GRPO en modélisant chaque gradient comme une variable aléatoire bayésienne. (3) Fusion de modèles géométriquement fondée : CORAM remplace l’arithmétique linéaire en espace de poids par une moyenne sur variétés SVD par tranches, gagnant jusqu’à 1,35 point sur OrthoMerge. (4) Lois d’échelle enfin établies pour la diffusion : Abra montre que les modèles texte-à-image suivent des lois de scaling aussi prédictibles que les LLM — mais exigent ~200 tokens image par paramètre, soit dix fois la prescription Chinchilla, et tolèrent l’overtraining. (5) Inférence quantifiée sans perte : Liquid AI publie des checkpoints Q4_0 entraînés par distillation sensible à la quantification (QAD) pour sa famille LFM2.5, qui conservent 96,5 à 97,4 % de la performance BF16 sur des hardware de bord (MacBook Pro, Galaxy S26, Raspberry Pi 5). En complément, deux approches radicalement différentes pour entraîner des agents — evolution strategies (Agentic ESOpt) et RL multi-agents sans labels (Co-RL) — confirment que la diversification des cohortes est la clé pour échapper aux boucles de renforcement auto-référentielles.
🔥 Tendances : sélection de données et post-entraînement passent au crible de l’incertitude
Data-DPO : choisir les données d’entraînement pour ce modèle-là
La sélection de données pour le supervised fine-tuning (SFT) traite généralement la valeur d’un échantillon comme une propriété statique, indépendante du modèle cible. Data-DPO (arXiv 2608.16926) casse ce postulat : la méthode observe la réponse d’apprentissage locale du modèle cible sur chaque échantillon via un one-step probing, transforme les différences d’activation entre échantillons en préférences appariées, puis entraîne un léger modèle de récompense à apprendre des préférences conscientes du modèle. L’étape finale combine préférence du modèle cible, scores de qualité externes et diversité marginale. Sur Vision-Flan et LLaVA-CoT, Data-DPO surpasse les baselines de sélection existantes sous plusieurs budgets de données — et dépasse stablement la performance de l’entraînement sur toutes les données. Pour les équipes qui veulent réduire les coûts de fine-tuning, c’est une brique directement actionnable.
GUPO : des gradients de groupe moins naïfs pour GRPO
GRPO est devenu l’approche standard du post-entraînement par renforcement des LLM de raisonnement — mais son agrégation moyenne les gradients de groupe comme des contributions déterministes, alors qu’ils pointent souvent dans des directions conflictuelles. GUPO (arXiv 2608.17411) traite chaque gradient de groupe comme une variable aléatoire sous formulation bayésienne, estime sa distribution, en dérive une incertitude via une formulation de Dirichlet, puis calibre la contribution de chaque gradient lors de l’agrégation. Les expériences multi-benchmarks confirment l’efficacité de l’approche : prendre en compte la fiabilité des gradients est plus efficace que de les moyenner aveuglément. Attendu : une ligne de code à surveiller pour tous ceux qui affinent des modèles de raisonnement avec GRPO.
🤖 Nouveaux outils : fusion géométrique, world models et entraînement d’agents frugal
CORAM : la fusion de modèles sort de l’espace des poids
Fusionner des modèles fine-tunés combine des capacités spécialisées sans entraînement conjoint. La plupart des méthodes (model soup, Task Arithmetic) opèrent par arithmétique linéaire en espace de poids euclidien — ce qui ignore la géométrie de la mise à jour. CORAM (arXiv 2608.17366) partitionne chaque matrice cible en tranches de lignes, représente chaque tranche experte par sa décomposition en valeurs singulières (SVD) dans le repère SVD du modèle de base, et moyenne les facteurs spécifiques à la tâche sur leurs variétés respectives. Un coefficient d’amplification λ = κĉ compense la contraction de la moyenne sur variété, avec une règle de sélection de κ à partir de la dispersion des mises à jour expertes — sans évaluer de modèles candidats (reste dans 0,72 point du meilleur balayage). Sur quatre suites couvrant trois familles de modèles (3B à 9B, experts langage et vision-langage), CORAM améliore OrthoMerge de 0,25 à 1,35 point et égale ou dépasse les meilleures baselines en espace de poids.
Q-Learning With World Models : la recherche à l’inférence, sans biais de composition
Les world models prédisent les changements d’état plutôt que les actions seules — un levier d’efficacité d’échantillons qui restait confiné à l’apprentissage de politiques supervisé, car les rollouts imaginés souffrent d’un biais de composition cumulatif. QWM (arXiv 2608.17163) pose la question autrement : et si le world model servait uniquement à la recherche au moment du test — sélectionner des actions de haute valeur par recherche sur trajectoires imaginées — pendant que la politique et la fonction de valeur restent entraînées exclusivement sur des transitions réelles ? Le biais de composition disparaît, les bénéfices d’efficacité demeurent. Sur Robomimic et LIBERO, QWM surpasse nettement les méthodes précédentes en efficacité d’échantillons et en performance — une piste sérieuse pour la robotique d’application réelle.
Agentic ESOpt : le fine-tuning d’agents longs horizons à mémoire GPU minimale
Le RL agentique long-horizon souffre de deux maux : un stack d’entraînement par rétropropagation trop lourd pour les gros LLM, et une assignation de crédit qui se dégrade avec la longueur des trajectoires. Agentic ESOpt (arXiv 2608.17310) parie sur les evolution strategies (ES) : optimisation full-parameter avec seulement une mémoire GPU de niveau inférence, attribution de crédit au niveau trajectoire sans décomposer les récompenses, et composition facile avec l’évolution dans l’espace des prompts (optimisation de skills, test-time compute). Sur WebArena-Lite, l’optimisation full-parameter de Qwen-3.5-27B améliore la baseline No Skill de 6,69 %, et la co-évolution prompt-paramètre bat la baseline appariée dans 28 des 36 réglages. À surveiller pour les équipes qui veulent entraîner des agents sans cluster.
Co-RL : la raison sans labels par cohorte diverse
Le RL auto-récompensé (self-rewarding) réduit la dépendance aux annotations — mais s’entraîner uniquement sur son propre feedback renforce les biais, homogénéise les réponses et mène à l’effondrement. Co-RL (arXiv 2608.17253) montre que du raisonnement non supervisé peut émerger d’un entraînement RL coopératif multi-agents : plusieurs modèles découplés, sans paramètres partagés, optimisés simultanément avec des récompenses dérivées de leurs pairs. La diversité de cohorte (familles de modèles hétérogènes, tailles variées, échantillons reformulés) réduit les erreurs corrélées qui alimentent les boucles auto-renforçantes. Résultats : +3,0 à 8,6 % sur sept benchmarks textuels, +2,3 à 7,2 % sur quatre benchmarks multimodaux, égalant ou dépassant les méthodes supervisées — sans aucune étiquette de vérité terrain.
SLAaaT : les adaptateurs LoRA comme outil d’agent
Enfin, SLAaaT (arXiv 2608.17034) rejette le compromis classique du post-entraînement (nouvelle capacité vs oubli catastrophique) en donnant à l’agent un outil pour changer d’adaptateur LoRA spécialisé en milieu de trajectoire. Sur des tâches de codage composites, le modèle résout des problèmes qu’il ne pouvait pas résoudre avant, bascule de manière autonome (trouvant même une stratégie qui bat une heuristique humaine sur une tâche), et réduit la “capability tax” jusqu’à 18× par rapport à un agent mono-adaptateur — tout en surpassant nettement le spawning de sous-agents en capacités et en tokens.
📊 Analyse : la diffusion a enfin ses lois d’échelle — et elles changent les priorités
Abra : 200 tokens image par paramètre, dix fois la prescription Chinchilla
Les lois de scaling compute-optimales guident l’entraînement des LLM frontière mais restaient largement inexplorées pour la génération visuelle. Abra (arXiv 2608.17286) comble le vide avec une famille contrôlée de transformers flow-matching entraînés sur trois ordres de grandeur de calcul (10¹⁹ à 10²² FLOPs), bien au-delà des études précédentes. Quatre résultats majeurs : (1) les modèles de diffusion scalent aussi prédictiblement que les LLM ; (2) mais ils exigent beaucoup plus de données — l’optimalité compute survient à ~200 tokens image par paramètre, soit dix fois la prescription Chinchilla des LLM ; (3) contrairement aux LLM, les modèles de diffusion sont robustes à l’overtraining — mieux vaut trop de données qu’un modèle trop gros ; (4) la prédictibilité s’étend au-delà de la loss d’entraînement : qualité générative, réglages CFG optimaux, qualité de représentation, et même la forme des courbes d’entraînement, qui se replient sur une forme universelle. Pour toute équipe qui entraîne des modèles texte-à-image : l’équation de budget a changé.
LFM2.5 Q4_0 QAD : la quantification apprise, pas subie
Sur le blog Hugging Face, Liquid AI publie des checkpoints Q4_0 entraînés par distillation sensible à la quantification (QAD) pour LFM2.5-230M, 350M, 1.2B-Instruct et 2.6B. Là où la quantification post-entraînement (PTQ) classique fait chuter la qualité, les checkpoints QAD conservent 97,1 %, 96,5 %, 97,4 % et 96,6 % de la performance BF16 respective — mesurée sur un benchmark couvrant raisonnement, instruction-following, usage d’outils et capacités agentiques (GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, plus GSM8K/AIME25 selon l’échelle). Les mesures sur hardware réel (MacBook Pro, NucBox EVO-X2, Galaxy S26 Ultra, Raspberry Pi 5) confirment l’intérêt pour l’inférence de bord : les modèles LFM2.5 tournent en Q4_0 avec la vitesse et la mémoire Q4_0, sans le compromis de qualité habituel. Un pas de plus vers des petits modèles agentiques réellement exploitables en local.
Google : l’IA générative s’invite dans les révisions
Côté produits grand public, Google déploie cinq nouveautés d’étude dans Search : génération de simulations et outils interactifs personnalisés (ex. tracer des agrumes sur l’échelle de pH), quiz de pratique générés pour toute matière, et préparation aux tests standardisés (ACT, AP, ENEM, GRE, JEE, LSAT, MCAT, NEET, SAT) en partenariat avec The Princeton Review, Careers360, PhysicsWallah et Akira Enem. Les Generative UI sont déployées globalement en anglais dans AI Mode et commencent à arriver dans AI Overviews. L’IA de Search devient un tuteur génératif — un marqueur de l’infiltration de l’IA générative dans les usages éducatifs de masse.
🎯 À retenir
- Data-DPO : la sélection de données SFT consciente du modèle cible (one-step probing + préférences appariées) surpasse l’entraînement sur toutes les données, sur Vision-Flan et LLaVA-CoT (arXiv 2608.16926).
- GUPO : l’agrégation de gradients GRPO sensible à l’incertitude (formulation bayésienne + Dirichlet) stabilise le post-entraînement par renforcement (arXiv 2608.17411).
- CORAM : la fusion de modèles par moyenne sur variétés SVD par tranches gagne 0,25 à 1,35 point sur OrthoMerge, sans balayage de modèles candidats (arXiv 2608.17366).
- Abra : les lois d’échelle de la diffusion exigent ~200 tokens image par paramètre (10× Chinchilla) et tolèrent l’overtraining — plus de données plutôt qu’un plus gros modèle (arXiv 2608.17286).
- QWM, Agentic ESOpt, Co-RL, SLAaaT : world models en recherche à l’inférence, evolution strategies à mémoire GPU minimale, RL multi-agents sans labels par diversité de cohorte, et LoRA switching comme outil d’agent — quatre voies convergentes vers un entraînement d’agents plus stable et plus frugal.
- LFM2.5 Q4_0 QAD de Liquid AI : 96,5-97,4 % de la performance BF16 en 4 bits sur hardware de bord — la quantification apprise remplace la quantification subie.
- Google Search : simulations interactives et quiz générés par IA pour les tests standardisés, déployés globalement en anglais dans AI Mode.