Inférence CPU ultra-rapide, RAG sans ingestion et géospatial à l'échelle planétaire : la semaine technique
💡 En résumé. Côté technique, la semaine du 29 juillet est exceptionnellement riche. Liquid AI publie des encodeurs (230M et 350M paramètres) qui battent ModernBERT sur CPU à long contexte avec un facteur 3,7×. Le paper ScalableRAG propose un RAG sans base vectorielle ni graphe de connaissances — et bat tous les baselines. GLIDE réinvente l’attention des LLM avec une approche hybride couche-par-couche. OlmoEarth démontre l’inférence géospatiale à l’échelle d’un continent en 30 heures. Fish Audio lève $52M pour la voix IA, et Recursive Superintelligence signe $410M de compute avec AWS.
🔥 Tendances
La course à l’efficacité s’intensifie
Le 28 juillet 2026 marque une accélération notable dans la recherche d’efficacité computationnelle. Alors que les modèles deviennent plus gros et les contextes plus longs, trois papers distincts attaquent le problème sous des angles complémentaires : l’architecture d’attention (GLIDE), les modèles encodeurs légers (LFM2.5-Encoders), et l’ingestion de données (ScalableRAG). Chacun promet des gains significatifs sans compromis sur la qualité.
🤖 Nouveaux modèles et outils
LFM2.5-Encoders : l’encodeur CPU 3,7× plus rapide
Liquid AI publie deux modèles encodeurs, LFM2.5-Encoder-230M et LFM2.5-Encoder-350M (230M et 350M paramètres), conçus pour l’inférence CPU en long contexte.
Architecture : Initialisés à partir des modèles decoder LFM2.5 (230M et 350M), ils subissent trois modifications clés pour passer de causal à bidirectionnel :
- Attention bidirectionnelle — chaque token voit les deux côtés
- Convolutions courtes non-causales — padding symétrique pour mixer l’information voisine
- Masked language modeling — 30 % des tokens masqués pendant l’entraînement
Performances :
- LFM2.5-Encoder-350M se classe 4e au global — battu uniquement par des modèles 10× plus gros (dont un 3,5B)
- LFM2.5-Encoder-230M bat ModernBERT-base et tous les modèles EuroBERT, tout en étant plus petit
- À 8 192 tokens sur CPU : ModernBERT-base > 90s vs ~28s pour le 230M → 3,7× plus rapide
- Un développeur peut scanner/classifier un contrat entier, un transcript ou un long thread de support en moins de 30 secondes sur un CPU de laptop
Cas d’usage : routeurs d’intention, linters de politique, détecteurs PII, classifieurs de texte, filtres de sécurité — tournant 24/7 sur CPU avec des entrées de plus en plus longues.
GLIDE : attention hybride couche-par-couche
Le paper GLIDE (Guided Layerwise Hybrid Attention, arXiv:2607.24788) s’attaque au goulot d’étranglement du KV-cache lors du décodage long-contexte. L’idée centrale : toutes les couches d’un LLM n’ont pas besoin de la même attention softmax.
Découverte clé : les couches précoces sont très sensibles au retrait du softmax, tandis que les couches profondes tolèrent un remplacement par des alternatives linéaires.
Mécanisme : GLIDE introduit un mécanisme adaptatif par couche où chaque couche équilibre une récurrence linéaire efficace avec une fenêtre softmax de taille variable. Contrairement aux approches hybrides uniformes, GLIDE compresse de manière non-uniforme l’empreinte softmax à travers le modèle.
Résultat : latence réduite pour la génération long-contexte sans perte de qualité, avec une réduction de l’I/O du cache KV.
ScalableRAG : le RAG sans ingestion
ScalableRAG (arXiv:2607.25135) propose une approche radicale : un RAG de haute qualité sans coût d’ingestion — pas de base vectorielle, pas de graphe de connaissances, pas de tables SQL.
Comment ça marche :
- Zero-Ingestion ScalableRAG : maintient un espace de travail d’ensembles de documents et de valeurs, avec écriture/lecture pour un raisonnement agrégatif à la volée
- Limited-Ingestion ScalableRAG : ajoute une base vectorielle minimale + découverte automatique de motifs sur un échantillon
Résultats : précision moyenne supérieure de 7,36 % au meilleur baseline concurrent sur 6 corpus. Bat tous les baselines (y compris les approches par graphe de connaissances) sur 3 corpus sur 6, et manque marginalement le maximum sur les 3 autres.
Le code est publié sur GitHub sous licence MIT par Cohesity.
OlmoEarth : l’inférence géospatiale à l’échelle planétaire
Ai2 (Allen Institute for AI) dévoile la plateforme OlmoEarth, une infrastructure d’inférence pour modèles de fondation d’observation terrestre, pré-entraînés sur ~10 téraoctets de données satellites multimodales.
Architecture en trois étages :
- Acquisition/prétraitement (CPU, haut I/O) — fetch, reprojection, alignement, normalisation
- Inférence (GPU) — forward pass du modèle
- Post-traitement (CPU) — assemblage, masques, export Zarr/GeoTIFF/GeoJSON
Performance : inférence à l’échelle d’un continent en ~30 heures, avec jusqu’à 19 600 CPUs + 994 GPUs en parallèle (accélération 155× par rapport au séquentiel), pour des fractions de centime par km².
La roadmap inclut des runs automatisés, la détection de changement (déforestation, inondations), des outils agentiques pour non-experts, et des embeddings globaux pré-calculés.
Fish Audio : $52M pour la voix IA
Fish Audio lève $52M en seed (Coreline Ventures, Capital Today) pour ses modèles de voix IA. 8 millions d’utilisateurs, $21M d’ARR, 15 000+ contrôles de voix en langage naturel. Ses modèles (3 open-source, 1 propriétaire S2.1 Pro) sont utilisés par HeyGen, Sanas et LiveKit pour les agents vocaux.
« Chaque entreprise a des cas d’usage différents : HeyGen veut du réalisme, un studio de jeu des voix expressives, LiveKit de la faible latence. » — Rissa Cao, CEO
Recursive Superintelligence : $410M de compute AWS
Recursive Superintelligence (RSI — amélioration récursive sans intervention humaine) signe un accord de $410 millions avec AWS pour du compute flexible multi-années. Le CEO Richard Socher : « C’est probablement le plus petit deal de compute que nous signerons dans les prochaines années. »
L’objectif : un produit concret d’ici octobre 2026.
📊 Analyse
Le CPU comme plateforme d’inférence oubliée
Les LFM2.5-Encoders de Liquid AI redonnent ses lettres de noblesse au CPU pour l’inférence. Avec 3,7× plus rapide que ModernBERT à 8K tokens, ils ouvrent la voie à des applications (PII, classification, routage) qui tournent 24/7 sans GPU. C’est une tendance de fond : alors que l’entraînement reste GPU-bound, l’inférence en production — particulièrement pour les tâches d’encodage — peut avantageusement retourner sur CPU.
Le RAG sans ingestion : un changement de paradigme
ScalableRAG remet en question la sagesse reçue selon laquelle tout bon système RAG nécessite un index vectoriel coûteux à construire et maintenir. À 7,36 % au-dessus du meilleur baseline, l’approche « workspace dynamique » pourrait réduire considérablement le coût opérationnel des systèmes RAG en production — notamment dans les contextes où les documents changent fréquemment et où la ré-indexation est un fardeau.
L’attention hybride devient granulaire
GLIDE pousse la logique des architectures hybrides (attention + récurrence) au niveau de chaque couche individuelle, reconnaissant que l’hétérogénéité des couches est une propriété fondamentale des LLM. Cette granularité pourrait devenir la norme dans les futurs modèles long-contexte.
🎯 À retenir
- Liquid AI propose des encodeurs CPU 3,7× plus rapides pour le long contexte — une alternative viable aux GPU pour l’inférence d’encodage 24/7
- ScalableRAG bat tous les baselines sans ingestion — le RAG sans base vectorielle est désormais une réalité
- GLIDE introduit l’attention hybride par couche, réduisant la latence long-contexte sans perte de qualité
- OlmoEarth démontre l’inférence géospatiale à l’échelle continentale — 30h pour un continent à ~0,01¢/km²
- $462M investis dans l’infrastructure (Recursive $410M compute + Fish Audio $52M voix)