Agents IA : la recherche passe à l'échelle avec des frameworks multi-agents, santé agentique et ARC-AGI
💡 En résumé
Le lundi 20 juillet 2026 marque un tournant quantitatif dans la recherche sur les agents IA : plus de 50 papers déposés sur arXiv cs.AI, dont une majorité consacrée aux architectures agentiques. Trois avancées majeures se dégagent : (1) les frameworks multi-agents intègrent désormais la conscience des coûts comme contrainte de premier ordre, (2) le premier modèle spécialisé « agentic healthcare » dépasse les généralistes tout en restant compétitif hors-domaine, et (3) les environnements d’apprentissage par renforcement agentique passent à l’échelle avec 4 500 outils réels via le protocole MCP. Sur le front ARC-AGI, la saturation du benchmark public semble proche avec des agents codant atteignant 99 % de score.
🔥 Tendances — La vague agentique du lundi 20 juillet
GraphDx : la conscience des coûts au cœur du raisonnement multi-agent
Le framework GraphDx (arXiv:2607.15280) propose une approche hybride qui combine graphes de connaissances médicaux et trois agents collaboratifs (perception, raisonnement, décision). L’innovation clé réside dans l’intégration de la sensibilité aux coûts au niveau même de la représentation des connaissances — via des attributs de pertinence diagnostique et de coût dans le graphe MDKG — plutôt que comme pénalité a posteriori.
Les résultats parlent d’eux-mêmes : sur les benchmarks MedQA et MIMIC-IV, GraphDx atteint 79–93 % de succès contre 50–68 % pour les LLMs seuls (DeepSeek-V3, Kimi-k2, Llama-3.3), avec une réduction des coûts de test de 20 à 54 %. Le raisonnement déterministe sur le graphe rend la décision interprétable — un prérequis pour les applications cliniques.
« Les approches LLM existantes échouent à raisonner systématiquement sous contrainte de coût, conduisant à des tests excessifs. » — GraphDx, arXiv:2607.15280
Cura 1T : le premier LLM spécialisé « agentic healthcare »
La startup actAVA AI dévoile Cura 1T, un modèle de 1 000 milliards de paramètres spécialisé dans les soins de santé agentiques. Plutôt qu’une simple mise à jour de données médicales générique, Cura 1T utilise une boucle d’auto-évolution supervisée par des humains : un agent d’entraînement planifie une capacité cible, entraîne le modèle, évalue les trajectoires sur des benchmarks, puis affine le mélange de données à partir des échecs observés.
Le modèle gère consultation patient, raisonnement clinique sur texte et images, diagnostic interactif et utilisation d’outils EHR (dossiers médicaux électroniques). Résultat : Cura 1T atteint ou dépasse les meilleurs modèles généralistes sur les benchmarks de santé, tout en restant compétitif sur les benchmarks agentiques et de raisonnement hors domaine. Une démonstration que la spécialisation agentique peut coexister avec la polyvalence.
AnovaX : l’assistant vocal local multi-agents
AnovaX (arXiv:2607.15367) incarne une philosophie radicalement opposée à Siri ou Alexa : un assistant vocal « local-first » qui tourne entièrement sur la machine de l’utilisateur. En quelques milliers de lignes Python, il combine un pipeline vocal complet, un planificateur LLM (Gemini) générant des plans JSON d’appels d’outils, une couche de sécurité whitelist/denylist, et un orchestrateur multi-agents sur un pool de threads.
Chaque outil correspond à une classe d’agent spécialisée (AppAgent, TypingAgent, BrowserAgent, etc.) avec son propre timeout, politique de retry et verrous de ressources partagées. Un MetaAgent récursif permet au planificateur de déléguer un sous-objectif à lui-même (jusqu’à deux niveaux de profondeur), et une boucle de récupération adaptative ReAct prend le relais en cas d’échec. Le tout peut être piloté depuis un téléphone via une interface Flask sur le WiFi local, avec streaming d’écran en MJPEG.
« Le projet vise moins à concurrencer Siri ou Alexa qu’à montrer qu’un assistant lisible de quelques milliers de lignes suffit à ouvrir des apps, taper du texte, lancer des recherches, coordonner des actions concurrentes et récupérer d’échecs — sans que le LLM ne touche jamais au clavier. » — AnovaX, arXiv:2607.15367
ToolVerse : 4 500 outils réels pour l’apprentissage par renforcement agentique
ToolVerse (arXiv:2607.15660) attaque un problème majeur : les agents LLM raisonnent bien dans des environnements compacts mais peinent à maintenir leur robustesse dans des environnements réels à grande échelle. La solution ? Un framework qui construit automatiquement des environnements d’entraînement massifs à partir de près de 400 protocoles MCP réels, représentant environ 4 500 outils.
ToolVerse introduit trois innovations :
- La construction automatique d’environnements d’entraînement exécutables à partir de MCPs
- La génération de tâches via graphes de dépendances d’outils et un algorithme d’échantillonnage à déverrouillage dynamique
- L’algorithme Turn-Aware Relative Advantage pour résoudre le problème d’assignation de crédit dans l’apprentissage par renforcement agentique à long horizon
ARC-AGI-3 : la saturation du benchmark public est-elle proche ?
Sergey Rodionov (arXiv:2607.15439) compare quatre variantes d’agents de codage sur le benchmark ARC-AGI-3. Le résultat le plus frappant : avec gpt-5.6-sol, l’agent avec vérification (executable world model + simplification + exact replay) résout 100 % des jeux publics avec 99 % de RHAE (reward per human action equivalence), utilisant moins de la moitié des actions du baseline humain.
Prudence toutefois : le modèle postdate ces jeux, et la performance sur des jeux non publiés reste à tester. Le papier suggère que le benchmark public pourrait être saturé par les modèles de pointe. La leçon robuste : la vérification est le composant le plus puissant, la simplification aide dans presque tous les cas, et un world model exécutable sans vérification peut être contre-productif.
Recursive Harness Self-Improvement : l’optimisation du harnais agentique
RHI (arXiv:2607.15524) aborde la coévolution modèle–harnais sous un angle inédit. Plutôt que d’optimiser les modèles, RHI optimise les prompts de harnais — la spécification textuelle de la boucle agentique — via un feedback par paires itératif sur son propre historique de révision. Sur 30 tâches de recherche en ML (finance quantitative, robotique, pharmacie), quelques itérations suffisent à dépasser le réglage « maximum reasoning effort » tout en réduisant le coût d’inférence de 60 %. Le mécanisme sous-jacent : une meilleure gestion du contexte spécifique à la tâche via un flux d’information inter-agents plus efficace — pas des traces de raisonnement plus longues.
🤖 Nouveaux outils et frameworks
- GraphDx — Framework multi-agents avec graphes de connaissances médicaux et conscience des coûts. 79–93 % de succès diagnostique, -54 % de coûts de test. arXiv:2607.15280
- Cura 1T — Modèle 1T paramètres spécialisé healthcare agentique. Boucle d’auto-évolution supervisée. Compétitif sur benchmarks agentiques hors domaine. actava.ai/cura
- AnovaX — Assistant vocal local-first multi-agents. Planification LLM + exécuteurs typés + récupération adaptative. Moins de 10 000 lignes Python. arXiv:2607.15367
- ToolVerse — Framework RL agentique avec 4 500 outils MCP. Algorithme Turn-Aware Relative Advantage. arXiv:2607.15660
- RHI (Recursive Harness Self-Improvement) — Optimisation de harnais agentique par feedback par paires. -60 % coût d’inférence. arXiv:2607.15524
- DSWorld — « World model » pour agents autonomes en science des données. arXiv:2607.15901
- Knowledge-Centric Agents — Génération de workflows par agents centrés sur la connaissance. arXiv:2607.15845
📊 Analyse — Trois tendances de fond
1. La conscience des coûts comme nouvelle frontière. GraphDx et RHI convergent vers une idée commune : l’optimisation des coûts n’est plus une considération secondaire mais une contrainte architecturale. Que ce soit dans le diagnostic médical ou la génération de traces d’entraînement, les frameworks qui intègrent le coût dans leur conception fondamentale surpassent ceux qui l’appliquent comme pénalité a posteriori.
2. La spécialisation agentique sans sacrifice. Cura 1T démontre qu’un modèle peut être profondément spécialisé dans un domaine (santé) tout en restant compétitif sur des benchmarks généraux. C’est une réponse directe au problème classique du « catastrophic forgetting » — ici résolu par une boucle d’auto-évolution qui identifie et corrige les dégradations capacité par capacité.
3. ARC-AGI : du benchmark à la saturation. La performance de gpt-5.6-sol sur ARC-AGI-3 (99 % RHAE) interroge sur la durée de vie des benchmarks publics. Comme le note Rodionov, la vérification combinée à la simplification est le meilleur pari pour les agents de codage — mais l’avantage est plus computationnel qu’architectural.
🎯 À retenir
- Les frameworks multi-agents intègrent les coûts comme contrainte de conception — GraphDx et RHI ouvrent la voie.
- Un modèle 1T spécialisé healthcare démontre qu’on peut allier profondeur de domaine et polyvalence agentique.
- ARC-AGI-3 public peut être saturé — les vrais progrès se joueront sur des jeux non publiés.
- ToolVerse prouve que l’apprentissage par renforcement agentique passe à l’échelle avec 4 500 outils réels via MCP.
- AnovaX montre qu’un assistant vocal local-first, multi-agents et lisible tient dans quelques milliers de lignes Python.