Benchmarks d'agents : ce qu'un échec certifie vraiment

💡 En résumé

Le débat sur les agents IA franchit une étape : la question n’est plus de savoir si les modèles savent accomplir une tâche, mais ce qui atteste qu’ils l’ont accomplie. Trois publications convergentes de la nuit dernière — l’audit d’un corpus d’agents gelé, la démonstration qu’un cache d’outils marginalement correct peut inverser une mise à jour de politique, et une couche de mémoire qui refuse de retenir une compétence avant qu’elle ait passé les contrôles de synthèse — dessinent une même conclusion : le taux d’échec d’un banc d’essai mesure la qualité de l’instrument autant que la difficulté de la tâche.

Sur 125 tâches de Terminal-Bench où aucun agent n’a réussi, 78 seulement survivent à un écran de validité ordonné. Les 47 autres se répartissent entre oracles cassés, pannes d’infrastructure, contournements du vérificateur et solvabilité non démontrée. En parallèle, côté industrie, Meta pousse son agent Muse sur tous les supports imaginables et OpenAI apporte les commandes vocales agentiques sur mobile. La capacité progresse ; la capacité à la prouver progresse plus lentement.


🔥 Tendances : la preuve devient le goulot d’étranglement

Ce qu’un échec universel ne dit pas

Le papier le plus important de la journée vient d’un corpus de production gelé. Les auteurs ont travaillé sur l’enregistrement d’exécution de Terminal-Bench 3 / Frontier-Bench 0.1 : 1 081 pull requests, 639 tâches notées, 28 801 essais d’agents et 105 933 dollars de dépense agent enregistrée. Le point de départ est une intuition que tout le monde partage sans l’avoir vérifiée : une tâche qu’aucun modèle ne résout est une tâche difficile.

C’est faux, et le papier quantifie à quel point. Sur les 125 tâches sans réussite honnête, l’application d’un écran de validité ordonné — artefacts de tâche, exécutions de la solution de référence, contrôles à solution vide, essais adversariaux, trajectoires, télémétrie, dossiers de revue — n’en laisse survivre que 78 comme candidates certifiées non résolues. Le reste se décompose ainsi :

  • 14 tâches avec des oracles cassés : la solution de référence elle-même ne passe pas.
  • 8 tâches dominées par des défaillances d’infrastructure : le harnais d’exécution est le facteur limitant.
  • 4 tâches franchissables uniquement par contournement du vérificateur : la difficulté apparente est une faiblesse de la porte de sortie.
  • 21 tâches dont la solvabilité n’est certifiée par aucune preuve disponible.

Le libellé « certifié non résolu » est lui-même délibérément étroit : il signifie que la route rédigée par l’auteur passait, que l’infrastructure n’a pas dominé, qu’aucun contournement strict n’a été observé et que tous les agents évalués ont échoué. Il ne prouve pas la difficulté intrinsèque, ni la complétude du vérificateur, ni l’échec sur la capacité visée. La recommandation finale des auteurs est directement opérationnelle : les bancs d’essai de frontière devraient publier les preuves qui soutiennent leurs tâches « en échec total » avant de les utiliser comme revendication de capacité.

C’est un renversement de charge de la preuve. Jusqu’ici, on demandait aux modèles de prouver qu’ils savent faire. On demande maintenant aux évaluateurs de prouver que la tâche est faisable.

Le cache d’outils qui inverse la mise à jour

Deuxième pièce du dossier, plus discrète et plus dérangeante. Le cache de résultats d’outils est une brique standard de l’entraînement d’agents : il évite de réexécuter les mêmes appels et réduit massivement le coût des rollouts. Mais il couple aussi l’aléa entre les rollouts d’un même groupe.

Les auteurs construisent un modèle à deux actions où l’exécution indépendante et l’exécution partagée préservent rigoureusement la distribution conditionnelle de récompense de chaque rollout. Accord marginal parfait, donc. Malgré cela, partager un seul résultat stochastique par groupe peut inverser la mise à jour de politique normalisée par groupe. L’expression finie exacte est éloquente : face à une alternative constante, la mise à jour partagée suit la probabilité de gagner diminuée de la probabilité de perdre, au lieu de la différence de récompense espérée. Une spécialisation bernoullienne exhibe une région de direction erronée et un plancher de variance de mise à jour qui ne tend pas vers zéro quand la taille du groupe augmente.

Les vérifications sont exhaustives : 540 configurations, 3 240 évaluations d’estimateur, un vérificateur de séquences ordonnées séparé, et un audit d’implémentation qui reproduit le chemin de partage dans une pile TVCache épinglée et non modifiée sur 256 rollouts scriptés. Les auteurs sont prudents — ces résultats ne mesurent pas la performance d’entraînement d’un modèle de langage et ne réfutent pas le contrat de sortie déterministe de TVCache. Ils établissent une chose plus fondamentale : la validité marginale d’une sortie ne certifie pas qu’un cache stochastique est équivalent à un entraînement sans cache.

C’est le type de résultat qui ne se voit dans aucune courbe de perte et qui explique des régressions inexplicables en production.

Retenir une compétence seulement après vérification

Troisième pièce, constructive celle-là. ChipMEM s’attaque à un travers bien documenté des agents de conception électronique (EDA) : les méthodes récentes apprennent des retours d’outils en distillant des compétences réutilisables ou en s’entraînant sur des récompenses dérivées de l’outillage, mais elles sont évaluées sur les tâches qui ont produit l’expérience. L’accès répété au retour du banc d’essai sur la même tâche récompense la révision spécifique à la tâche plutôt que la création de connaissance transférable.

La couche de mémoire proposée combine deux composants. Le composant procédural ne stocke une compétence qu’après qu’elle a passé les contrôles de synthèse, de simulation ou de forme formelle — pas sur auto-évaluation du modèle. Le composant bayésien maintient des estimations Beta hiérarchiques sur les résultats d’appels d’outils et classe les stratégies de récupération qui ont fonctionné sous des erreurs comparables. Un adaptateur commun applique la même interface de mémoire à l’optimisation RTL et à la génération de bancs de test, en préservant les outils et critères d’acceptation de chaque domaine.

Les chiffres, à modèle et outils identiques : 39/54 designs produisent des sorties qui passent l’équivalence, contre 35/54 sans mémoire ; sur la suite courte de 49 designs, l’amélioration moyenne de surface monte à 8,69 % contre 5,66 %. Et le test qui compte vraiment, celui du transfert : sur des tâches CVDP tenues à l’écart, 20/20 résultats acceptés contre 18/20 sans mémoire, avec une bibliothèque procédurale gelée et une seule évaluation par réglage. La mémoire ne fait pas gagner parce qu’elle se souvient ; elle fait gagner parce qu’elle ne se souvient que de ce qui a été vérifié.

L’écart entre prédire et utiliser

CELLAUDIT déplace le même principe vers la découverte scientifique par agents. Les cellules virtuelles IA visent à prédire les réponses cellulaires à des interventions spécifiées — mais une performance prédictive sur données tenues à l’écart n’établit pas que l’information de perturbation fournie a été utilisée. C’est l’écart entre prédiction et revendication.

Sur un banc d’essai apparié morphologie-transcriptomique (BBBC047), un prédicteur sélectionné par agent atteint un coefficient de corrélation de Pearson global de 0,3153 sur données tenues à l’écart, mais reste invariant au remplacement du composé. Un prédicteur exclusivement fondé sur les profils de contrôle atteint 0,3142. Autrement dit : le modèle « gagnant » n’utilise pas la variable qu’il prétend exploiter, et un modèle aveugle à cette variable fait aussi bien. L’inspection du code source identifie une voie de requête composé bloquée par une attention clé-valeur à clé singleton, et l’invariance persiste après réajustement sur des puits de contrôle disjoints.

Sur un audit stratifié de 48 candidats répartis sur deux tâches liées : 47 changent leurs prédictions sous remplacement du composé sur les deux plis tenus à l’écart, mais seulement 20 montrent des gains de perte cible avec des intervalles au-dessus de zéro sur les deux plis. Le message est que la découverte de modèles par agents doit passer d’un cycle générer-noter-réviser à un cycle découvrir-falsifier-réviser.


🤖 Nouveaux outils et capacités

FWBench : la décision, pas l’exactitude

Les modèles de fondation de séries temporelles fournissent des prévisions pour des décisions opérationnelles, mais l’exactitude seule ne détermine pas leur valeur. FWBench évalue cette capacité sur 1 251 cas d’électricité et de vélos en libre-service, avec des outils de prévision fixes et des contrats de capacité simulés. Les agents sélectionnent des modèles, des historiques et des horizons, puis soumettent des capacités pour minimiser un objectif de coût de perte déclaré. Deux configurations hébergées et huit locales ont été évaluées, y compris des petits modèles de langage, avec et sans modèles de séries temporelles.

Résultat notable : GPT-6 Astra a acheté sélectivement des prévisions bon marché à court horizon, en utilisant 2,5 % du budget, et a surpassé les politiques fixes lorsque les décisions ainsi économisées étaient notées selon trois pondérations de coût de perte différentes. La compétence mesurée n’est pas la précision de prévision : c’est l’arbitrage entre acheter de l’information et décider.

Live Assistant : apprendre à se taire

Toutes les capacités d’agent ne sont pas des actions. Live Assistant formalise l’assistance en direct comme quatre décisions couplées : agir ou non, quand agir, à qui s’adresser, quoi communiquer. Toutes les dix secondes, une politique autorégressive consomme l’audio et la vidéo natifs avec les commentaires synchronisés, les cadeaux, la dynamique des spectateurs et les métadonnées de salle, puis choisit OBS (rester silencieux), MEM (enregistrer une mise à jour sémantique privée) ou ANS (spécifier un destinataire, une tâche et un message ancré).

Pour soutenir la tâche, les auteurs ont construit un moteur de trajectoires qui reconstruit de vraies sessions de diffusion en supervision causale structurée : plus de 320 heures de trajectoires d’optimisation et un banc d’essai relu par des humains de 275 clips et 13 812 intervalles de décision. L’entraînement combine un affinage supervisé multitour sensible aux marqueurs (MA-MSFT) puis un GSPO multitour en flux (SM-GSPO) avec crédit au niveau du tour et de la trajectoire. Sur le banc tenu à l’écart : 71,14 d’exactitude d’état, 72,67 de destinataire, 58,41 de tâche. Le silence y est une action apprise, pas une absence de sortie.

SR-Fraud : le vérificateur comme porte d’admission

La détection de fraude en temps réel est un problème de prédiction en flux non stationnaire : les adversaires s’adaptent avant que les étiquettes supervisées ne mûrissent, et les attaques en rafale localisées causent des pertes avant tout réentraînement. SR-Fraud découple la décision au moment de la requête de l’adaptation hors ligne. Un agent gelé et sans état note chaque transaction à partir d’une fenêtre épisodique hybride pour suivre les dérives comportementales, tandis qu’un agent de réflexion hors ligne propose des hypothèses de frontière à partir des erreurs mûries. Un vérificateur déterministe n’admet dans l’état de connaissance exécutable que les hypothèses étayées.

Sur un banc de fraude de production, SR-Fraud améliore toutes les métriques de détection par rapport à son agent de décision gelé, obtient des estimations ponctuelles supérieures à CatBoost statique et à CatBoost réentraîné périodiquement, et détecte une rafale de fraude émergente. La leçon architecturale est nette : l’agent propose, le vérificateur dispose.

Côté industrie : la distribution avant la démonstration

L’actualité produit n’est pas en reste, mais elle joue une autre partition. Meta a consacré sa conférence Connect à Muse, son agent personnel lancé début septembre : avatar numérique temps réel (modèle Muse Realtime Avatar), intégration dans les lunettes connectées via mot d’activation, exécution de tâches sur Mac (« vous pouvez vous éloigner de votre ordinateur, il continue de travailler »), adresse e-mail dédiée à l’agent, et un catalogue de connecteurs qui inclut Shopify, Stripe, PayPal, Best Buy, Gap, Sephora, Walmart, Wayfair, Expedia, Instacart, GitHub, Granola et Notion. Meta indique avoir reçu plus de 1 500 candidatures de développeurs en moins d’une semaine pour sa plateforme de connecteurs.

OpenAI, de son côté, a apporté les fonctionnalités agentiques vocales sur mobile : les abonnés Plus et Pro peuvent déclencher depuis leur téléphone la rédaction de documents, la rédaction d’e-mails ou le résumé de messages Slack via l’onglet Work, construire des sites, créer des présentations, utiliser le navigateur cloud, et reprendre sur ordinateur une conversation commencée en déplacement. Les utilisateurs Free et Go accèdent aux plugins et aux applications connectées.

La différence de maturité est frappante : la recherche publie des protocoles d’audit, l’industrie publie des catalogues de connecteurs.


📊 Analyse : le déplacement de la charge de la preuve

Trois niveaux de lecture se superposent dans les travaux de la nuit.

1. L’échec n’est pas une mesure, c’est une observation à qualifier. Un banc d’essai publie un taux de réussite. Ce taux est la somme de plusieurs phénomènes : incapacité réelle, contexte manquant, solution de référence cassée, infrastructure défaillante, vérificateur contournable. Tant que ces composantes ne sont pas séparées, la somme est ininterprétable comme revendication de capacité. Le résultat des 125 tâches est un rappel que la statistique la plus citée de l’évaluation des agents est aussi la moins décomposée.

2. L’équivalence d’entraînement est un contrat, pas une propriété émergente. L’affaire du cache d’outils est emblématique : deux procédures peuvent avoir exactement la même distribution marginale de sorties et produire des mises à jour de gradient de signe opposé. Toute optimisation de coût dans une boucle d’entraînement d’agents — mise en cache, réordonnancement, parallélisation, découpage de lots — doit être auditée pour son effet sur les corrélations intra-groupe, pas seulement sur les sorties. La validité marginale est un critère nécessaire et insuffisant.

3. La mémoire utile est une mémoire vérifiée. ChipMEM et CELLAUDIT pointent dans la même direction depuis deux domaines éloignés (conception de circuits, découverte de modèles cellulaires). Dans les deux cas, ce qui distingue la connaissance transférable du surapprentissage local est une porte d’admission adossée à un contrôle indépendant du modèle : synthèse, simulation, forme formelle pour l’un ; falsification par remplacement d’entrée et audit du code source pour l’autre. L’auto-évaluation, aussi calibrée soit-elle, n’occupe pas cette place.

Le fil qui relie ces trois lectures est le même que celui qui traversait la veille de ces dernières semaines : l’instrument devient le lieu du progrès. Ce qui a changé aujourd’hui, c’est la granularité. On ne discute plus de la qualité d’un banc d’essai en général, mais de la validité de tâches individuelles au sein d’un corpus donné, de la validité marginale d’un cache stochastique, et de la validité de la revendication d’usage d’une entrée.

Pour les équipes qui déploient des agents en entreprise, cela se traduit par trois questions à poser à tout fournisseur ou à toute évaluation interne :

  • Sur quelles tâches mon agent échoue-t-il, et la faisabilité de ces tâches a-t-elle été certifiée ? Un taux d’échec non qualifié n’est pas un argument commercial ni un critère d’achat.
  • Quelles optimisations de la boucle d’entraînement ou d’inférence modifient les corrélations entre rollouts ? Les caches, la parallélisation et la mise en lots ne sont pas neutres.
  • Quelles compétences mon système retient-il, et sur quel contrôle indépendant cette rétention est-elle conditionnée ? Une mémoire non vérifiée est un générateur de dette technique.

🎯 À retenir

  • Sur 125 tâches de Terminal-Bench sans réussite honnête, 78 seulement sont certifiées non résolues ; 14 ont des oracles cassés, 8 sont dominées par des pannes d’infrastructure, 4 ne sont franchissables que par contournement du vérificateur et 21 n’ont aucune preuve de solvabilité. Le corpus représente 1 081 pull requests, 639 tâches notées, 28 801 essais et 105 933 dollars dépensés.
  • Un cache d’outils marginalement correct peut inverser la mise à jour de politique normalisée par groupe : 540 configurations et 3 240 évaluations d’estimateur confirment qu’une accord marginal sur les distributions de récompense ne garantit pas l’équivalence d’entraînement.
  • ChipMEM ne retient une compétence qu’après passage des contrôles de synthèse, simulation ou forme formelle : 39/54 contre 35/54 en équivalence, 8,69 % contre 5,66 % d’amélioration de surface, 20/20 contre 18/20 sur tâches tenues à l’écart.
  • CELLAUDIT montre qu’un prédicteur à PCC 0,3153 peut être invariant à la variable qu’il prétend utiliser, alors qu’un prédicteur aveugle à cette variable atteint 0,3142 : la performance prédictive n’est pas une preuve d’usage de l’entrée.
  • FWBench mesure l’arbitrage entre acheter de l’information et décider : GPT-6 Astra a utilisé 2,5 % du budget de prévision et battu des politiques fixes sur 1 251 cas.
  • Live Assistant fait du silence une action apprise (OBS/MEM/ANS) sur 320 heures de trajectoires et 13 812 intervalles de décision relus par des humains.
  • Côté industrie, Meta pousse Muse sur lunettes, Mac, montres-totems et e-mail dédié avec 1 500 candidatures de connecteurs en une semaine, tandis qu’OpenAI apporte l’agentique vocale sur mobile. La distribution avance plus vite que la certification.

A lire aussi