Agents IA dans l'économie réelle : quand Amazon, Apple et les comptables refusent de se laisser automatiser

💡 En résumé

L’agent IA a quitté le bac à sable. Il achète, il réserve, il tient la comptabilité, il pilote un navigateur, il parle à des API métier. Et cette semaine, il a découvert ce que tout le monde avait oublié de lui dire : le monde réel n’est pas un environnement d’entraînement. Dimanche soir, les utilisateurs de Muse — l’assistant de Meta — ont vu apparaître un message d’erreur sec en tentant d’acheter sur Amazon : « Continued access by an unauthorized AI agent violates Amazon’s Conditions of Use, to which our customers have agreed. » L’agent n’est pas persona non grata par accident. Il est persona non grata par contrat.

Le même jour, le chercheur qui a construit les Apple Store expliquait à TechCrunch, à propos du « commerce agentique », que personne ne laisserait une machine choisir et acheter seul un ordinateur à 2 000 dollars. Et pendant ce temps, côté recherche, les cinquante articles arXiv du jour disent exactement l’inverse : ils industrialisent. On apprend à un agent à gérer 79 000 capacités, à extraire des procédures exécutables de trajectoires bruitées, à refuser quand il n’y a pas de chemin sûr, à compresser son cache mémoire par étape de raisonnement plutôt que par jeton.

Trois définitions de ce qu’est un agent, qui ne peuvent pas toutes être vraies en même temps. C’est le sujet de cette veille.

🔥 Tendances : l’agent entre dans l’économie réelle par la porte de service

Muse : un succès d’adoption tellement rapide qu’il s’est fait bloquer

Le cabinet Apptopia a publié lundi des estimations qui, si elles sont à peu près justes, sont gênantes pour OpenAI. Sur les douze premiers jours suivant leur lancement respectif, Muse a été téléchargé 1,8 million de fois contre 1,3 million pour ChatGPT — en comparant uniquement l’iOS sur les marchés américain et canadien, pour neutraliser la différence de stratégie de déploiement (ChatGPT était mondial mais iOS seul, Muse est iOS + Android mais limité aux États-Unis et au Canada). Au total, Muse atteint 2,8 millions d’installations mondiales. En utilisateurs actifs quotidiens sur mobile américain, l’écart est plus brutal encore : 642 000 contre 231 000 au même âge de lancement. Même en réduisant la comparaison au seul iOS, Muse reste devant, à 359 000. L’application est passée de n°2 à n°1 du classement général de l’App Store américain.

Cette adoption doit moins au produit qu’à la distribution : plus de 95 % des utilisateurs de Muse sont aussi sur Facebook, 63 % sur Instagram, et l’application fonctionne à l’intérieur de WhatsApp. Meta réédite la mécanique de Threads, et la question n’est pas de savoir si le produit est meilleur, mais si la surface d’exposition bat le logiciel.

Sauf que dimanche soir, cette base installée s’est cassée sur un mur. L’agent de Muse ne peut plus acheter sur Amazon. Le message d’erreur invoque les Conditions of Use — un texte contractuel, pas une limitation technique. TechCrunch pose les deux lectures possibles et elles ne s’excluent pas. La première est un duel entre géants : Amazon a ses propres modèles de fondation et l’une des plateformes d’inférence les plus utilisées du web ; rien ne l’oblige à ouvrir sa boutique à l’agent d’un concurrent. La seconde est plus ennuyeuse et plus décisive : si Muse passe une mauvaise commande, c’est Amazon qui ramasse les dégâts, face au client mécontent et au vendeur mécontent. Muse affiche l’un des taux d’hallucination les plus bas du marché — il n’est pas nul pour autant.

Autrement dit, la porte n’est pas fermée à l’agent parce qu’il ne sait pas faire. Elle est fermée parce que le coût de son erreur est porté par un tiers qui n’a pas de contrôle sur lui. C’est une asymétrie de responsabilité, pas un problème de performance.

« Honnêtement, personne ne va faire ça »

Ron Johnson, 66 ans, a construit le réseau de magasins d’Apple à partir de 2000, à l’époque où l’e-commerce décollait — c’est-à-dire exactement pendant le précédent « la technologie va tuer le commerce physique ». Il a également dirigé J.C. Penney en 2011 et s’est fait débarquer en moins de deux ans après l’effondrement des ventes, un échec qu’il attribue aujourd’hui à avoir appliqué une mentalité de startup à un redressement.

TechCrunch lui demandait s’il imaginait quelqu’un laisser un agent choisir et acheter un ordinateur à 1 000 ou 2 000 dollars sans jamais visiter un site ni un magasin. Sa réponse : « Honnêtement, personne ne va faire ça. » Son argument n’est pas technophobe — il se déclare « optimiste sur l’IA ». Il porte sur la nature de l’achat : on veut porter la machine, voir l’écran, décider de la taille. Il concède que l’agent réduira les options — mais il le voit comme un meilleur consommateur qui arrive en magasin mieux informé, pas comme un substitut.

Face à lui, les paris les plus lourds du secteur : Google pousse son Universal Commerce Protocol, un standard destiné à conduire un agent de la découverte produit au paiement ; OpenAI transforme ChatGPT en destination d’achat où l’on peut chercher, comparer et parfois acheter sans sortir du chat.

Il faut prendre l’argument de Johnson pour ce qu’il est : une hypothèse sur la demande, invérifiable aujourd’hui. Mais il y a un point qu’il touche juste et qui rejoint l’affaire Amazon : la question n’est pas « l’agent peut-il acheter ? » mais « qui répond de l’achat ? ». Tant que la réponse est floue, les plateformes ont une bonne raison rationnelle de fermer la porte — et elles le feront sous couvert de conditions d’utilisation.

Le cas Tabby : automatiser la couche, pas le métier

Pendant que les géants se disputent la porte d’entrée, quelqu’un automatise l’arrière-boutique. Ahad Ali était comptable, dirigeait 20 personnes et traitait plus de 2 000 déclarations par an. Il a constaté que son travail était de plus en plus dicté par les frictions d’un logiciel comptable conçu sans les comptables, puis il en a tiré une conclusion que peu de gens osent formuler : « Les petites entreprises n’ont pas besoin d’un meilleur logiciel de comptabilité. Elles ont besoin de moins de logiciel comptable. »

Tabby importe les données bancaires en direct via Plaid et construit un tableau de bord temps réel de la santé financière. Quatorze mois plus tard : 5 500 petites entreprises, environ 100 000 dollars de revenus récurrents annuels, sept personnes. Une version pour cabinets comptables existe, mais l’objectif assumé est d’aller directement à l’utilisateur final, et de transformer la comptabilité en un abonnement mensuel du même ordre qu’une facture d’accès internet.

C’est le contre-modèle exact du commerce agentique. Tabby ne demande à aucune plateforme la permission d’agir sur son domaine : il remplace la couche logicielle au lieu de l’orchestrer de l’extérieur. La compétition existe — QuickBooks reste le plus gros acteur, Rillet est bien financé, les laboratoires d’IA ont leurs propres outils finance — mais l’espace est grand, comme le dit Ali : « Il y a 30 millions d’entreprises de plus ».

Le pari matériel de Google

Google a ouvert les précommandes du Googlebook à 899 dollars, un portable Android avec Chrome de bureau, livré le 4 octobre aux États-Unis (le 5 au Canada, au Royaume-Uni, en Irlande, en France, en Allemagne et en Australie), construit par Acer, ASUS, Dell, HP et Lenovo, avec écrans OLED jusqu’à 2,8K et NPU Intel/Qualcomm dédiées. Le pari est que Gemini justifie d’acheter une machine neuve — avec un curseur IA (« Magic Cursor ») qui sert de conduit vers le modèle, des widgets « vibecodés » et un mode de dictée appelé Rambler qui transforme un pensum désordonné en texte lisible.

TechCrunch est sceptique, et à raison : c’est très proche d’un « Circle to Search » transposé au bureau, et surtout nous avons désormais des agents capables de prendre le contrôle du navigateur et de l’ordinateur pour faire la tâche. Ajouter un curseur intelligent ne résout pas le problème que l’agent résout. L’angle réellement intéressant est ailleurs : 50 millions de Chromebooks dans les établissements scolaires, et un chemin de migration dessiné pour convertir cette base vers Gemini. La livraison inclut 12 mois de Google AI Pro et un support jusqu’à 10 ans.

🤖 Nouveaux outils : l’ingénierie qui fait tenir les agents

Pendant que le débat public tourne au bras de fer contractuel, la recherche du jour ne promet aucun modèle plus fort. Elle construit des infrastrutures de tenue.

Toollery — gérer 79 000 capacités sans noyer le modèle. Exposer des centaines ou des dizaines de milliers d’outils à un agent casse deux choses en même temps : chaque candidat supplémentaire coûte des jetons et de la latence, et une liste plus longue introduit plus de distracteurs pour la sélection. Toollery applique une compression de candidats sans entraînement : il génère des requêtes d’intention utilisateur à partir de chaque spécification d’outil ou de compétence, construit un index de récupération, et ne présente au LLM qu’un ensemble top-k compact. Évalué sur SkillRouter (~79 000 capacités), BFCL-V4 (plus de 440 outils atomiques) et 3 396 requêtes propriétaires d’un cockpit automobile (220 outils), il maintient la sélection en ligne bornée. Le détail honnête : les gains de qualité et de coût dépendent de la couverture de la charge de travail et du cache du fournisseur. Ce n’est pas une amélioration universelle, c’est un arbitrage conditionnel.

Trace — transformer des trajectoires ratées en procédures exécutables. Les agents auto-évolutifs au moment du test réutilisent l’expérience passée, mais les trajectoires à récompense éparse contiennent échecs, boucles et détours, et les résumés omettent les conditions d’état et les dépendances d’action nécessaires à l’exécution. L’observation clé est que le crédit différé identifie les actions associées au progrès mais ne peut pas dire si elles produisent les faits dont les actions suivantes ont besoin. Trace détecte des ancres de progrès, propage le crédit, estime les prérequis d’action à partir des succès et échecs inter-épisodes, puis fait du tranchage de dépendances en arrière pour remonter chaque fait jusqu’à son producteur. Le résultat n’est pas un résumé mais une procédure exécutable : conditions d’entrée, étapes état→action→effet ordonnées, prédicats de complétion et d’échec. Sur J-TTL, WebShop et ScienceWorld avec trois LLM ouverts, +30,0 % en AUC moyenne et +40,5 % en Final-3 par rapport au meilleur des huit baselines — en consommant moins de jetons d’inférence.

SCOPE — capacité et sûreté, pas capacité puis sûreté. Un agent qui pilote une interface ne doit pas seulement réussir ses tâches : il doit conditionner son exécution au risque — accomplir le bénin, éviter les dangers d’environnement et continuer s’il reste un chemin sûr, refuser quand l’objectif est nuisible ou qu’aucun chemin sûr n’existe. SCOPE post-entraîne conjointement les deux, en s’appuyant sur SCOPE-Gen qui synthétise des tâches vérifiables puis les convertit en variantes à risque d’environnement en préservant l’objectif d’origine. Partant de Qwen3.5-9B, SCOPE-RL atteint 54,17 % de réussite sur OSWorld et 64,30 % de taux d’évitement d’attaque sur OS-BLIND, pour un score agrégé capacité-sûreté de 58,80 %, le meilleur des agents évalués. L’ablation est instructive par son asymétrie : les trajectoires de refus portent l’essentiel du gain d’évitement d’attaque, tandis que les trajectoires de gestion du risque préservent une meilleure utilité de tâche à niveau d’évitement comparable. Autrement dit, apprendre à dire non et apprendre à contourner sont deux compétences différentes.

Agnostique du dosage : SFT ou RL selon la zone. Sur des agents analytiques d’entreprise à longue horizon (récupération, raisonnement, appels d’API, exécution de code), les auteurs montrent que l’application uniforme du RL peut dégrader des compétences déjà calibrées par SFT. Ils séparent rétrospectivement trois régimes — Imitation (le SFT a capturé le comportement fiable de l’enseignant), Lift (les deux étapes aident), Discovery (le comportement utile est hors du support de l’enseignant) — puis s’en servent prospectivement pour router chaque compétence vers SFT seul, SFT puis RL, RL renforcé, ou développement d’environnement. Sur 18 expériences ultérieures, le diagnostic prédit 15 trajectoires sur 18. Sur GPT-OSS 120B, le ciblage produit des estimations positives sur 7 compétences d’annonceur sur 8 face à un contrôle de frontière, dont cinq avec intervalles de confiance à 95 % excluant zéro ; le plus grand gain est la non-divulgation, à +11,27 points. Bonus d’audit : le RL ciblé réduit la fuite standard de 11,8 % à 2,9 % et la fuite adversariale de 22,9 % à 6,8 %, tout en consommant 43 % de calcul RL incrémental en moins.

StepKV — quand la mémoire de l’agent ne se découpe pas en jetons. Les méthodes de pruning de cache KV traitent le cache comme un flux plat de jetons et classent par récence ou saillance d’attention. Cela crée un décalage entre l’unité de compression et l’unité de raisonnement : une observation précoce ou une décision intermédiaire peut avoir peu d’attention récente et rester indispensable à la synthèse de preuves ultérieure — un mode de défaillance que les auteurs nomment Reasoning Continuity Disruption. StepKV traite les étapes de raisonnement comme des unités de rétention de première classe, associe chaque entrée de cache à l’étape qui l’a produite, estime son utilité à partir de signaux de trajectoire, combine cette utilité à la saillance par jeton, puis classe globalement. Sur du QA multi-sauts et du raisonnement web longue horizon, il tient la précision à faible budget KV là où les baselines par jeton s’effondrent.

EvoRank — l’ingénieur de ranking autonome et sa porte de sortie. Une boucle évolutionnaire guidée par LLM découvre des pipelines complets de Learning-to-Rank (features, modèles, pertes, ensembles) pour la recherche e-commerce multi-objectif. Sur Expedia ICDM 2013, avec pertinence, conversion et revenu comme objectifs concurrents, trois exécutions indépendantes convergent en moins de 50 itérations — environ dix dollars — vers des pipelines interprétables qui battent un LambdaMART optimisé par Optuna sur 60 000 requêtes tenues à l’écart, et se placent dans le top 6 % de la compétition d’origine. La partie la plus utile est l’échec : une première campagne n’évoluant que les objectifs d’entraînement semblait fonctionner sur son pli de sélection, tandis qu’un audit de transfert a montré que les gains étaient presque entièrement du bruit de fitness. D’où la règle : la quantité décisive est mesurable à l’avance — la marge d’espace de recherche relative au bruit de fitness — packagée en headroom gate qui prédit, avant toute dépense de LLM, si la boucle va payer.

📊 Analyse : trois frontières, pas une courbe d’adoption

Si on met ces éléments côte à côte, on ne lit pas une progression continue de la capacité des agents. On lit trois frontières distinctes, et chacune se referme selon un critère différent.

Première frontière : le contrat. Le blocage d’Amazon n’est pas un problème de compétence de Muse. C’est un problème d’attribution de responsabilité. Les Conditions of Use sont l’outil qui permet de refuser sans négocier, et elles sont d’autant plus faciles à invoquer qu’une commande ratée par un agent produit un coût asymétrique : le client et le vendeur sont mécontents, la plateforme nettoie, l’éditeur de l’agent est ailleurs. Dans ce cadre, même un agent quasi sans hallucination reste un risque non provisionné. La conséquence pratique est que l’agentic commerce ne s’ouvrira pas par la supériorité technique mais par un arrangement de responsabilité — plafond de montant, assurance, journal d’audit opposable, réversibilité. Tant que cet arrangement n’existe pas, la porte restera fermée indépendamment de la qualité du modèle. Le scepticisme de Ron Johnson et le blocage d’Amazon disent la même chose sous deux angles : la question n’est pas ce que l’agent peut faire, c’est qui signe.

Deuxième frontière : la charge de travail. Toollery et le benchmark Eurostat se répondent à distance. Toollery montre qu’au-delà de quelques centaines d’outils, la sélection devient un problème de récupération et non de raisonnement — et que les gains dépendent de la couverture de la charge et du cache du fournisseur. L’étude Eurostat va plus loin et plus gênant : sur 30 tâches, 7 domaines, 7 jeux de données et 4 niveaux de difficulté, 360 exécutions sous quatre conditions, la conclusion est que les agents de codage statistique ont besoin d’une validation sémantique contre des spécifications gelées et d’un contrat de sortie entièrement spécifié — pas de diagnostics d’exécution. Le chiffre qui tue : dans une expérience complémentaire où le contrat de sortie était sous-spécifié (la clé de classement requise et la représentation de l’unité n’étant jamais énoncées), la condition « meilleure » du benchmark était sous-estimée de 23,4 points. Autrement dit, une part massive de l’erreur d’agent mesurée dans la littérature est une erreur de conception d’évaluateur. Réussir à exécuter n’est pas produire un résultat valide.

Troisième frontière : la sûreté conditionnelle. SCOPE et les agents publicitaires convergent sur un point que le marketing de l’IA agentique préfère ignorer : la sûreté n’est pas une propriété du modèle, c’est une politique conditionnée à l’exécution. Refuser, contourner un danger, continuer quand un chemin sûr subsiste — SCOPE montre que ces comportements s’entraînent, et que le refus et la gestion du risque sont deux contributions asymétriques. L’audit des agents publicitaires ajoute la dimension économique : le ciblage RL réduit les fuites d’information de 11,8 % à 2,9 % et de 22,9 % à 6,8 % tout en consommant 43 % de calcul RL en moins. La sûreté, correctement ciblée, n’est pas un coût — mais elle est mesurée par des métriques qui n’existent pas dans les classements publics, qui continuent de classer sur la seule réussite de tâche.

Le fil commun aux trois frontières est que la contrainte décisive est presque toujours externe à l’agent : un texte contractuel, une couverture de distribution, un contrat d’évaluation, une métrique de fuite. On passe d’un problème de modèle à un problème d’intendance.

🎯 À retenir

  • Amazon a bloqué l’agent de Muse en invoquant ses Conditions of Use, dimanche soir. Ce n’est pas une limite technique mais un refus contractuel, motivé par une asymétrie de responsabilité : en cas de mauvaise commande, c’est la plateforme qui absorbe le coût. L’agentic commerce s’ouvrira par un arrangement de responsabilité, pas par une meilleure précision.
  • Muse dépasse le lancement mobile de ChatGPT sur les douze premiers jours (1,8 M vs 1,3 M en iOS US/Canada ; 642 000 vs 231 000 d’utilisateurs actifs quotidiens américains) et atteint la première place de l’App Store américain. Le moteur est la distribution croisée Meta, pas le logiciel.
  • Ron Johnson, architecte des Apple Store, ne croit pas au délégué d’achat : l’agent informera mieux le consommateur, il ne le remplacera pas pour un achat personnel significatif. Pendant ce temps Google pousse son Universal Commerce Protocol et OpenAI transforme ChatGPT en destination d’achat.
  • Tabby montre le modèle inverse : ne pas orchestrer la couche logicielle existante, la faire disparaître. 5 500 petites entreprises, ~100 000 dollars d’ARR, sept personnes, quatorze mois.
  • La recherche ne promet aucun modèle plus fort mais des infrastructures de tenue : Toollery (79 000 capacités, compression de candidats sans entraînement), Trace (walkthroughs exécutables, +30 % AUC, −jetons), SCOPE (54,17 % OSWorld + 64,30 % d’évitement d’attaque), StepKV (rétention par étape contre la Reasoning Continuity Disruption), EvoRank (top 6 % de la compétition, 10 dollars, et un headroom gate pour savoir avant de dépenser).
  • La leçon transversale : la compétence de l’agent n’est plus le facteur limitant. Les trois contraintes réelles sont le contrat, la couverture de charge de travail et l’instrumentation de la sûreté. Tant que les classements publics n’évaluent que la réussite de tâche, ils mesureront la seule des trois qui est déjà largement résolue.

A lire aussi