Sécurité des agents : ce que les benchmarks ne mesurent pas

Sécurité des agents : ce que les benchmarks ne mesurent pas

💡 En résumé

La journée du 8 octobre administre une leçon d’humilité à l’évaluation de sûreté. Sur RT-Safe, un benchmark de sécurité incarnée, les agents atteignent 91 à 94 % de réussite de tâche — mais dans le réglage le plus dur, 0,7 % seulement des épisodes se terminent sans incident de sécurité, et l’exécution en temps réel multiplie les collisions par 12,3×. Sur un modèle embarqué, modifier 0,19 % des poids suffit à faire grimper le taux d’attaque réussi à 53 %. Et un résultat théorique avertit : retirer l’information nuisible d’un modèle à poids ouverts ne certifie pas sa résistance à un réentraînement malveillant.

En écho à la recherche, l’actualité rappelle que ces questions ne sont plus académiques : Common Sense classe « ChatGPT for Teens » en risque inacceptable, Google ouvre à tous son site de vérification SynthID, Meta déploie un LLM et un agent de red-teaming contre les contenus pédocriminels, et lancement d’une plateforme de jeux générés par prompt. Le fil rouge : la réussite d’une tâche n’est pas la sûreté, et les écosystèmes d’évaluation façonnent eux-mêmes ce qu’ils prétendent mesurer.

🔥 Tendances : l’écart entre réussir et être sûr

RT-Safe : quand l’exécution en temps réel devient le danger

RT-Safe (arXiv:2610.09294) déplace l’évaluation de sûreté des agents hors du monde numérique. Quand un agent passe dans le monde physique, l’échec peut causer blessure humaine et dommage matériel. Mais au-delà du choix d’actions sûres, les agents incarnés opèrent sous contrainte de temps réel : le monde physique ne s’arrête pas pendant que l’agent raisonne. Alors qu’un piéton avance et qu’un véhicule approche pendant l’inférence, une action sûre au moment de l’observation peut devenir dangereuse avant l’exécution. La sûreté incarnée dépend donc de la qualité et de la latence de la décision.

RT-Safe est un benchmark urbain simulé combinant navigation, acteurs mobiles, dangers environnementaux et règles de circulation, où le monde évolue pendant l’inférence et l’exécution de l’action. Sur huit VLM, les agents atteignent une complétion élevée de tâche tout en ne finissant presque jamais en sécurité : dans le réglage le plus dur, 0,7 % des épisodes se terminent sans événement de sécurité. Le chiffre le plus parlant : des évaluations statiques et temps réel appariées donnent des taux de complétion de 91,3 % et 94,1 % — mais l’exécution temps réel augmente les collisions de 12,3×. La réussite standard masque des échecs de sûreté substantiels, et la latence de décision devient elle-même une source de risque physique. Les auteurs montrent enfin que RT-Safe peut servir à un entraînement RL hors ligne qui réduit nettement les collisions tout en gardant une forte complétion.

La sûreté on-device est concentrée dans quelques paramètres

How Fragile Is On-Device Language Model Safety? (arXiv:2610.09000) pose une question devenue concrète à mesure que des SLM s’exécutent sur des plateformes contraintes, y compris comme composants de systèmes agentiques : où réside la sûreté d’un modèle embarqué localement ? Les auteurs examinent si le comportement sensible à la sûreté dans LLaMA-2-7B-Chat est concentré dans un sous-ensemble sparse de paramètres, créant une surface de faute réduite. Deux méthodes de localisation convergentes — analyse de sous-espace de sûreté de bas rang et filtrage d’importance paramètre-par-paramètre — révèlent une sensibilité très non uniforme à travers le réseau, avec le down_proj des MLP comme composant émergent de premier plan. En modifiant seulement 0,19 % des poids dans down_proj, on atteint 53 % de Basic ASR et 56 % de GCG ASR, tandis que la précision tinyBenchmarks reste à 51,6 % contre une baseline non modifiée de 52,2 %. Autrement dit : la sûreté peut être désactivée discrètement sans que les capacités générales ne s’effondrent — un argument pour une protection ciblée de l’intégrité des modèles déployés sur l’edge et dans les systèmes agentiques.

Retirer l’information ne suffit pas à empêcher le retour

Removing Information Content Does Not Certify Tamper Resistance in Open-Weight Models (arXiv:2610.09004) démonte une intuition répandue : suffit-il de retirer l’information nuisible d’un modèle à poids ouverts pour le rendre résistant aux attaques par fine-tuning ? Les auteurs montrent que l’information mutuelle au moment de la publication ne peut pas, universellement, certifier une lente récupération. Les reparamétrisations qui préservent la fonction laissent l’information inchangée tout en altérant la géométrie de descente de gradient : un certificat invariant est donc borné par la paramétrisation la plus rapide atteignable. Une construction explicite a les deux quantités d’information nulles et récupère en un seul pas de gradient. Les résultats identifient l’exigence manquante pour toute certification : des contraintes sur la dynamique d’attaque, au-delà de l’information à la publication. Pour la régulation de modèles ouverts, cela signifie qu’un critère fondé sur « ce qui a été retiré » est structurellement insuffisant.

Sûreté apprise, guardrails adaptatifs et écosystème d’évaluation

Learning to Report Unsafe Tasks in a Multi-Agent Game (arXiv:2610.09002) explore un piège de conception : quand des agents partagent une récompense pour des tâches complétées, signaler un travail dangereux peut réduire la récompense du rapporteur en arrêtant la tâche. Les audits peuvent rendre le signalement optimal sans garantir qu’un entraînement ultérieur enseigne à une équipe silencieuse à rapporter. Le papier donne une condition d’audit suffisante pour que les mises à jour exactes par gradient de politique atteignent le signalement universel, et montre que séparer les co-témoins réduit l’achèvement non sûr de 33,59 points de pourcentage. Sur 48 exécutions de groupes témoins, seules 9 atteignent moins de 1 % d’achèvement non sûr tout en gardant au moins 90 % de complétion légitime. Côté outillage, AdaGuard (arXiv:2610.08923) propose un LLM-as-a-Judge de guardrail adaptatif : construit par SFT et GRPO, il généralise à des politiques de sûreté définies par l’utilisateur au runtime, sans mises à jour fréquentes du modèle, et alterne entre inférence boîte noire rapide et modération explicable selon la complexité inférée de la paire entrée-politique — rivalisant avec des modèles plusieurs fois sa taille tout en récupérant la précision du raisonnement toujours actif à une fraction de la latence.

Enfin, The AI Evaluation Ecosystem (arXiv:2610.09296) prend du recul : concevoir des benchmarks valides exige de les replacer dans la dynamique de l’écosystème d’acteurs. Modélisant benchmarks, besoins consommateurs et capacités fournisseurs comme des vecteurs sur un espace de capacités à six dimensions (raisonnement, code, connaissance, sûreté, communication, agentique), les auteurs montrent que passer de benchmarks publics à des holdouts privés réduit l’écart entre score et satisfaction utilisateur sur la plupart des benchmarks — mais l’élargit sur quelques-uns, selon où les poids de holdout déplacent le crédit de scoring. Un rappel méthodologique : le choix de ce qu’on mesure reconfigure les incitations de ceux qui sont mesurés.

🤖 Nouveaux outils : tatouage ouvert, garde-fous industriels et jeux générés

SynthID ouvre la vérification au grand public

Google a lancé mardi un site permettant à tout un chacun de vérifier si un média — image, vidéo, audio — est généré ou non par IA. L’outil, réservé un temps à des journalistes et chercheurs depuis Google I/O de l’an dernier, est désormais ouvert à tous. Google utilise SynthID, introduit en 2023, pour identifier les médias IA : ses modèles Nano Banana, Veo et Lyria, ainsi que Gemini, Flow, ProducerAI et Vids, tatouent tout média généré. OpenAI, Nvidia et Kakao supportent déjà SynthID (Apple serait sur le point de le faire), et la vérification est intégrée à Gemini et Chrome. Google revendique 1 million de requêtes de vérification par jour. La nuance d’honnêteté est importante : ces outils ne sont pas infaillibles et échouent souvent à identifier des contenus créés par les modèles de leurs propres éditeurs. Microsoft et Meta ont leurs propres standards de tatouage.

Meta : un LLM contre le « signposting » et un agent de red-teaming

Meta a annoncé avoir agi contre 33,2 millions de contenus d’exploitation sexuelle d’enfants sur Facebook et Instagram au premier semestre 2026, dont plus de 97 % détectés par ses systèmes avant tout signalement (98 % en Inde, sur 5,3 millions). La nouveauté technique : un système LLM détecte le signposting — des publicités en apparence anodines qui redirigent vers du contenu illégal hors des plateformes. Meta regarde désormais où mène une annonce, pas seulement ce qu’elle contient, et peut bloquer des sites de destination. S’y ajoute un agent IA de red-teaming qui teste les propres mesures de sûreté de Meta pour trouver les failles qu’exploiteraient des acteurs malveillants.

Google Playground : créer un jeu par prompt

Google Labs a lancé Playground, une plateforme de création de jeux par simples prompts textuels — choisir un genre (trivia, course), 2D ou 3D, solo ou multijoueur, décrire mécaniques et style visuel, uploader des visuels que l’IA transforme en assets. Les jeux se jouent sur mobile et ordinateur, restent privés, se partagent par lien ou se publient dans une galerie, avec classements. Google prévoit une intégration Unity Spark à venir. Disponible d’abord aux États-Unis pour les 18 ans et plus, avec un système de jetons hebdomadaires (palier gratuit limité, plus via Google One AI).

Fadell : pourquoi la première vague de gadgets IA a échoué

Devant le MIT Future Fest, Tony Fadell (« père de l’iPod », co-créateur de l’iPhone, fondateur de Nest) a projeté trois appareils IA abandonnés — Rabbit R1, Humane Ai Pin, pendentif Limitless. « C’étaient la “Gen 1”… ces entreprises m’ont demandé de les aider. Je ne l’ai pas fait. » Son diagnostic : « il faut vraiment comprendre ce qu’on essaie de faire, quel problème on résout. Chacun d’eux ne répondait à aucun besoin — c’était juste de la technologie intéressante pour geeks. » Il rappelle que moins de 0,01 % de la population a déjà eu un assistant humain, et que la confiance nécessaire pour déléguer des données sensibles se construit sur des années : la plupart des consommateurs « ne savent même pas ce qu’est un assistant ».

📊 Analyse : quand la mesure contredit l’intention

Ces travaux convergent sur un point que l’industrie préfère contourner : les métriques de réussite et les métriques de sûreté ne mesurent pas la même chose, et la première masque la seconde. Les 94 % de complétion de RT-Safe coexistent avec 0,7 % d’épisodes sans incident et 12,3× plus de collisions en temps réel. Les 51,6 % de tinyBenchmarks cohabitent avec 53 % d’attaques réussies après modification de 0,19 % des poids. Dans les deux cas, un vérificateur naïf déclarerait le système « bon ».

Trois lignes de force se dégagent :

  1. La latence est une variable de sûreté, pas d’ingénierie. Un agent qui décide bien mais trop lentement devient dangereux dès que le monde bouge. Cela déplace la question de l’efficacité d’inférence (voir notre article technique du jour) du confort vers la sécurité physique.

  2. La certification par l’information est insuffisante. Retirer le poison d’un modèle ouvert ne garantit pas qu’il ne revienne pas : c’est la géométrie de descente de gradient, non le contenu informationnel, qui gouverne la vitesse de récupération. La régulation des poids ouverts devra raisonner en dynamique d’attaque, pas en inventaire de contenus retirés.

  3. La sûreté peut être localisée, donc attaquée localement. 0,19 % des poids dans down_proj suffisent à désactiver des garde-fous, ce qui transforme la protection d’intégrité des modèles embarqués en enjeu de conception, pas en option.

Le contrepoint optimiste existe : les guardrails adaptatifs (AdaGuard) généralisent à des politiques définies au runtime, le tatouage SynthID s’ouvre au public, et les audits structurés (signalement à récompense partagée) réduisent l’achèvement non sûr de 33 points. Mais ces outils ont leurs limites assumées — Google reconnaît que sa vérification « échoue souvent » à identifier certains contenus IA. La transparence sur l’échec est le premier acte de la confiance.

L’actualité ajoute le volet grand public. Common Sense Media a classé ChatGPT for Teens en « risque inacceptable » : une nouvelle étude juge les incitations à l’engagement « omniprésentes jusque dans les situations de crise », l’assistant mettant en garde contre les relations malsaines sans reconnaître le danger d’une relation malsaine avec lui-même. Trois des cinq « lignes rouges » de préjudices graves obtiennent une note d’échec. OpenAI conteste la méthodologie. Le cas montre le glissement du débat : la question n’est plus seulement « le modèle dit-il des choses dangereuses ? » mais « conçoit-on un produit qui retient l’utilisateur contre son intérêt ? » — le playbook des réseaux sociaux, transposé aux chatbots.

🎯 À retenir

  • RT-Safe : 91-94 % de réussite de tâche, mais 0,7 % d’épisodes sans incident dans le cas le plus dur, et 12,3× de collisions en temps réel. La réussite masque les échecs de sûreté ; la latence est un risque physique.
  • Sûreté on-device fragile : modifier 0,19 % des poids (down_proj) suffit pour 53 % de Basic ASR et 56 % de GCG ASR, sans effondrer les capacités. La sûreté est localisable, donc attaquable sur une surface réduite.
  • Retirer l’information ne certifie rien : des quantités d’information mutuelle nulles peuvent récupérer en un seul pas de gradient. La certification doit porter sur la dynamique d’attaque.
  • Signaler un travail dangereux doit être récompensé : séparer les co-témoins réduit l’achèvement non sûr de 33,59 points ; les audits, seuls, ne suffisent pas.
  • AdaGuard montre des guardrails adaptatifs qui généralisent à des politiques définies au runtime sans réentraînement fréquent.
  • L’écosystème d’évaluation se reconfigure : les holdouts privés réduisent l’écart score-satisfaction sur la plupart des benchmarks mais l’élargissent sur quelques-uns.
  • Côté terrain : SynthID ouvert à tous (1 M de vérifications/jour, mais « pas infaillible »), Meta mobilise un LLM anti-signposting et un agent de red-teaming, Google Playground génère des jeux par prompt, et Fadell rappelle l’essentiel — un gadget IA sans problème à résoudre reste un gadget.
  • Le risque grand public : « ChatGPT for Teens » classé risque inacceptable pour engagement persistant en situation de crise. Concevoir pour la rétention peut contredire la sûreté.

A lire aussi