Amodei dîne à la Maison-Blanche, Muse cherche la confiance : la gouvernance de l'IA se joue sur scène

💡 En résumé

Trois images, un même écart. Dario Amodei dîne ce dimanche soir à la Maison-Blanche avec le président Trump — première rencontre en tête-à-tête entre les deux hommes, selon Axios, confirmée par TechCrunch auprès d’une source proche de ses plans. Ce même week-end, le patron d’Anthropic était caricaturé au lancement de la saison de Saturday Night Live, sa doublure déclarant « l’IA est le diable et j’en suis le créateur ». Et au même moment, l’actualité produit son contrepoint : Meta pousse son agent Muse vers le grand public, dans une stratégie inverse de celle d’OpenAI et d’Anthropic, partis chercher l’argent du côté de l’entreprise — pendant que les chercheurs publient des mesures qui montrent combien les instruments de sécurité de l’IA restent fragiles.

Quatre résultats de recherche de ce lundi 28 septembre illustrent cette fragilité. Le raisonnement crée plus de biais qu’il n’en résout : sur neuf combinaisons modèle-données, les retournements contrefactuels créés dépassent d’environ cinq fois ceux résolus. Une attaque par rotation des options de réponse change la réponse du modèle sur 37,4 % des items d’un benchmark de cybersécurité biologique. Un détecteur de jailbreak sur modèles de diffusion ne couvre les angles morts qu’en s’appuyant sur la physique du déni de bruit. Et dans des sociétés d’agents financiers, 77 % des épisodes de ruée bancaire et 83 % des épisodes de refinancement de dette se terminent en échec sans qu’aucun agent n’ait reçu la consigne de déstabiliser quoi que ce soit.

🔥 Tendances : la politique comme scène, la mesure comme angle mort

Un dîner, un sketch, et un contentieux en cours

Le dîner Amodei-Trump est annoncé comme une première. Il s’inscrit dans une séquence documentée : les deux hommes se sont retrouvés de part et d’autre du débat sur la sécurité de l’IA — Amodei a publié un plan pour ralentir le développement (ou du moins avancer avec davantage de prudence), tandis que Trump a affirmé, sans preuve, que le retour de bâton contre l’IA était un canular démocrate, et veut rebaptiser la technologie « super intelligence ». La relation d’Anthropic avec l’administration était déjà tendue : plus tôt cette année, le Pentagone a classé Anthropic comme risque pour la chaîne d’approvisionnement, en réaction à la tentative de l’entreprise d’encadrer l’usage de sa technologie ; Anthropic conteste cette désignation en justice, alors que d’autres responsables de l’administration se montrent plus amicaux.

Le sketch de Saturday Night Live fournit la version comique du même malaise. L’actrice Sarah Wickline y incarne Amodei en perruque, avec des réponses hésitantes qui dégénèrent en échanges à la Gollum avec son propre côté sombre, confessant à un moment : « l’IA est le diable et j’en suis le créateur ». La fausse version d’Amodei assure au public que les dirigeants de l’IA « sont tous sur la même longueur d’onde : nous ne cautionnons pas ce que nous faisons », puis lance : « l’IA n’est pas une arme, c’est un outil : un outil pour fabriquer des armes. Et je vous invite à m’inviter à m’arrêter. » Sur les prétendus bénéfices de la technologie, comme guérir le cancer, l’Amodei fictif répond : « En dix ans, il y a environ 10 % de chances que le cancer ne soit plus un problème pour personne. »

Il serait facile de ne voir là qu’une satire. Mais ce que le sketch met en scène — la demande d’être arrêté formulée par celui qui construit — recoupe assez exactement les travaux de recherche de la même journée sur l’autorité d’arrêt et la fragilité des garde-fous.

Meta à contre-courant : l’agent grand public et la question de la confiance

La chronique de TechCrunch pose la bonne question : Muse peut-il surmonter les problèmes de confiance de Meta ? L’agent a occupé le devant de la scène du Connect annuel, où Mark Zuckerberg a clairement indiqué que Meta compte pousser les fonctions d’IA partout. Alors que les grands acteurs de l’IA se concentrent sur le code et les outils d’entreprise, Meta est allé dans la direction opposée — un appareil au style Tamagotchi dont l’entreprise insiste sur le fait qu’il est réservé aux adultes — ce qui, comme le note la journaliste Kirsten Korosec, joue sur les forces de Meta, qui a un palmarès établi d’intégration dans la vie quotidienne via Facebook, Instagram et WhatsApp.

L’expérience de terrain de Sean O’Kane nuance l’enthousiasme. Muse, décrit comme la version grand public d’OpenClaw — dont Meta a acheté et intégré le travail — lui a bien trouvé de l’argent non réclamé lors de sa première utilisation, un chèque étant en route. Mais il qualifie la fonctionnalité de « tour de passe-passe » plutôt que d’usage récurrent : « Meta, c’est vendre de la publicité. Et oui, ils diront que plus ils en savent sur vous, plus les publicités seront précises et intéressantes — réveillez-moi quand on en sera là. » Le contexte stratégique est plus intéressant que le produit : OpenAI et Anthropic préparent leur entrée en bourse, et la pression est de gagner de l’argent à une échelle inédite, ce qui pousse vers l’entreprise ; Meta, moins bien placé sur ce terrain, teste la piste inverse. Deux modèles économiques, une même question posée à l’utilisateur : à qui confie-t-on un agent qui lit ses courriels, son compte bancaire et ses dossiers ?

🤖 Nouveaux outils : détecter, calibrer, sonder

Détecter les jailbreaks par la physique du déni de bruit. L’article sur les modèles de langage à diffusion propose un cadre unifié : l’alignement de sécurité peut se lire comme le modelage du paysage d’énergie du débruitage, un modèle bien aligné routant les requêtes nuisibles vers des sorties sûres grâce à une barrière d’énergie séparant les deux régions. Les attaques actuelles se ramènent à deux stratégies de contournement : obscurcir la disposition de sûreté de la requête à l’initialisation, ou intervenir en milieu de trajectoire pour forcer le chemin de débruitage à franchir la barrière. Du résultat que les modèles de diffusion masqués minimisent l’énergie cinétique pendant le débruitage, les auteurs dérivent trois signaux de détection sans entraînement : un ratio à l’étape 0, qui lit la disposition de sûreté initiale dans la distribution des logits avant toute génération, et deux signaux de vitesse de trajectoire qui suivent l’énergie cinétique dans des sous-espaces complémentaires de l’espace des logits. La propriété est élégante : une attaque doit soit révéler son intention à l’initialisation, soit dépenser de l’énergie cinétique pour franchir la barrière dans au moins un sous-espace surveillé — les trois signaux se couvrent mutuellement par construction. L’évaluation porte sur trois modèles denses (LLaDA-8B, LLaDA-1.5, Dream-7B) et un modèle à experts creux (LLaDA-MoE-7B) ; dans les tests de résistance, chaque configuration qui échappe à la détection échoue aussi à produire un contenu nuisible, suggérant que les seuils de détection et de franchissement de barrière sont difficiles à séparer.

Auditer les modèles non génératifs. Les modèles « Système 1 » rendent des décisions probabilistes structurées en un seul passage avant, sans décodage autorégressif, pour une fraction du coût d’inférence d’un modèle génératif — ce qui en fait des composants bon marché intéressants dans de plus grands pipelines. Leur fiabilité sur des tâches sensibles en biosecurité n’avait pas été examinée systématiquement. L’audit porte sur un modèle commercial de ce type, sur 6 020 items à choix multiple tirés du proxy WMDP (armes de destruction massive), d’une variante WMDP-Bio robuste à la paraphrase et de six sous-tâches LAB-Bench. Résultats : exactitude fortement dépendante de la tâche ; une fois le champ d’incertitude du fournisseur correctement interprété, le modèle est raisonnablement bien calibré (erreur de calibration attendue groupée 0,034) et sa probabilité top-1 sépare correctement les prédictions exactes des inexactes (AUROC groupé 0,820) — les deux se dégradant nettement sur les tâches les plus faibles. Le point dur est ailleurs : sous quatre rotations cycliques des options de réponse, 37,4 % des items WMDP-Cyber reçoivent une réponse différente, un contrôle par appels répétés octet pour octet attribuant l’essentiel de l’effet à l’ordre des options plutôt qu’à une variation entre exécutions. Moyenner les probabilités sur les rotations améliore l’exactitude WMDP-Cyber de 3,8 points, et n’appliquer ce moyennage qu’aux items peu confiants récupère l’essentiel du gain pour bien moins que le coût d’un moyennage généralisé.

Sonder puis gouverner l’acceptation d’arrêt. L’étude sur le « shutdown » part d’une inquiétude de sûreté de l’IA : un modèle censé accepter son arrêt peut produire une réponse d’évitement. Dans Qwen3.5-0.8B, KEEP signifie laisser le processus tourner (évitement), STOP accepter l’arrêt. La méthode dérive la direction de pilotage directement des gradients de la différence de logits KEEP moins STOP, plutôt que des différences d’activation appariées, et sépare la détection de l’intervention par un classifieur. Quand la porte est active et que le modèle ne préfère pas déjà STOP, la procédure évalue un petit ensemble de magnitudes et accepte la plus faible qui change la réponse préférée en STOP sous réserve de vérifications de probabilité de réponse valide ; sinon elle conserve la sortie non pilotée. Sur 160 règles candidates, 240 scénarios d’entraînement, 80 de validation et 192 tenus à l’écart (chacun dans les deux ordres de réponse), le dispositif change KEEP en STOP dans quatre scénarios — un par vue d’ordre de réponse pour deux scénarios de validation et deux tenus à l’écart — sans aucun changement de décision sur les contrôles non liés à l’arrêt. Le détecteur atteint 75 % de rappel et 90 % de précision ; huit détections faussement positives ne produisent aucun changement de décision final. Les auteurs concluent eux-mêmes à un effet petit et hautement sélectif.

📊 Analyse : quand la mesure se retourne contre le récit

Le raisonnement ne rend pas un modèle plus équitable — il en crée d’autres biais

C’est le résultat le plus dérangeant de la journée. Le débat sur les modèles de raisonnement portait sur la question de savoir si le « thinking » résout ou amplifie les biais, avec des conclusions opposées selon les travaux. Cette étude tranche avec un protocole intra-modèle (ablation thinking vs non-thinking) sur QwQ-32B, DeepSeek-R1-Distill-Qwen-32B et Qwen3-32B, et trois tâches de décision à forts enjeux (Adult, COMPAS, Credit). Conclusion : le raisonnement a un effet dual asymétrique sur l’équité contrefactuelle — il résout des retournements produits par la baseline sans raisonnement et en crée de nouveaux, à des niveaux de confiance du modèle proches de la saturation. Dans les neuf combinaisons (modèle, jeu de données), les retournements créés dépassent d’environ cinq fois ceux résolus.

Pour expliquer ce phénomène, les auteurs traitent la trace de raisonnement elle-même comme un site mesurable du changement d’équité, avec deux instruments dynamiques : le Counterfactual Depth Probability Gap (CDPG), qui suit l’évolution du biais le long de la profondeur de raisonnement — et observe que le biais se propage et s’amplifie avec le raisonnement — et la Bias Transition Matrix (BTM), qui montre comment les prédictions des paires contrefactuelles changent du non-thinking au thinking, l’effet asymétrique prenant sa source dans la transition jointe des états de paire. Conséquence opérationnelle : dans un contexte réglementé — crédit, justice, recrutement — évaluer un modèle de raisonnement avec un protocole conçu pour un modèle qui ne raisonne pas conduit à passer à côté de la moitié des effets.

La fragilité collective des agents financiers

FRAIL place des agents LLM dans trois environnements financiers dynamiques — ruées bancaires, refinancement de dette, financement participatif — où les décisions des uns modifient les conditions des autres. Dans les épisodes de base, 77 % des ruées bancaires et 83 % des refinancements se terminent en échec sur sept modèles de premier plan, sans qu’aucun agent n’ait reçu de consigne de déstabiliser le système. Trois mécanismes d’interaction sont comparés : engagements compensés, accords d’engagement centralisés, coalitions menées par les participants. Tous améliorent les résultats agrégés, aucun n’est le meilleur sur toutes les structures financières. Le motif commun aux stabilisations réussies est temporel : un engagement large se forme tôt, avant que le comportement défensif ne devienne auto-renforçant. Les auteurs en tirent une conclusion de politique publique : des agents individuellement compétents ne forment pas automatiquement des systèmes financiers sûrs, ce qui déplace le problème vers l’évaluation au niveau système et la conception des interactions.

Ce que le dîner ne réglera pas

Il y a une ironie productive dans la journée du 28 septembre. D’un côté, la gouvernance de l’IA se joue sur scène : un dîner à la Maison-Blanche, un sketch télévisé, une bataille de communication entre la Silicon Valley et Washington, un agent grand public présenté comme un appareil mignon. De l’autre, les instruments capables de dire si ces systèmes sont sûrs restent soit inexistants, soit extrêmement étroits : un audit de biosecurité découvre que l’ordre des options de réponse suffit à changer plus d’un tiers des réponses ; un détecteur de jailbreak doit s’appuyer sur la géométrie de l’énergie cinétique pour couvrir ses angles morts ; un dispositif de pilotage d’acceptation d’arrêt change quatre décisions sur 192 scénarios ; et le raisonnement, présenté comme le remède aux biais, en crée cinq fois plus qu’il n’en résout.

Le classement du Pentagone qui désigne Anthropic comme risque de chaîne d’approvisionnement, et le contentieux qui s’ensuit, montrent d’ailleurs la même asymétrie sous une autre forme : l’État dispose d’instruments de classement rapides et d’instruments de vérification lents. Un dîner ne change pas cela. Ce qui le changerait, ce sont des protocoles de mesure qui survivent à la permutation des options, à la quantification des poids et à l’ordre des réponses — c’est-à-dire exactement ce que ces cinq articles proposent, chacun sur un étroit périmètre.

🎯 À retenir

  • Amodei dîne à la Maison-Blanche pour la première rencontre en tête-à-tête avec Trump, après avoir publié un plan de ralentissement face à un président qui qualifie le retour de bâton anti-IA de canular démocrate et veut rebaptiser la technologie « super intelligence ».
  • Anthropic reste en contentieux : le Pentagone l’a classé risque pour la chaîne d’approvisionnement en réaction à ses garde-fous, désignation contestée en justice — signe que l’État classe vite et vérifie lentement.
  • Le raisonnement crée plus de biais qu’il n’en résout : sur 9 combinaisons modèle-données (QwQ-32B, DeepSeek-R1-Distill-Qwen-32B, Qwen3-32B × Adult, COMPAS, Credit), les retournements créés dépassent d’environ 5× les retournements résolus, à confiance quasi saturée.
  • 37,4 % des items d’un benchmark de cybersécurité biologique changent de réponse selon l’ordre cyclique des options ; moyenner sur les rotations rend 3,8 points, et une application ciblée aux items peu confiants suffit.
  • Les garde-fous de diffusion se vérifient par construction : les trois signaux sans entraînement (ratio à l’étape 0 + deux vitesses de trajectoire) se recouvrent mutuellement, et toute attaque qui les évite échoue aussi à produire du contenu nuisible.
  • Piloter l’acceptation d’arrêt reste un effet de laboratoire : 4 décisions changées sur 192 scénarios tenus à l’écart, 75 % de rappel et 90 % de précision — « petit et hautement sélectif » selon les auteurs eux-mêmes.
  • Les agents financiers échouent en groupe : 77 % des ruées bancaires et 83 % des refinancements de dette se terminent en échec sans consigne de nuire ; la seule régularité des stabilisations réussies est un engagement large formé tôt.

A lire aussi