Prouver ce qu'un modèle sait : la vérification quitte la sortie et entre dans le modèle
💡 En résumé
Une question traverse les recherches publiées ce lundi : peut-on savoir ce qu’un modèle sait vraiment ? Non pas ce qu’il répond — ce qu’il « sait », distinction qui devient critique dès qu’un système est soupçonné de masquer ses capacités lors d’une évaluation ou d’inventer une réponse qu’il pourrait vérifier.
Un papier y répond de la façon la plus directe qui soit. Le Probe of Internal Recognition applique au modèle un équivalent du test d’information dissimulée, la méthode utilisée en criminologie pour identifier une connaissance coupable : on présente la question avec ses réponses candidates et on lit dans les états internes laquelle le modèle reconnaît comme correcte. Sans modèle de référence honnête, sans corpus de vérité étiqueté. Sur huit modèles de cinq familles, la reconnaissance est récupérée avec une précision équilibrée de 0,70 à 0,87, contre 0,28 à 0,40 pour la référence « item inconnu » et 0,25 pour le hasard. Et le signal tient sous toutes les formes de dissimulation testées — tromperie par instruction, sandbagging entraîné, poids verrouillés par mot de passe, circuits cassés — avec une reconnaissance entre 0,85 et 0,93.
Le même mouvement se vérifie ailleurs. Un autre papier trace les signatures topologiques de l’hallucination dans les graphes d’attention. Un troisième formalise et vérifie chaque étape d’un raisonnement avec des démonstrateurs automatiques. Un quatrième remplace les tests par des preuves formelles sur 500 problèmes réels, et découvre qu’entre un quart et la moitié des correctifs qui passent les tests admettent des contre-exemples.
Pendant que cette preuve technique se construit, le débat politique se durcit. Dario Amodei veut « pace the frontier » — rythmer la frontière — et propose des évaluateurs tiers embarqués dans les laboratoires. Jensen Huang, appelé par le président Trump en pleine conférence, qualifie le mouvement de reculade de canular. Une analyste résume le risque en une phrase : le consensus peut aussi être le début d’un cartel.
🔥 Tendances : lire l’intérieur plutôt que juger la sortie
Le sandbagging cesse d’être indétectable
Le problème pratique du sandbagging est simple à énoncer et était, jusqu’ici, impossible à trancher : quand un modèle répond mal, masque-t-il une capacité ou ne la possède-t-il pas ? Les sorties seules ne permettent pas de distinguer « ne peut pas » de « ne veut pas ». Cette ambiguïté n’est pas théorique — elle mine toute évaluation de sûreté, dans les deux sens. Un modèle peut passer une évaluation en dissimulant, ou échouer une évaluation en dissimulant, et les deux cas produisent le même signal observable.
PIR résout le problème en déplaçant la lecture de la sortie vers l’état interne, ce qui présente trois propriétés importantes. Il est sans référence : aucun modèle honnête témoin, aucun corpus de vérité n’est nécessaire, ce qui le rend applicable à un modèle de frontière dont on ne dispose pas d’équivalent fiable. Il est causal : les auteurs montrent que le signal ajoute de l’information au-delà des indices comportementaux de type boîte noire. Et il est discriminant dans les deux sens : quand le modèle cache une réponse qu’il connaît, la reconnaissance reste élevée ; quand le désapprentissage supprime la connaissance, la reconnaissance retombe au niveau d’une question jamais connue. PIR sépare donc ne veut pas répondre de ne peut pas répondre.
Deux applications en découlent directement. L’audit de sandbagging — vérifier qu’un modèle évalué n’a pas sous-performé volontairement. Et la vérification de désapprentissage — s’assurer qu’une capacité dangereuse a réellement été retirée et non simplement rendue muette. Le procédé s’étend de la question à choix multiple à la génération libre.
L’hallucination a une signature structurelle
Si PIR traite le mensonge intentionnel, un second papier traite l’erreur non intentionnelle par des moyens tout aussi internes. L’équipe examine la topologie des flux d’information dans les graphes d’attention pour distinguer les réponses hallucinées des réponses fondées. L’instrument central est la courbure de Forman-Ricci, utilisée pour identifier des goulots structurels dans les graphes d’attention. La méthode capture à la fois les caractéristiques semi-locales et globales des têtes d’attention associées aux réponses hallucinées.
Les résultats convergent vers un portrait cohérent. Les réponses hallucinées se caractérisent systématiquement par trois signatures : une dépendance excessive à l’auto-attention, une récupération de contexte diffuse depuis les jetons antérieurs, ou un écrasement d’information — en particulier dans la dernière couche du transformer. La méthode est en passe unique, ce qui la distingue des approches multi-réponses qui exigent plusieurs générations pour trancher. Elle améliore de façon consistante les références fondées sur l’attention sur deux benchmarks de détection d’hallucination, à travers différentes architectures.
Ce que cela suggère est plus intéressant que le score : l’hallucination n’est pas seulement un problème de connaissance, c’est un problème de circulation de l’information dans le réseau. Un défaut de partage de contexte entre jetons, mesurable géométriquement.
Vérifier le raisonnement, pas seulement la réponse
Une chaîne de raisonnement peut arriver à la bonne réponse par un chemin logiquement invalide. C’est le problème que LogicTrack prend de front, en soulignant que les méthodes d’optimisation existantes reposent largement sur un retour fondé sur l’issue finale, laissant la validité logique des étapes intermédiaires non vérifiée.
LogicTrack est un cadre neuro-symbolique qui auto-formalise chaque étape de raisonnement en représentations symboliques et la vérifie avec des démonstrateurs automatiques. Il introduit une récompense de retour arrière fondée sur le solveur, mécanisme de notation étape par étape qui quantifie la solidité logique et guide une recherche arborescente par retour arrière au moment de l’inférence. Le cadre est ensuite étendu pour construire des données de réglage fin contenant les traces de retour arrière, permettant aux modèles ajustés d’internaliser l’audit étape par étape comme capacité intrinsèque. Les expériences couvrent huit benchmarks de raisonnement et sept modèles : la méthode améliore à la fois la vérifiabilité des chaînes et le taux de réussite final.
Le point conceptuel mérite d’être souligné : l’audit ne reste pas un outil externe, il devient une compétence du modèle. C’est la même logique que PIR appliquée à un autre objet — rendre l’inspection interne au système plutôt que de la confier à un juge postérieur.
La vérification formelle révèle ce que les tests laissent passer
Le papier le plus dérangeant du lot porte sur le code. Les benchmarks de génération de code agentique vérifient la correction par des suites de tests réservées, intrinsèquement incomplètes et de plus en plus exposées à la mémorisation. La vérification formelle évite les deux problèmes, mais les travaux existants ne couvrent que des tâches isolées dont la spécification est fournie en entrée — pas de vrais problèmes, qui touchent de grands dépôts et expriment leur intention en langage naturel vague.
Benchproofer convertit une tâche de codage disposant d’un correctif connu en tâche formellement vérifiée : il écrit une spécification pour le nouveau code, résume par axiomes les fonctions existantes que ce code appelle, et n’admet une instance qu’après accord de portes mécaniques et adverses. Appliqué à SWE-bench Verified, cela produit SWE-Proof, 500 problèmes réels dont la correction est formellement vérifiée plutôt que testée, et s’étend à SWE-bench Pro.
Le résultat tient en une phrase : entre un quart et la moitié des correctifs qui passent les tests admettent des contre-exemples — et une spécification en langage naturel structuré ne corrige pas le problème. Une spécification formelle correcte, elle, fait passer le taux de résolution de 85 % à 95 % pour Opus 4.8.
Mais écrire cette spécification est la partie difficile, et le papier ne l’embellit pas. Les modèles contraints de rédiger leur propre spécification ne gagnent rien par rapport à une référence sans assistance, et seules 62 % de leurs spécifications passent l’audit. Le mode d’échec typique est un défaut de fidélité : une spécification qui contraint une partie du comportement requis et laisse le reste libre. La qualité de spécification reste corrélée à l’issue — 89 % d’échec sur les instances non résolues contre 47 % sur les résolues — ce qui fait de la synthèse de spécifications fidèles un problème ouvert clairement identifié.
Le retour d’information sur soi dégrade le jugement
Un papier mérite une mention particulière parce qu’il documente une boucle de rétroaction que personne n’a encore instrumentée à grande échelle. Les modèles participent de plus en plus à l’évaluation scientifique, à la fois comme relecteurs automatisés et comme assistants de relecteurs humains. À mesure que des évaluations générées par modèle entrent dans les données publiques et les futurs corpus d’entraînement, la relecture par IA peut devenir récursive : les relecteurs ultérieurs apprennent des jugements produits par les modèles antérieurs.
L’équipe étudie une étape de cette boucle en milieu contrôlé. En partant de Llama 3.1 8B, elle ajuste d’abord un relecteur sur les évaluations officielles d’ICLR 2018-2023, puis entraîne quatre modèles successeurs sur les données d’ICLR 2024 avec des mélanges systématiquement variés d’évaluations officielles et générées par modèle. Observation : l’introduction d’évaluations synthétiques comprime les distributions de notes et réduit la diversité sémantique, à la fois pour un même article et au niveau du corpus. Les auteurs nomment ce phénomène l’effondrement du jugement scientifique.
La mitigation proposée, TrustReviewer, intervient à deux étages complémentaires : prévention à l’entraînement par un corpus curé réduisant la supervision dégradée, et correction au test par pilotage d’activation apparié, sans entraînement supplémentaire ni annotation experte. Le papier ne prétend pas résoudre le problème — il le caractérise et fournit des interventions pratiques. Mais la question qu’il laisse ouverte est vertigineuse : si le jugement scientifique est lui-même un produit du corpus, que devient la relecture quand le corpus devient majoritairement synthétique ?
🤖 Nouveaux outils : mesurer la valeur plutôt que la capacité
La grille d’acceptation d’un déploiement en entreprise
EnterpriseVal part d’un paradoxe documenté : les modèles de frontière produisent des livrables professionnels que des évaluateurs experts jugent comparables au travail humain sur une part substantielle de tâches économiquement précieuses, et pourtant la majorité des initiatives d’IA générative en entreprise n’affichent aucun effet mesurable sur l’activité, une part importante des projets agentiques étant même attendue à l’annulation.
Le diagnostic posé est un diagnostic de mesure. Les benchmarks publics répondent à « que sait faire le modèle ? », alors qu’une décision de déploiement exige une autre question : « ce flux de travail est-il adapté, fiable, sûr et digne d’être industrialisé — ici, sur nos données, sous nos contrôles ? »
Le système proposé comporte cinq pièces. Une spécification formelle du cas d’usage et de la configuration socio-technique gelée sous test — modèle, invites, récupération, outils, garde-fous, supervision humaine — avec un niveau d’autonomie et un palier de conséquence qui déterminent conjointement l’intensité d’évaluation requise. Un catalogue de métriques couvrant fidélité, utilité, efficience, fiabilité, assurance et supervision. Un protocole de notation qui met à l’échelle le jugement expert en aveugle avec une notation calibrée par modèle-juge via inférence alimentée par prédiction. Une porte à deux seuils, spécifiée comme algorithme exécutable, qui transforme un vecteur de métriques assorti de bornes de confiance en décision REJET / CONDITIONNEL / INDUSTRIALISATION. Et un modèle de valeur et de risque où le taux de détection par le relecteur est un paramètre mesuré.
Le pilote rapporté porte sur trois flux de travail d’une banque mondiale. En rédaction de mémoires de crédit, la précision de citation notée par des humains atteint 88 % et le taux d’hallucination 1,6 % pour le meilleur modèle, contre des portes fixées à 70 % et 5 %. En transformation de procédures, l’effort de raffinement analyste passe d’un estimé de 27,4 à 2,9 heures par document. Les auteurs prennent soin de séparer les résultats établis des preuves de pilote, du système proposé et des hypothèses ouvertes. Cette discipline de présentation est exactement ce que la porte à deux seuils cherche à imposer aux autres.
Outiller l’équité et l’aide à la recherche
Deux bibliothèques complètent le tableau. FairLMs unifie des activités habituellement dispersées entre outils aux interfaces incompatibles : 33 métriques intrinsèques et extrinsèques, 14 composants d’atténuation répartis en quatre catégories d’intervention, 14 diagnostics de jeux de données et d’instruments de notation, des adaptateurs pour trois architectures Transformer. Sa particularité est que les capacités et prérequis des modèles sont déclarés explicitement et vérifiés avant exécution, et que les résultats portent la configuration sous laquelle ils ont été obtenus — ce qui rend les méthodes comparables sous protocole commun.
Dans l’enseignement supérieur, une étude évalue Beacon, un système de génération augmentée par récupération spécifique à un cours, destiné à réduire les inégalités d’accès au soutien académique. Les étudiants décrivent des réponses mieux alignées sur le contenu du module et plus dignes de confiance que les outils génératifs sans restriction, appréciant le recours au pseudocode et aux explications étayées plutôt qu’aux solutions directes. Ils restent prudents sur la vérification et voient le système comme un premier point de contact avant le recours aux enseignants. Il ne remplace pas les éducateurs : il élargit l’accès à l’accompagnement.
Deux formes de fragilité, mesurées avec précision
CogGym fournit un cadre unifié pour comparer comportement humain et comportement machine sur des essais expérimentaux appariés. La version initiale standardise 258 expériences cognitives issues de 100 articles, centrées sur le raisonnement de sens commun humain, et évalue 50 modèles de langage contre les réponses humaines.
Le résultat est nuancé et important. On observe bien une tendance claire : les modèles plus grands et plus récents reproduisent mieux les jugements humains. Mais l’amélioration sur ces tâches de raisonnement commun est considérablement plus lente que les gains observés sur les benchmarks de raisonnement formel comme les mathématiques et le code. Et l’ajustement modèle-humain reste loin de la fiabilité humaine mesurée par demi-test : au mieux R² = 0,59 sur le texte, 0,58 sur l’image, 0,43 sur la vidéo, contre 0,93, 0,95 et 0,92 pour la fiabilité humaine. Autrement dit : les modèles excellent là où l’on peut vérifier mécaniquement, et progressent lentement là où il faut ressembler à un humain.
Clinician-Grounded Quality Assurance, enfin, documente un profil d’erreur que l’on retrouve partout dès qu’un modèle conversationnel entre dans un processus à enjeu. Sur un pilote comparant six cliniciens à un intervieweur d’admission psychiatrique fondé sur un LLM, le modèle récupère davantage d’éléments cliniquement pertinents enfouis dans les vignettes — 88,0 % contre 38,9 % — mais produit plus d’inférences cliniques non fondées sur l’entretien (56,8 % contre 27,8 %) et caractérise moins souvent les préoccupations de sécurité identifiées (33,3 % contre 66,7 %). Le modèle est meilleur pour collecter, moins bon pour distinguer ce qu’il sait de ce qu’il suppose, et moins bon pour signaler ce qui est grave.
📊 Analyse : la preuve comme enjeu politique
Il faut lire ensemble les deux moitiés de cette journée, parce qu’elles se répondent.
D’un côté, la recherche produit des instruments remarquables : lire une réponse reconnue dans les états internes, mesurer la topologie d’un flux d’information, vérifier formellement un correctif, transformer un vecteur de métriques en décision d’industrialisation. De l’autre, le débat industriel porte précisément sur qui détient ces instruments.
Sur le podcast Equity de TechCrunch, l’équipe revient sur le plan d’Amodei et le débat sur un éventuel ralentissement. Deux propositions y sont discutées : des évaluateurs tiers indépendants qui travailleraient à l’intérieur d’Anthropic ou d’OpenAI pour surveiller les pratiques et les incidents de sûreté, et une coordination des grandes entreprises d’IA des pays démocratiques sur des standards et des limites. S’y ajoute un volet de coordination internationale.
La réaction la plus instructive ne vient pas de l’industrie mais d’une journaliste spécialisée, Kirsten Korosec, qui formule en une phrase le risque institutionnel : « le consensus peut être une bonne chose ; il peut aussi être le début de la formation d’un cartel ». Sean O’Kane ajoute deux objections de fond. D’abord, un gouvernement fédéral qui « ne semble certainement pas empressé d’appliquer les réglementations de manière générale, encore moins ici ». Ensuite, et c’est peut-être l’observation la plus dérangeante : « il ne semble pas y avoir beaucoup de choix consommateur pour piloter ce marché — au sens où, si une de ces entreprises fait quelque chose de très grave, elle verra un impact sur le nombre de résiliations ».
Sur Jensen Huang, la lecture proposée est également sévère. Il bénéficie d’une position de « grande personne dans la pièce », rôle occupé il y a deux ans par Microsoft et Satya Nadella — et il est l’un des relais les plus utiles entre le secteur et l’administration, au point de recevoir un appel du président pendant qu’il est sur scène dans une conférence très suivie. Le commentaire de Korosec est explicite : l’intervention « m’a semblé un peu mise en scène, elle est allée un pas trop loin, et elle a surtout mis en lumière le fait que Nvidia bénéficie grandement d’une avancée de l’IA à un rythme non rythmé ». Anthony Ha complète : « les intérêts de Trump et de Huang sont alignés, et il dit à Trump ce qu’il veut entendre ».
Le point qui relie les deux moitiés de la journée n’est pas moral, il est structurel. La proposition d’évaluateurs tiers embarqués à l’intérieur des laboratoires est exactement la forme politique de ce que la recherche du jour industrialise : la preuve déplacée à l’intérieur du système, produite par un instrument, plutôt que constatée après coup sur les sorties. C’est cohérent techniquement et risqué institutionnellement. Techniquement, nous venons de voir pourquoi c’est nécessaire : les sorties ne distinguent pas « ne peut pas » de « ne veut pas », les tests laissent passer un quart à la moitié des correctifs non corrigés, et la relecture par IA peut s’effondrer sur elle-même. Institutionnellement, nous venons de voir pourquoi c’est insuffisant : si l’instrument de preuve est détenu par la partie évaluée, ou si les évaluateurs tiers sont choisis, financés et arbitrés par elle, l’instrument perd la propriété qui lui donne sa valeur — l’indépendance.
C’est là que les deux autres articles du jour prennent un relief inattendu. Vocci lance un anneau à 249 dollars qui enregistre les réunions par une double pression, léger, en titane, capable de transcrire une heure de conversation dans un café bruyant. Le journaliste note que le matériel fonctionne et que le logiciel déçoit. Mais il soulève un point qui relève exactement du même registre que la preuve : l’anneau porte un témoin d’enregistrement, et ce témoin fait face à l’utilisateur. Il ressemble à un bijou ordinaire jusqu’à ce qu’on remarque le bouton. La divulgation d’un enregistrement est requise par la loi dans certains pays et régions, et la société dit encourager la divulgation — mais rien dans l’appareil ne l’impose ni ne l’atteste. Le porteur de la preuve est aussi celui qui peut la dissimuler.
ScrollEd, de son côté, veut transformer les manuels en flux de type TikTok, avec vidéo, audio, texte et quiz générés par IA. Les fondateurs assument la position : la génération jeune est en format vertical court, et il faut « aller les chercher là où ils sont ». Ils ajoutent une intention explicite — « nous devons juste être délibérés sur la façon dont nous l’utilisons et choisir de ne pas maximiser l’engagement sur la plateforme », avec l’ambition d’un « réseau social meilleur pour vous ». On peut prendre la déclaration au sérieux. On peut aussi observer qu’aucun instrument ne la mesure : l’engagement est instrumenté par défaut, la retenue ne l’est pas. La dissociation entre ce que la plateforme optimise et ce qu’elle promet est le même écart que celui entre la sortie d’un modèle et son état interne — sauf qu’ici personne ne construit le PIR correspondant.
La conclusion qui se dégage de l’ensemble est donc double, et elle n’est pas confortable.
La preuve technique est en train de gagner, et cela change les règles. Un modèle ne peut plus prétendre ignorer ce qu’il reconnaît ; une chaîne de raisonnement ne peut plus arriver à la bonne réponse par un chemin invalide sans que cela se voie ; un correctif ne peut plus passer grâce à des tests incomplets ; un déploiement ne peut plus être décidé sur un score de benchmark public. Chacun de ces verrous était impensable il y a dix-huit mois.
Mais la preuve technique ne dit pas qui décide. Elle fournit les instruments — lecture interne, vérification formelle, portes d’acceptation, catalogues de métriques. Elle ne fournit ni l’indépendance de celui qui les tient, ni la sanction pour celui qui les contourne. Le débat sur le rythme de la frontière, tel qu’il s’est déroulé cette semaine, montre que les acteurs les plus concernés proposent précisément de placer l’instrument à l’intérieur de chez eux. C’est défendable au nom de la faisabilité — on ne lit pas les états internes d’un modèle depuis l’extérieur d’un bâtiment. C’est problématique au nom de la fonction même de l’instrument.
Pour une organisation qui achète ou déploie de l’IA aujourd’hui, la conséquence pratique est immédiate et modeste : ne pas attendre que ce débat institutionnel soit tranché. Les briques disponibles existent — portes d’acceptation avec seuils et bornes de confiance, spécifications formelles sur les parties critiques, vérification de désapprentissage, mesures de fidélité de spécification, catalogues d’équité vérifiés avant exécution. Celles qui les adoptent maintenant n’auront pas besoin qu’on leur explique, plus tard, la différence entre un système qui marche et un système dont on peut montrer qu’il marche.
🎯 À retenir
- Le mensonge d’un modèle devient détectable. Le Probe of Internal Recognition lit dans les états internes la réponse que le modèle reconnaît, sans modèle de référence ni corpus de vérité : 0,70 à 0,87 de précision équilibrée contre 0,25 pour le hasard, et 0,85 à 0,93 sous tromperie entraînée, poids verrouillés ou circuits cassés.
- L’hallucination a une signature géométrique. Une méthode en passe unique fondée sur la courbure de Forman-Ricci identifie trois signatures récurrentes : dépendance excessive à l’auto-attention, récupération de contexte diffuse, écrasement d’information — surtout dans la dernière couche. L’hallucination est un défaut de circulation de l’information, pas seulement de connaissance.
- Les tests laissent passer l’essentiel. Sur SWE-Proof — 500 problèmes réels formellement vérifiés — un quart à la moitié des correctifs qui passent les tests admettent des contre-exemples. Une spécification formelle correcte porte Opus 4.8 de 85 % à 95 %, mais seuls 62 % des spécifications écrites par les modèles passent l’audit : la synthèse de spécifications fidèles est un problème ouvert.
- La relecture par IA peut s’effondrer sur elle-même. Introduire des évaluations synthétiques dans l’entraînement d’un relecteur comprime les distributions de notes et réduit la diversité sémantique — « effondrement du jugement scientifique ». La mitigation existe mais ne ferme pas la question.
- L’écart humain-machine ne se comble pas au même rythme selon le domaine. Sur 258 expériences cognitives et 50 modèles, l’ajustement aux jugements humains plafonne à R² = 0,59 sur le texte contre 0,93 pour la fiabilité humaine ; la progression est bien plus lente que sur les benchmarks formels.
- Un déploiement se décide sur une porte, pas sur un score. EnterpriseVal transforme un vecteur de métriques avec bornes de confiance en décision REJET / CONDITIONNEL / INDUSTRIALISATION ; sur un pilote bancaire, 88 % de précision de citation et 1,6 % d’hallucination contre des seuils de 70 % et 5 %, et 27,4 à 2,9 heures de raffinement par document.
- Le débat sur le ralentissement est un débat sur la propriété de la preuve. Les évaluateurs tiers embarqués proposés par Amodei sont la forme politique du déplacement technique du jour — avec le risque, relevé par TechCrunch, qu’un consensus entre laboratoires frontière ressemble au début d’un cartel, sans choix consommateur pour arbitrer.