OpenAI annonce 100 problèmes de maths résolus et crée un groupe sans pouvoir de ralentir : qui vérifie quoi ?
💡 En résumé
OpenAI a annoncé lundi un Advisory Group on Mathematics and Artificial Intelligence, hébergé à l’Institute for Advanced Study de Princeton, avec neuf mathématiciens. Le groupe « servira de pont vers la communauté mathématique et le grand public, donnant aux mathématiciens une voix dans la façon dont nous avançons », selon le billet publié. Neuf membres sur neuf.
La même annonce fait état, en passant, de ceci : après la publication abrupte d’une solution au problème du millénaire de Navier-Stokes, le même modèle interne aurait résolu plus de 100 problèmes ouverts supplémentaires dans la plupart des domaines des mathématiques. Un groupe consultatif de neuf personnes pour encadrer une production de résultats que le communiqué lui-même n’arrive pas à quantifier précisément.
Le point qui résume la journée est dans une phrase. Le billet précise que le groupe « ne sera pas responsable de nous conseiller sur le rythme de nos progrès internes en mathématiques ». Et l’IAS, dans son propre communiqué, enfonce le clou : « Bien que nous donnions des conseils, nous n’avons aucun pouvoir de décision dans une entreprise d’IA, et la responsabilité des décisions prises par une entreprise reposera sur cette entreprise. »
Neuf membres pour un côté de la table. Un seul d’entre eux, Camillo De Lellis, avait signé la lettre ouverte par laquelle 25 mathématiciens médaillés Fields ont protesté ce mois-ci contre le rythme effréné de ces résultats. L’institution qui accueille le groupe déclare publiquement, dans le même souffle, qu’elle n’a aucun pouvoir.
Ce n’est pas une critique dirigée contre OpenAI. C’est la description d’une nouvelle catégorie de dispositif : l’organe consultatif sans capacité d’arrêt. Et la recherche du jour explique précisément pourquoi ce vide est structurellement dangereux : parce que la vérification, elle, est devenue mesurable — et ce qui est mesurable se découvre défaillant.
🔥 Tendances : le pouvoir consultatif comme substitut à la responsabilité
Ce que le groupe peut et ne peut pas faire
Le mandat est explicite et étroit : le groupe évolue en capacité consultative, évalue la significativité de nouveaux résultats et coordonne leur publication. Les membres ne sont pas payés, peuvent offrir des conseils non sollicités, rendre leurs vues publiques et contrôler leur propre composition — ce dernier point leur conférant une mesure d’indépendance vis-à-vis de l’entreprise.
Ce qu’ils ne peuvent pas faire : ralentir ou rediriger la recherche mathématique en cours. Pas de veto, pas de calendrier, pas d’accès à la décision. La formulation d’OpenAI est nette — le groupe n’est pas là pour conseiller sur le rythme.
Il y a une lecture charitable de ce dispositif. Neuf mathématiciens de premier plan disposant d’un canal public, du droit de contredire et du contrôle de leur propre renouvellement constituent un contrepoids réel : c’est plus que la plupart des comités consultatifs, qui n’ont ni la voix ni la sortie. La publication « abrupte » d’une solution à un problème du millénaire sans processus de revue préalable est exactement le genre de comportement que ce canal peut dissuader par le coût réputationnel.
Il y a une lecture plus sombre, et elle est documentée par la composition : sur les neuf membres, un seul a signé la protestation des médaillés Fields. Le groupe n’est donc pas composé des critiques de la pratique — il est composé de mathématiciens qui acceptent d’y participer, ce qui est un ensemble différent. Et l’IAS le dit sans détour : aucun pouvoir décisionnel, la responsabilité reste à l’entreprise.
Le problème n’est pas l’intégrité des membres. Le problème est qu’on a construit un instrument dont la fonction déclarée est de rendre des comptes et dont la contrainte constitutionnelle interdit qu’on en rende. C’est une structure de vérification sans capacité de sanction — un mécanisme qui produit de la légitimité en amont sans engager de responsabilité en aval.
Le même schéma côté commerce : le blocage comme acte de gouvernement privé
L’affaire parallèle de la journée est le blocage de l’agent de Muse de Meta sur Amazon, dimanche soir, au motif que « l’accès continu par un agent IA non autorisé viole les Conditions of Use d’Amazon ».
Remarquez la symétrie institutionnelle. Une entreprise privée a édicté une règle, un tiers l’a enfreinte, et la sanction est immédiate, unilatérale et non contestable — pas de recours, pas de comité, pas d’organe d’appel. Les Conditions of Use remplissent ici exactement la fonction qu’un régulateur remplirait dans un autre secteur. Le détail qui rend le cas intéressant est la justification sous-jacente : si l’agent passe une mauvaise commande, c’est Amazon qui récupère le client mécontent et le vendeur mécontent. Amazon agit donc en tant qu’assureur de dernier recours d’un risque qu’il ne contrôle pas.
Deux entreprises, deux mécanismes de gouvernance privée, aucune autorité publique. Voilà l’état réel du gouvernement de l’IA en septembre 2026 : des Conditions of Use qui font office de régulation du commerce agentique, et des groupes consultatifs sans pouvoir qui font office de contrôle scientifique.
Et pendant ce temps, les instruments de vérification disent qu’ils ne vérifient pas
C’est ici que la recherche rend le vide institutionnel coûteux, parce qu’elle démontre que les outils sur lesquels tout le monde s’appuie sont mesurablement insuffisants.
Measuring the Checker : un oracle sur six rates une faute. Les benchmarks de noyaux GPU produits par LLM décident de la correction avec quelques entrées aléatoires et une tolérance flottante lâche. Leurs verdicts alimentent désormais des classements et des récompenses d’apprentissage par renforcement. Les auteurs introduisent l’analyse par mutation comme métrique d’adéquation : des règles déterministes injectent 10 303 fautes compilables dans des implémentations CUDA vérifiées de 188 problèmes KernelBench, dont 7 384 dotées d’un témoin de détection indépendant. N’importe quel protocole de test est noté par la fraction de fautes qu’il détecte.
Le résultat : le vérificateur officiel manque une faute témoin sur six — 16,9 % — de manière déterministe. Et les manques sont biaisés par famille : 8,7 % des fautes arithmétiques s’échappent, contre 78,6 % des fautes de précision. La métrique explique pourquoi (une bande aveugle de tolérance qui grandit avec la taille de la réduction, et un plafond mesuré sur l’agressivité des entrées fixé par la variance flottante légitime), audite le meilleur correctif existant (le gain de KernelBench-Verified se scinde en +4,0 points venant d’entrées cachées et +4,5 de la tolérance resserrée — une répartition que ses propres auteurs ne pouvaient pas calculer), et expose une recette de fuzzing publiée qui rejette 107 fois des noyaux corrects.
Ce qu’il faut retenir n’est pas le taux d’échec, c’est la structure : optimiser des suites de tests sur la matrice de détection atteint 98,0 % de détection avec deux entrées par problème (94,8 % hors échantillon). Le résultat est donc un problème de protocole, pas de ressources. Et sur 48 architectures complètes, l’aveuglement croît avec l’échelle, se concentrant dans les pipelines profonds et homogènes. Deux problèmes se révèlent inosécables : leurs références officielles violent la tolérance du benchmark contre fp64.
CleanScore : ce qu’un audit négatif prouve vraiment. La question posée est simple et redoutable : un score public reflète-t-il une compétence, une exposition préalable aux questions, ou les deux — et pour la plupart des modèles, les données d’entraînement sont inconnues. CleanScore est un audit en boîte noire qui n’utilise que les sorties notées. Chaque question devient un item parent avec une forme publique et deux formes fraîches écrites indépendamment, préservant nombres, faits et réponse. L’audit rapporte un intervalle pour l’avantage de la forme publique plutôt qu’un verdict, plus une banque de contrôle négatif privée avec un rayon de transport explicite qui sépare l’exposition de la simple différence de forme.
L’audit enregistré de cinq modèles ouverts sur 200 items GSM8K et 200 ARC-Challenge ne trouve aucun avantage compatible avec une exposition, bornant l’inflation de forme de surface sous cinq points. Jusque-là, bonne nouvelle. Puis viennent les contrôles positifs, qui bornent ce qu’un tel nul peut signifier : fuiter un item augmente la précision sur des paraphrases que le modèle n’a jamais vues presque autant que sur la formulation fuitée, laissant 52 % à 110 % de l’effet invisible à un audit de paraphrase. Sur ARC, un avantage planté de 49 points affiche un écart observable de −0,020, et environ 20 points survivent à la réécriture de l’énoncé et des options, sur quatre graines d’entraînement.
Autrement dit : un résultat nul de forme de surface borne bien moins que ce qu’un audit de contamination de formulation laisse croire. Le vocabulaire de l’audit lui-même doit être reçu avec prudence.
SafeTune : la dérive de sûreté n’a pas d’implémentation commune. Les méthodes qui traitent la dérive de sûreté dans les modèles fine-tunés sont dispersées entre implémentations incompatibles, étapes de cycle de vie et protocoles d’évaluation — ce qui les rend difficiles à adopter et impossibles à comparer. SafeTune unifie quatre paradigmes d’intervention : récupération de poids post hoc, fine-tuning contraint par la sûreté, désapprentissage par gradient, et pilotage à l’inférence. Le démonstrateur est un registre configurable, illustré par des comparaisons contrôlées et des études de cas en finance et en médecine. C’est un papier d’infrastructure, donc moins spectaculaire que les autres — mais il traite exactement le problème qui empêche la reddition de comptes : sans protocoles communs, il n’y a pas de comparaison, donc pas de standard, donc pas de conformité vérifiable.
Quantification clinique : la sûreté n’est pas une propriété dérivée. Cinq modèles de 7-8 milliards de paramètres, à FP16, GPTQ-INT8 et GPTQ-INT4, sur cinq benchmarks : MedQA, MedMCQA, Med-HALT, un échantillon stratifié par risque de HealthBench et MedSafetyBench. Le résultat principal est simple : INT8 est universellement sûr (dégradation maximale de −1,9 % à 1,9 %). INT4, non, et la dégradation dépend du modèle.
Les chiffres qui comptent : BioMistral-7B, fine-tuné cliniquement, perd 19,7 % sur MedMCQA — plus que n’importe quel modèle généraliste, ce qui montre que l’adaptation au domaine clinique ne confère aucune robustesse à la compression. Sur le sous-groupe à risque d’urgence de HealthBench, Qwen2.5-7B se dégrade de 26,8 % en INT4, suggérant que les scénarios à haut risque sont disproportionnellement vulnérables. Sur MedSafetyBench, la famille de modèles domine la précision — les taux de refus vont de 10,2 % à 74,9 % à FP16 — tandis que Qwen2.5-7B (−17,8 %) et Meditron-7B (−28,3 %) affichent une dégradation substantielle de sûreté en INT4. Le détail le plus fort : Qwen2.5-7B est simultanément le modèle le plus robuste en exactitude et l’un des plus dégradés en sûreté. Exactitude et robustesse de sûreté sont deux propriétés indépendantes. Et les deux méthodes de récupération testées — substitution de calibration clinique et QLoRA — produisent le même arbitrage : MedMCQA se rétablit pendant que MedQA continue de se dégrader. La récupération exige une validation par tâche, elle ne peut pas être supposée bénéfique.
Préférences plurielles : l’alignement sur une fonction unique est un choix de conception, pas une neutralité
Dernier élément, et il est philosophique autant que technique. L’intransitivité des préférences des LLM — A préféré à B, B à C, C à A — est habituellement traitée comme du bruit autour d’un ordre unique. Les auteurs montrent que cela ne peut pas être le cas, puis modélisent ces préférences comme un mélange d’ordres latents internes cohérents. Sur les dilemmes de Moral Machine, des modèles dont les ordres agrégés divergent partagent encore des composantes latentes.
La conclusion est directement institutionnelle : les pipelines d’alignement et d’évaluation qui traitent les préférences d’un modèle comme une fonction unique risquent de moyenner des ordres cohérents que des utilisateurs différents endosseraient différemment. Quand on discute de « valeurs » d’un modèle, de charte de comportement ou de politique de sûreté, on présuppose une fonction de préférence bien définie à aligner. Si le modèle héberge un mélange, alors « aligner le modèle » signifie choisir une pondération entre des publics — une décision politique déguisée en paramètre technique.
Détecter la fuite de données d’entraînement dans les modèles à diffusion
Un dernier point technique qui alimente le dossier de la reddition de comptes. Les modèles de langage à diffusion peuvent exposer des données d’entraînement sensibles pendant le débruitage, mais n’ont pas la décomposition de probabilité en une passe des architectures causales. Les méthodes existantes recourent à un masquage aléatoire, qui ne contrôle pas les dépendances entre jetons masqués. Les auteurs démontrent que cette approximation par jeton introduit une erreur d’estimation structurelle non négative, caractérisée par l’information mutuelle conditionnelle cumulée entre jetons masqués — laquelle peut masquer des signaux de mémorisation subtils. Leur méthode, Independent Token Sampling, utilise un proxy de dépendance par paire dérivé de l’attention, avec une stratégie de diversité. Résultat : +0,18 d’AUC sur ArXiv, en tenant sous budget de requêtes limité. Détecter une fuite demande donc désormais un instrument spécifique à l’architecture testée.
📊 Analyse : trois asymétries qui tiennent le système en place
Première asymétrie : produire est gratuit, vérifier coûte. C’est l’observation centrale de la journée. Un modèle résout 100 problèmes de mathématiques ouverts — la production est abondante et son coût marginal est proche de zéro. Vérifier un seul de ces résultats demande des semaines de travail humain expert. Le déséquilibre n’est pas seulement quantitatif : il est institutionnel. Les 25 médaillés Fields ne peuvent pas contester la validité de 100 résultats par lettre ouverte ; ils peuvent seulement exprimer une position sur le rythme. Et le groupe consultatif, nommément, n’a pas compétence pour ralentir. La contre-mesure disponible — la pression réputationnelle via un canal public — est réelle mais proportionnelle à la lenteur des mathématiciens face au débit d’un modèle.
C’est un renversement de ce que la littérature sur l’audit supposait généralement. L’hypothèse implicite était que vérifier serait facile parce qu’une machine peut vérifier une preuve. Mais Measuring the Checker montre la difficulté à un niveau bien inférieur : même quand on peut écrire le vérificateur, même quand on injecte 10 303 fautes déterministes avec témoins, le vérificateur officiel en rate 16,9 % et 78,6 % des fautes de précision. Le problème n’est pas de savoir vérifier — c’est de savoir que le vérificateur vérifie.
Deuxième asymétrie : le contrat d’évaluation vaut plus que le modèle. CleanScore et l’étude Eurostat que nous avons traitée côté agentique racontent la même histoire depuis deux angles. CleanScore : un audit de paraphrase peut manquer de 52 % à 110 % de l’effet, parce que fuiter un item augmente la précision sur des paraphrases jamais vues — l’audit cherche la mauvaise trace. Eurostat : un contrat de sortie sous-spécifié sous-estime la meilleure condition du benchmark de 23,4 points. Dans les deux cas, la conclusion mesurée est dominée par la conception de l’évaluateur, pas par le modèle évalué.
Ce qui signifie qu’une part importante de la littérature comparative sur les agents mesure en réalité une propriété du benchmark, non une propriété des systèmes. Un classement peut être stable, reproductible et entièrement porté par son protocole. La conséquence pratique est qu’aucun de ces chiffres ne devrait entrer dans une décision réglementaire ou d’achat sans lecture du contrat d’évaluation — ce que personne, en pratique, ne fait.
Troisième asymétrie : la performance et la sûreté sont indépendantes. C’est l’apport le plus concret du papier clinique, et il est directement actionnable. INT8 est sûr partout ; INT4 doit être évalué par modèle et par tâche. Qwen2.5-7B est simultanément le plus robuste en exactitude et l’un des plus dégradés en sûreté : le modèle qui se compresse le mieux n’est donc pas celui qui se dégrade le moins en refus. Sur MedSafetyBench, la famille de modèles (de 10,2 % à 74,9 % de refus) domine la précision de quantification. Et les deux stratégies de récupération échangent MedMCQA contre MedQA, ce qui interdit de traiter la récupération comme une opération neutre.
Traduit en termes de gouvernance : déployer un modèle clinique quantifié en INT4 sans évaluation par tâche, c’est prendre une décision de sûreté sur la base d’une métrique d’exactitude. Or ces deux métriques n’ont aucune corrélation garantie. Et l’effet de second ordre est encore plus grave : si l’adaptation clinique (BioMistral) n’apporte aucune robustesse à la compression, alors un modèle spécialisé n’est pas plus sûr qu’un modèle généraliste — il est seulement plus précis quand rien ne le comprime.
Ces trois asymétries s’emboîtent : un volume de production invérifiable, des instruments d’évaluation dont la conception domine le résultat, et des propriétés de sûreté indépendantes des propriétés de performance. Dans ce paysage, un dispositif de gouvernance dont la fonction est de rendre des comptes et dont la constitution interdit de décider n’est pas une imperfection : c’est la seule forme de contrôle compatible avec le déséquilibre. On ne peut pas auditer ce qu’on ne sait pas mesurer ; on peut seulement s’engager à ne pas ralentir.
La sortie de ce piège n’est probablement pas institutionnelle en premier, elle est instrumentale. Les mêmes papiers qui diagnostiquent donnent la parade : un contrôle négatif privé à rayon de transport explicite, une matrice de détection par mutation avec témoins, un registre unifié de quatre paradigmes de sûreté, une évaluation stratifiée par risque clinique. Aucun de ces éléments ne demande une autorité nouvelle. Tous demandent qu’on cesse de publier des nombres sans publier le contrat qui les produit.
🎯 À retenir
- OpenAI a créé un Advisory Group on Mathematics and AI à l’Institute for Advanced Study, avec neuf mathématiciens. Le groupe évalue la significativité des résultats et coordonne leur publication ; il n’a explicitement pas mandat pour conseiller sur le rythme des progrès internes. L’IAS confirme : aucun pouvoir de décision, la responsabilité reste à l’entreprise. Un seul des neuf membres avait signé la lettre des 25 médaillés Fields.
- L’annonce s’accompagne de plus de 100 problèmes ouverts résolus par le même modèle interne, après la solution publiée à Navier-Stokes. Le volume de production rend la vérification experte structurellement impossible — et c’est précisément ce que la lettre ouverte des mathématiciens contestait.
- Amazon a bloqué l’agent de Muse au nom de ses Conditions of Use : c’est une gouvernance privée, unilatérale et sans recours, exercée par une entreprise qui se retrouve assureur d’un risque qu’elle ne contrôle pas. Deux mécanismes privés remplacent une régulation publique inexistante.
- Le vérificateur officiel des benchmarks de noyaux GPU rate 16,9 % des fautes témoins, dont 78,6 % des fautes de précision contre 8,7 % des fautes arithmétiques — alors que ces verdicts alimentent des classements et des récompenses RL. Sur 48 architectures, l’aveuglement croît avec l’échelle. Deux problèmes sont inosécables, leurs références officielles violant la tolérance du benchmark.
- Un audit négatif de contamination prouve bien moins qu’on ne le croit : fuiter un item augmente la précision sur des paraphrases jamais vues, laissant 52 % à 110 % de l’effet invisible à un audit de paraphrase. 20 points survivent à la réécriture de l’énoncé.
- Quantification clinique : INT8 est sûr partout, INT4 non. BioMistral-7B (fine-tuné clinique) perd 19,7 % sur MedMCQA, Qwen2.5-7B perd 26,8 % sur le sous-groupe urgence de HealthBench, et Qwen2.5-7B est à la fois le plus robuste en exactitude et l’un des plus dégradés en sûreté. La récupération exige une validation par tâche.
- Les préférences des LLM forment un mélange d’ordres cohérents, pas un ordre unique bruité : aligner un modèle sur « une » fonction de préférence revient à choisir une pondération entre publics — une décision politique déguisée en paramètre.
- La conclusion de la journée : ce ne sont pas les capacités qui manquent au contrôle, ce sont les instruments. Contrôle négatif privé, matrice de mutation avec témoins, registre unifié de la dérive de sûreté, évaluation stratifiée par risque — aucun de ces outils ne requiert une autorité nouvelle, tous requièrent d’arrêter de publier des scores sans publier le contrat qui les produit.