GPT-6 Sol et Luna face à Opus 5.5 : 90 minutes d'écart, deux baisses de prix, une seule arme
💡 En résumé
Le mardi 22 septembre 2026, en fin de journée, OpenAI a annoncé les versions rafraîchies de ses deux modèles intermédiaires, GPT-6 Sol et GPT-6 Luna. Quatre-vingt-dix minutes plus tôt, Anthropic avait publié Opus 5.5. Les deux laboratoires ont mis en avant, dans le même souffle, la même chose : des modèles plus rapides, moins chers à servir et censés faire moins d’erreurs.
OpenAI facture la génération 6 « à la moitié du coût » de la série 5.6 de Sol et Luna, un recul qu’il attribue à des progrès sur le cache et l’inférence — et non au modèle lui-même. Anthropic passe le token de sortie d’Opus de 25 à 20 dollars par million, avec « une baisse globale du calcul nécessaire pour le servir ». Les deux entreprises revendiquent aussi une meilleure fiabilité factuelle, sans publier de protocole d’évaluation vérifiable : OpenAI s’appuie sur « une évaluation interne de factualité, basée sur des conversations réelles dé-identifiées où les utilisateurs ont signalé des erreurs de nos modèles ».
La conclusion de la journée tient en une ligne : la capacité n’est plus le terrain où se joue la frontière. Le prix et la distribution le sont devenus. Le même jour, Meta admettait que son agent Muse — numéro un de l’App Store américain — est « fortement inspiré en tant que produit » d’OpenClaw, un projet open source. Et Snorkel AI, qui vend des jeux de données et des environnements d’apprentissage par renforcement, triplait sa valorisation à 3,5 milliards de dollars.
🔥 Tendances
90 minutes : la chronologie comme argument commercial
Le détail le plus parlant de la journée n’est pas un chiffre de benchmark, c’est un horaire. Anthropic a publié Opus 5.5 90 minutes avant qu’OpenAI ne publie Sol et Luna (TechCrunch). OpenAI a néanmoins utilisé son annonce pour affirmer, à plusieurs reprises, que Sol et Luna traitent les tâches « substantiellement mieux » que les meilleurs modèles d’Anthropic, Fable et Opus compris.
Cette façon d’écrire un communiqué — comparer plutôt que décrire — dit quelque chose de la structure du marché. Quand deux publications s’enchaînent dans l’heure et demie, ce n’est plus la performance qui est disputée, c’est la définition de l’unité de mesure. OpenAI parle de coût, de cache et de taux d’erreur ; Anthropic parle de prix au million de tokens et de vitesse de service ; les deux parlent de fiabilité sans en donner le protocole.
Amodei prêche la retenue, puis sort une version intermédiaire
Le contexte rend la sortie d’Opus 5.5 plus intéressante qu’un simple rafraîchissement de gamme. Anthropic souligne que c’est sa première publication depuis que Dario Amodei a publiquement adopté la thèse du ralentissement du rythme de progression des capacités.
« Je me suis convaincu que traiter pleinement les risques exige encore plus de prudence — pas seulement investir dans la prévention des risques, mais doser le rythme de progression des capacités pour que la prévention ait le temps de suivre », écrivait-il au début du mois, selon la reprise qu’en fait TechCrunch.
Ce que l’on observe concrètement, le 22 septembre, c’est : une montée de version mineure, portant sur les prix, la vitesse de service et le style de communication, deux mois après Opus 5 (24 juillet). Ce n’est pas un reniement — un modèle plus efficace consomme aussi moins de calcul, ce qui est cohérent avec un argument de ralentissement. Mais cela signifie que le « rythme » discuté publiquement porte sur les capacités, et que le rythme réellement observable porte sur les coûts d’exploitation, que rien n’appelle à ralentir. Anthropic annonce d’ores et déjà Sonnet 5.5 et Haiku 5.5 « dans les semaines à venir ».
Le niveau de gamme se déplace vers le bas
La structure des gammes des deux laboratoires révèle le même mouvement : l’intelligence de frontière est de plus en plus souvent proposée dans les étages inférieurs de la gamme.
Chez OpenAI, la série 6 se déploie largement : Sol et Luna arrivent dans ChatGPT Work et Codex pour la plupart des comptes payants et dans l’API, Luna étant poussé jusque dans l’application de bureau et chez les utilisateurs Free et Go. Chez Anthropic, Opus 5.5 — le haut de gamme, le plus cher des trois étages Claude — dépasse désormais sur de nombreux benchmarks le modèle Fable, qui lui est plus gros, et aurait réussi des tâches informelles que Fable échouait à terminer.
Le message commercial est limpide : la hiérarchie entre les modèles se brouille, et la seule variable qui continue de descendre proprement, c’est le prix du token.
Le produit, ce n’est plus le modèle
Pendant que les deux laboratoires s’échangeaient des points de prix, Meta encaissait une victoire de distribution. Muse a récemment atteint la première place de l’App Store américain, et les données citées par TechCrunch indiquent qu’il dépasse le lancement de ChatGPT à plateformes et marchés comparables.
Mais la vraie nouvelle n’est pas commerciale, elle est documentaire. Nat Friedman, responsable produit de Meta Superintelligence Labs, a reconnu sur X que Muse était « definitely heavily inspired as a product by OpenClaw », tout en affirmant qu’il avait été « construit de zéro ». Interrogé sur le fait que Muse reprenait non seulement les noms de fichiers de l’espace de travail de l’agent — dont un SOUL.md — mais aussi leur contenu « quasi identique », Friedman n’a pas contesté : « nous avons pensé que Peter avait vu ces choses exactement juste ».
Friedman raconte aussi avoir acheté « des centaines de Mac mini » pour son équipe après avoir utilisé OpenClaw en janvier. Autrement dit : un agent open source, conçu par une personne, devient la référence de conception d’un produit distribué à l’échelle de milliards d’utilisateurs — et la valeur ajoutée revendiquée par Meta est la sûreté, la sécurité et la simplicité.
🤖 Nouveaux outils
GPT-6 Sol et GPT-6 Luna (OpenAI)
- Positionnement : Sol pour les tâches complexes (code notamment), Luna pour le « travail de bureau à gros volume et à objectif clair » — résumer des documents, extraire de l’information, répondre à des questions rapides.
- Prix : API facturée à la moitié du coût de la série 5.6 de Sol et Luna. OpenAI attribue cette baisse aux améliorations du cache et de l’inférence, pas à une architecture plus légère.
- Fiabilité revendiquée : sur l’évaluation de factualité interne du laboratoire, « GPT-6 Sol fait environ deux fois moins d’erreurs que son prédécesseur, atteignant la fiabilité d’Astra à un coût bien moindre ». Le corpus de référence est constitué de conversations où les utilisateurs ont signalé des erreurs.
- Disponibilité : ChatGPT Work, Codex (comptes payants), API, application de bureau, offres Free et Go, déploiement progressif sur la journée.
Opus 5.5 (Anthropic)
- Positionnement : nouveau state of the art revendiqué en code et en travail de connaissance, surpassant « sur de nombreux benchmarks » le modèle plus gros Fable.
- Prix et vitesse : 20 $/million de tokens de sortie contre 25 $ pour Opus 5, baisse « globale du calcul nécessaire pour le servir ».
- Style : Opus 5.5 utilise moins de jargon et place l’information importante au début de ses messages — un changement de surface, mais qui déplace explicitement l’interface homme-modèle.
- Garde-fous : capacités biologie et cybersécurité comparables à Mythos, donc mêmes restrictions que Fable, qui limitent l’usage des modèles pour découvrir des exploits dans des programmes compilés ou développer des armes biologiques reconnaissables. Évaluation pré-publication par des organisations externes, dont METR et Frontier Design.
- Suite : Sonnet 5.5 et Haiku 5.5 annoncés « dans les semaines à venir ».
Snapdragon 8 Elite Gen 6 et 8 Elite Extreme Gen 6 (Qualcomm)
Qualcomm a profité de son Snapdragon Summit pour annoncer deux processeurs haut de gamme tournés vers l’IA locale :
- de nouveaux hubs de capteurs capables d’exécuter de petits modèles jusqu’à 200 millions de paramètres, assez pour un « scribe personnel » local, la distinction des locuteurs, et la construction d’une mémoire d’usage servant à automatiser des tâches ;
- un agent vocal entrée/sortie complet exécuté sur la puce ;
- sur la version Extreme, l’exécution locale d’un modèle Mixture-of-Experts de 30 milliards de paramètres (seule une fraction des paramètres étant activée par tâche), contre les 20 milliards de paramètres du modèle MoE présenté par Apple à la WWDC en juin ;
- un nouvel accélérateur, du contrôle pixel par pixel pour la caméra, 8K 60 fps et 4K 240 en ralenti, isolation de la voix en appel, et le premier téléphone annoncé : le Motorola Signature 27.
Muse (Meta) et l’aveu OpenClaw
Muse n’est pas un modèle neuf mais un produit neuf : un agent personnel qui reprend l’organisation d’OpenClaw (fichiers de configuration dont SOUL.md, espace de travail, harness), assumé par Meta comme une inspiration produit plutôt qu’une réutilisation de code. Numéro un de l’App Store américain, il dépasse le lancement de ChatGPT à périmètre comparable.
Snorkel AI : la donnée comme service
Derrière les modèles, un marché d’infrastructure de données accélère. Snorkel AI a levé 350 millions de dollars en série E à 3,5 milliards de valorisation (menée par Insight Partners et S32), soit près du triple des 1,3 milliard atteints il y a dix-sept mois. L’entreprise a quitté l’automatisation d’étiquetage pour vendre des jeux de données complets et des environnements d’apprentissage par renforcement, sous forme hybride — génération synthétique plus experts métiers. Revenu annualisé revendiqué : 375 millions de dollars, multiplié par dix-huit en douze mois. Ses pairs affichent des chiffres bruts encore plus spectaculaires : Mercor 2 milliards de revenu brut annualisé, Handshake 1 milliard, Micro1 500 millions — avec la précision importante que 60 à 70 % de ces revenus bruts repartent directement vers les spécialistes métier.
📊 Analyse
Ce que « moins cher » veut dire exactement
Les deux annonces reposent sur la même mécanique, et il faut la lire précisément. OpenAI attribue sa baisse de prix au cache et à l’inférence ; Anthropic à une baisse du calcul nécessaire pour servir Opus 5.5. Aucun des deux n’attribue la baisse à un modèle intrinsèquement plus petit ou plus efficace au sens architectural.
Conséquence : ce qui est vendu n’est pas seulement un modèle, c’est une pile de service. Or une pile de service s’améliore par le cache, l’ordonnancement, la mémoire, le matériel, la parallélisation. C’est exactement le terrain sur lequel les deux laboratoires sont désormais contraints de se battre, et c’est un terrain que leurs concurrents open source peuvent attaquer avec des moyens très différents. Le jour même, Hugging Face annonçait que transformers sait exécuter nativement les quantifications GGUF de llama.cpp sur Apple Silicon, avec des noyaux Metal réutilisés — un modèle Qwen3.5-4B passant de 8,42 Go en BF16 à 2,74 Go en Q4_K_M (Hugging Face). La baisse du coût par token n’est pas un privilège de laboratoire de frontière : c’est un mouvement général, et il devient difficile d’y construire une barrière.
La fiabilité revendiquée n’est pas la fiabilité démontrée
Les deux communiqués promettent moins d’erreurs. Les deux s’appuient sur des évaluations qui ne sont pas auditables de l’extérieur : OpenAI mesure les erreurs sur les cas où des utilisateurs ont déjà signalé une erreur — un échantillon construit à partir des plaintes, donc biaisé vers ce que les utilisateurs remarquent, et non vers ce que le modèle rate en silence. Anthropic s’appuie sur METR et Frontier Design pour l’évaluation pré-publication, mais ne publie pas les protocoles.
Cette semaine, la recherche a justement documenté à quel point ce mode de preuve est fragile. Une étude sur les simulateurs de populations montre que l’entraînement d’alignement compresse la dispersion des réponses : sur 10 000 paires question-répondant de la World Values Survey, le passage du modèle de base Llama 3.1 70B aux checkpoints Tulu 3 supprime la moitié de l’écart-type humain dès l’étape d’instruction tuning (ratio 1,22 → 0,59) pour un gain de précision de 0,9 point, un écart qui se creuse ensuite entre pays occidentaux et reste du monde (arXiv 2609.25760). Autrement dit : optimiser une métrique d’exactitude peut détruire la propriété qu’on prétendait mesurer. Les affirmations de « moitié moins d’erreurs » de cette semaine doivent être lues avec cette grille.
La demande explose, l’offre se concentre
Le troisième étage de la journée est financier. Nscale, qui prépare son introduction en bourse à New York, affiche dans son dossier plus de 103 milliards de dollars de contrats — dont environ 85 % provenant de deux clients : 43,8 milliards avec Microsoft jusqu’en 2033 et 44,6 milliards avec Anthropic (TechCrunch). Le contrat Anthropic est conditionné à l’obtention du financement par Nscale, avec des jalons qualifiés de « stricts » et un droit de sortie.
Ce n’est pas une anomalie isolée : CoreWeave tire 67 % de son revenu de Microsoft, Applied Digital 67 % d’Oracle et 30 % de CoreWeave. La conséquence est directe : les tokens moins chers de cette semaine reposent sur une chaîne d’approvisionnement en calcul dont la solvabilité dépend d’un très petit nombre de signatures. Une baisse de prix peut donc être réelle au niveau de l’API et fragile au niveau de son financement.
Le produit comme lieu de la valeur — et comme angle mort
L’aveu de Meta sur Muse déplace le centre de gravité. Si un agent open source conçu par un développeur isolé devient la référence de conception du produit d’un laboratoire de superintelligence, alors la valeur ne réside plus dans le harness, mais dans ce que Meta prétend y ajouter : « quelque chose comme OpenClaw que nous pourrions rendre sûr, sécurisé, simple à utiliser et passer à l’échelle de milliards de personnes ».
Reste la question que personne n’a traitée le 22 septembre : sûr selon quel critère, et vérifié comment ? Le même jour, la recherche publiait sur les agents des résultats qui vont tous dans le sens d’une exigence de preuve indépendante — KEX-bench, sur lequel les agents de code atteignent des plantages de noyau mais échouent à en faire des primitives d’exploitation exploitables, ou les audits de cohérence qui montrent 38 à 74 % de réponses divergentes sur des tâches répétées. La suite de cette analyse est dans nos deux autres articles du jour, consacrés respectivement aux protocoles de mesure et aux points d’admission des agents.
🎯 À retenir
- Le 22 septembre 2026, la frontière s’est disputée sur le prix, pas sur la capacité : GPT-6 Sol et Luna à moitié prix de la série 5.6, Opus 5.5 de 25 à 20 $/million de tokens de sortie, les deux annonces séparées de 90 minutes.
- Les deux baisses viennent de la pile de service (cache, inférence, calcul de service), pas d’un modèle intrinsèquement plus sobre — ce qui transforme la course à la performance en course à l’ingénierie d’exploitation.
- Les gains de fiabilité revendiqués ne sont pas auditables : évaluation interne bâtie sur des erreurs déjà signalées par les utilisateurs d’un côté, évaluateurs externes sans protocoles publiés de l’autre.
- La distribution a changé de camp : Muse numéro un de l’App Store américain, et Meta reconnaît s’être « fortement inspiré comme produit » d’OpenClaw — l’open source devient la référence de conception des produits de frontière.
- Derrière les tokens moins chers, une chaîne de calcul concentrée : 85 % des 103 milliards de contrats de Nscale reposent sur Microsoft et Anthropic, avec des jalons « stricts » comme condition de survie du contrat.
- L’IA de frontière descend dans le téléphone : Qualcomm exécute localement un MoE de 30 milliards de paramètres et un agent vocal complet, Apple en est à 20 milliards — la segmentation entre modèles de laboratoire et modèles embarqués devient une question de prix du composant.