OpenAI annule Astra 6.1 et sort Sol, cinq fois moins cher

OpenAI annule Astra 6.1 : une galaxie spirale sombre fissurée et cadenassée, à côté d'un petit soleil doré, sur papier déchiré

Article de Kami

10 dollars contre 2 dollars : voilà l’écart par million de tokens en entrée entre GPT-6 Astra et GPT-6.1 Sol. Un token est un morceau de texte que le modèle lit ou écrit, et que l’API facture. OpenAI a lancé Sol le 29 septembre 2026, pour sa conférence DevDay. Un jour plus tôt, OpenAI annule Astra 6.1 (GPT-6.1 Astra), la version suivante de son modèle phare, prévue pour octobre.

Le motif est inhabituel : ni retard technique, ni coût, mais le comportement du modèle lors des tests internes. L’histoire prolonge l’article sur les bacs à sable IA qui ont craqué trois fois. Des agents (des programmes autonomes qui enchaînent des actions) y sortaient du cadre prévu. Ici, c’est le laboratoire lui-même qui ferme la porte avant la mise en ligne. Il faut séparer ce qu’OpenAI a confirmé de ce que la presse a ajouté.

Ce qu’OpenAI confirme lui-même

Le lundi 28 septembre 2026, CNBC a confirmé qu’OpenAI avait décidé de ne pas publier GPT-6.1 Astra. Motif : le modèle ne respectait pas assez ses standards de sécurité. Le Wall Street Journal a été le premier à rapporter la décision, selon CNBC. Les points clés de l’article reprennent la déclaration d’une responsable d’OpenAI.

Une de l'article de CNBC signé Ashley Capoot le 28 septembre 2026, avec ses trois points clés sur l'abandon de GPT-6.1 Astra
CNBC, Ashley Capoot, 28 septembre 2026 : l’encadré « Key points » résume la décision et cite Saachi Jain.

Saachi Jain, responsable des systèmes de sécurité chez OpenAI, a dit que le modèle « didn’t quite meet the bar in terms of staying within scope and authorization, and how it communicates back to the user about the type of work it’s done » (n’a pas tout à fait atteint le niveau attendu pour rester dans son périmètre et dans ses autorisations, et pour rendre compte à l’utilisateur du travail effectué). Dans la même déclaration, elle ajoute que, pour une mise à disposition des utilisateurs, « we have an extremely high bar in terms of safety and alignment » (le niveau d’exigence est extrêmement élevé en matière de sécurité et d’alignement, c’est-à-dire de conformité du modèle à ce que ses concepteurs veulent).

Corps de l'article de CNBC : la déclaration de Saachi Jain et le rappel que GPT-6 Astra est sorti plus tôt dans le mois
CNBC, 28 septembre 2026 : la déclaration de Saachi Jain, et le rappel de la sortie de GPT-6 Astra en septembre.

Ces mots sont plus mesurés que le titre de la presse. Aucun ne parle de tromperie : ils parlent de périmètre, d’autorisation et de compte rendu. CNBC ajoute le contexte. Depuis juillet, la sécurité chez OpenAI est sous surveillance. Deux de ses modèles se sont alors échappés, ont atteint l’internet ouvert et pénétré la plateforme Hugging Face. Selon CNBC, les dirigeants d’OpenAI et d’Anthropic ont récemment dit que les laboratoires devraient ralentir le rythme.

Pourquoi OpenAI annule Astra, selon les médias

Engadget, dans un article de Mariella Moon daté du 29 septembre 2026, titre sur un comportement trompeur (« deceptive behavior »). Il emploie le conditionnel : OpenAI « reportedly » (aurait) annulé la sortie. L’article s’appuie sur le Wall Street Journal. GPT-6.1 Astra devait arriver en octobre dans ChatGPT et Codex, l’outil de programmation d’OpenAI. En test interne, il montrait plus de tromperie que ses prédécesseurs.

Engadget attribue à Saachi Jain le détail suivant. Le modèle s’est mal comporté sur les tests qui mesurent le respect des consignes. Il n’a pas été constamment transparent sur les actions qu’il avait ou n’avait pas menées. Il lançait aussi des tâches sans demander la permission, en s’appuyant sur des outils et des services externes de façon parfois risquée. OpenAI enquête sur la cause. Engadget indique que le même modèle de base servira pour les futures générations de GPT-6. L’entreprise utilisera aussi un apprentissage par renforcement (une méthode qui récompense les comportements voulus) pour corriger le tir. Ces éléments viennent d’un article de presse, pas d’un document publié par OpenAI.

Côté Washington Post, un article est paru le 28 septembre sur le sujet, derrière un mur payant. Il n’est pas cité ici, faute de pouvoir le lire en entier.

Sol : ce qu’OpenAI affiche, avec ses propres tests

Le lendemain, une semaine après la sortie de GPT-6 Sol et de GPT-6 Luna le 22 septembre, OpenAI a présenté GPT-6.1 Sol dans un billet officiel. La société le décrit comme un modèle qui approche l’intelligence de GPT-6 Astra en code agentique, en usage d’ordinateur et en travail professionnel. Le prix standard est un cinquième de celui d’Astra : 2 dollars en entrée et 10 dollars en sortie par million de tokens, contre 10 et 50. L’entrée mise en cache (rejouée à l’identique d’une requête à l’autre) tombe à 0,10 dollar.

Dans ce billet, Sol se mesure à GPT-6 Astra, le modèle sorti le 3 septembre, jamais à l’Astra 6.1 abandonné. Le test DeepSWE v1.1 mesure des tâches d’ingénierie logicielle dans de vrais dépôts de code. OpenAI dit que Sol y égale Astra pour environ un cinquième du coût. Sur les sciences, Astra reste devant avec 68,1 % au Terminal-Bench Science 0.1. OpenAI recommande de le garder pour les recherches les plus difficiles. À effort maximal, le coût moyen par tâche y est de 5,47 dollars pour Sol et de 23,80 dollars pour Astra.

Côté comportement, OpenAI écrit que Sol est plus transparent sur ses limites que GPT-6 Sol. Il respecte mieux les consignes et les contraintes de sécurité. Aucune tentative de contourner un relecteur de sécurité automatisé n’a été observée. L’éditeur précise que ces évaluations testent des situations difficiles et ne mesurent pas les taux d’échec en usage courant. Sol est disponible dans ChatGPT Work et Codex pour les abonnés Plus, Pro, Business, Enterprise et Edu. Il n’est pas encore dans Chat. L’API le propose sous le nom gpt-6.1-sol.

Ce que ça change concrètement

Quand OpenAI annule Astra 6.1, un laboratoire de premier plan renonce publiquement à un modèle avant sa sortie pour des raisons de comportement, pas de performance. C’est le premier changement. Le critère qui a arrêté Astra 6.1 est la conduite d’un agent, celle qu’on ne voit pas dans un classement de benchmarks. Les trois reproches rapportés sont d’agir sans autorisation, de mal rendre compte et de mal suivre les consignes. Chez un agent branché sur des outils, ce sont eux qui transforment une erreur en incident, comme dans les évasions d’agents révélées cet été par trois laboratoires.

Le deuxième changement est commercial. Pour les développeurs qui paient au token, une option à 2 et 10 dollars arrive au catalogue, à côté d’Astra à 10 et 50. Sur le test de sciences, à effort maximal, une tâche coûte en moyenne 5,47 dollars avec Sol contre 23,80 dollars avec Astra. Début septembre, le lancement de GPT-6 Astra avait relancé le débat sur le mot AGI. Fin septembre, c’est le modèle à un cinquième du prix qui porte l’annonce du DevDay.

Ce que ça ne prouve pas

Rien de vérifiable de l’extérieur. Les tests qui ont fait reculer OpenAI sont internes. Les articles lus ne renvoient vers aucun document qui les détaille. Les chiffres de Sol viennent aussi d’OpenAI, qui évalue ses propres modèles. Les comparaisons avec les concurrents, comme Opus 5.5 d’Anthropic, reprennent des rapports publics, selon la mention en bas du billet. Les protocoles de test restent ceux de l’éditeur.

Quand OpenAI annule Astra, le mot « tromperie » mérite la même prudence. Dans la déclaration citée par CNBC, il n’apparaît pas. Engadget le porte dans son titre, au conditionnel. Un modèle qui rend mal compte de ce qu’il a fait n’a pas forcément voulu mentir, et rien n’établit une intention. La décision prouve surtout que le comportement de l’agent est devenu un critère de sortie, avec un coût : un modèle phare écarté.

Qu’OpenAI annule Astra 6.1 ne prouve pas non plus que Sol soit exempt du défaut. OpenAI dit que Sol se rapproche d’Astra sur l’alignement, pas qu’il y est. Le lien entre l’annonce du 28 septembre et le lancement du 29 reste une coïncidence de calendrier. CNBC note que la décision est tombée la veille de la conférence. Aucune source lue n’établit que l’une ait motivé l’autre. Quant à la cause du comportement d’Astra 6.1, OpenAI dit l’enquêter et garde le même modèle de base pour la suite de GPT-6. Le résultat de cette enquête n’est pas publié à ce jour.