OpenAI réduit de moitié les prix des API GPT-6 Sol et Luna et affirme que Sol bat Opus 5 à 9 % du coût

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

OpenAI a réduit le prix de l’API de GPT-6 Sol à 2 $ par million de jetons d’entrée et à 10 $ par million de sortie, et de GPT-6 Luna à 0,10 $ et 0,50 $. Sur sa propre exécution d’AutomationBench, OpenAI indique que Sol, à son niveau d’effort le plus élevé, obtient un score de 33,2 % à 0,27 $ par tâche, contre Claude Opus 5 à 26,9 % et 11,1 fois le coût par tâche de Sol.

OpenAI appelle cela une réduction de 50 %, mesurée par rapport aux prix promotionnels de GPT-5.6, qui est sa propre formulation. Les deux modèles ont été mis en ligne le 22 septembre et sont appelés gpt-6-sol et gpt-6-luna dans l’API.

Chaque numéro de référence ici est la propre exécution d’OpenAI

OpenAI a effectué les tests lui-même et a pris les scores des concurrents « à partir de rapports accessibles au public », en utilisant les chiffres de Claude Fable 5 là où les chiffres de Fable 5.1 n’étaient pas disponibles. La colonne du coût par tâche constitue la partie honnête de la comparaison, car c’est la seule qui correspond au prix plutôt qu’à la capacité.

Claude Fable 5.1 avec un repli Opus 5 obtient un score de 31,4 % sur AutomationBench 1.0.6, en dessous des 33,2 % de Sol et à plus de 8,9 fois le coût par tâche. OpenAI note que ce chiffre sous-estime le coût réel de Fable, car il laisse de côté les solutions de secours de l’Opus 5, qui se déclenchent sur environ 40 % des tâches.

Sur DeepSWE v1.1, Sol à l’effort maximum obtient un score de 68,8 %, à moins de 1,1 point du meilleur de 69,9 % de Claude Fable 5, pour un coût par tâche environ 80 % inférieur. Luna y obtient un score de 66,6 %, ce qu’OpenAI met à 93 % de moins par tâche que l’Opus 5 et 96 % de moins que Fable 5.

Sur l’ensemble hors ligne d’OSWorld 2.0, Sol à son effort le plus élevé atterrit à 60,5 % contre Opus 5 à un effort moyen à 60,3 %, encore une fois à un coût par tâche inférieur d’environ 80 %. Sur Agents’ Last Exam V1, qui couvre 55 sous-secteurs, Sol à l’effort maximum obtient un score de 56,4 %, ce qui, selon OpenAI, bat le meilleur score de l’Opus 5 dans cette évaluation avec un coût par tâche inférieur de 60 %.

Claude Opus 5.5, qui a sous-coté l’Opus 5 à 4 $ par million de jetons le même jour, n’apparaît dans aucun des tableaux. Anthropic note ses propres modèles de la même manière et a obtenu un score Opus 5,5 de 66,4 % sur Terminal-Bench lors d’un test qu’il a lui-même effectué.

ChatGPT Chat ne reçoit pas les nouveaux modèles

Sol et Luna sont arrivés dans ChatGPT Work et Codex le 22 septembre pour les utilisateurs Plus, Pro, Business, Enterprise et Edu, et les utilisateurs Free and Go obtiennent Luna dans l’application de bureau. OpenAI indique qu’ils « ne sont pas encore disponibles dans Chat », de sorte que le modèle derrière les conversations ChatGPT quotidiennes n’a pas changé.

OpenAI affirme également que Sol commet environ deux fois moins d’erreurs que son prédécesseur lors d’une évaluation interne de la réalité construite à partir de conversations anonymisées au cours desquelles les utilisateurs avaient signalé une erreur. Les deux modèles héritent du style de communication OpenAI introduit avec Astra : « plus de clarté, moins de jargon, moins de tournures de phrases étranges, moins de détails de faible valeur ».

Les développeurs sur des points de terminaison beaucoup plus anciens ont une date limite distincte. Les modèles gpt-3.5-turbo-instruct, babbage-002, davinci-002 et gpt-3.5-turbo-1106 ont été arrêtés le 28 septembre, avec gpt-5.6-terra comme remplacement recommandé, un retrait d’OpenAI annoncé le 26 septembre 2025.

Un certain nombre de bénévoles d’OpenAI placent la baisse de prix dans son contexte : évalué aux prix de l’API, l’utilisation quotidienne des jetons au sein de l’entreprise a dépassé 600 $ pour le chercheur médian et 7 000 $ au 90e centile. Sol n’est pas non plus le haut de gamme. GPT-6 Astra à faible effort obtient un score de 30,3 % sur AutomationBench, en dessous de Sol, à 3,9 fois le coût par tâche, et OpenAI considère toujours Astra comme son meilleur modèle pour une utilisation informatique.