L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
OpenAI a demandé aux développeurs d’abandonner ses modèles de synthèse vocale d’ici le 6 janvier 2027 et a nommé gpt-realtime-2.1-mini en remplacement, mais la propre documentation de ce modèle marque le point final de parole comme indisponible. Son tableau de points de terminaison indique « Génération vocale | v1/audio/speech | Non pris en charge », lu à 21h32 UTC le 7 octobre sur la page modèle d’OpenAI pour gpt-realtime-2.1-mini.
L’avis de dépréciation est sans ambiguïté quant à l’endroit où il pointe. tts-1, tts-1-hd, gpt-4o-mini-tts-2025-03-20 et gpt-4o-mini-tts-2025-12-15 « sont obsolètes et seront supprimés de l’API le 6 janvier 2027 », indique la page des dépréciations d’OpenAI, et chacune des quatre lignes nomme gpt-realtime-2.1-mini comme remplacement recommandé. La date elle-même est tombée le 1er octobre et dix autres dates d’arrêt d’OpenAI s’étendent jusqu’en 2027.
Le remplacement répond sur un autre point de terminaison
Les quatre modèles retirés répertorient v1/audio/speech comme étant pris en charge. La page tts-1 et la page gpt-4o-mini-tts portent toutes deux cette ligne, et toutes deux ont été lues à 21h32 UTC le 7 octobre.
Le remplacement produit du son, mais pas là. OpenAI décrit gpt-realtime-2.1-mini comme « un modèle de raisonnement distillé pour des interactions vocales en temps réel plus rapides et moins coûteuses » qui prend l’audio et le texte « via des connexions WebRTC, WebSocket ou SIP », avec du texte et de l’audio parmi ses modalités de sortie. Parmi les 18 points de terminaison répertoriés sur sa page, v1/realtime est le seul marqué pris en charge.
Les prix sont publiés en unités qui ne s’alignent pas. tts-1 est répertorié à 15 $ par million de caractères, gpt-4o-mini-tts à 0,6 $ par million de jetons d’entrée de texte et 12 $ par million de jetons de sortie audio, et gpt-realtime-2.1-mini à 10 $ par million de jetons d’entrée audio et 20 $ par million de jetons de sortie audio.
Les deux modèles sont construits selon des formes différentes. gpt-4o-mini-tts prend du texte et diffuse de l’audio, avec un maximum de 2 000 jetons d’entrée, tandis que gpt-realtime-2.1-mini comporte une fenêtre contextuelle de 128 000 jetons, 32 000 jetons de sortie maximum et une limite de connaissances au 30 septembre 2024. L’avis de dépréciation envoie les développeurs au guide de l’API en temps réel « pour planifier votre migration ».
Le guide recommande toujours un modèle sur la liste d’arrêt
Le guide de synthèse vocale d’OpenAI ne comporte aucun avis de dépréciation d’aucune sorte. Il indique toujours : « Pour les applications intelligentes en temps réel, utilisez le modèle gpt-4o-mini-tts, notre modèle de synthèse vocale le plus récent et le plus fiable », et « Nos autres modèles de synthèse vocale sont tts-1 et tts-1-hd ».
Ce sont les mêmes modèles avec les dates de janvier dessus. gpt-4o-mini-tts est un alias dont l’instantané par défaut est gpt-4o-mini-tts-2025-12-15, et les deux seuls instantanés qu’il propose, celui-là et gpt-4o-mini-tts-2025-03-20, sont tous deux dans la table d’arrêt. Aucune des quatre pages modèles ne présente de bannière de dépréciation.
Un guide donne deux comptes de voix
Le même guide évalue le nombre de voix intégrées à 11 à un endroit et à 13 à un autre. Il en nomme 13 : alliage, frêne, ballade, corail, écho, fable, nova, onyx, sauge, miroitement, vers, marin et cèdre, le marin ou le cèdre étant recommandé « pour la meilleure qualité ».
La prise en charge vocale n’est pas non plus uniforme sur tous les modèles retirés. tts-1 et tts-1-hd prennent un ensemble de neuf, en laissant de côté la ballade, le vers, le marin et le cèdre. OpenAI note également que l’API Realtime, qui héberge le modèle de remplacement, propose à nouveau un ensemble de voix légèrement différent.
Ainsi, la documentation dit désormais trois choses à la fois : les quatre modèles pouvant appeler v1/audio/speech vont le 6 janvier 2027, le modèle nommé pour les remplacer ne peut pas l’appeler, et le guide couvrant tout cela recommande toujours l’un des quatre comme option la plus récente. OpenAI n’a publié aucune correction sur aucune des pages, dont chacune a été lue le 7 octobre entre 21h32 et 21h33 UTC.