OpenAI affirme que ses propres modèles ont optimisé l’inférence d’Astra Ultrafast sur les GPU Nvidia

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

OpenAI a utilisé ses propres modèles pour régler le logiciel d’inférence qui sert GPT-6 Astra Ultrafast sur le matériel Nvidia, ont déclaré officiellement deux de ses dirigeants dans un article publié par Nvidia le 1er octobre. « Nous avons utilisé nos modèles internes pour optimiser l’inférence sur les GPU NVIDIA, et la programmabilité de NVIDIA nous a aidés à fournir l’accélération derrière Astra Ultrafast », a déclaré Uday Ruddarraju, directeur de la technologie de calcul chez OpenAI.

Ultrafast est le niveau de service rapide pour GPT-6 Astra. Nvidia affirme qu’il « offre une génération de jetons jusqu’à 8 fois plus rapide que le mode Astra Standard », fonctionne sur les GPU Nvidia Blackwell et est « disponible dès maintenant dans l’API OpenAI et pour les utilisateurs ChatGPT Work et Codex éligibles ».

Le 8x est un chiffre du fournisseur pour une seule chose

Ce numéro est celui de Nvidia, publié sur le propre blog de Nvidia par Dion Harris, et il couvre la génération de jetons plutôt que le temps nécessaire à une requête de bout en bout. Aucun benchmark, invite, taille de modèle ou configuration de lot n’est fourni avec, Nvidia ne dit pas sur quelle partie Blackwell la comparaison a été exécutée, et le « jusqu’à » fait le travail habituel. L’illustration de Nvidia pour le message montre une exécution standard à 17,0 secondes contre 6,4 secondes pour Ultrafast, ce qui n’est pas le chiffre 8x et n’est accompagnée d’aucune description de la tâche.

La propre description d’OpenAI est plus étroite et utile. Son entrée du journal des modifications de l’API du 29 septembre indique que le niveau existe « pour réduire le temps entre les jetons de sortie générés », qui est l’écart entre les mots apparaissant plutôt que l’attente avant le premier.

Le prix a déjà été fixé : Ultrafast coûte 300 $ par million de jetons de sortie, soit six fois le tarif standard, de sorte que la vitesse est achetée plutôt que cédée.

Ce que les ingénieurs d’OpenAI affirment que leurs modèles ont fait

Philippe Tillet, responsable de l’inférence chez OpenAI, met le travail sur les GPU eux-mêmes. « L’investissement profond de NVIDIA dans les outils et la documentation nous a permis de rendre nos modèles exceptionnellement performants dans la programmation des GPU Blackwell et Rubin », dit-il, ajoutant qu' »Astra peut transformer ces connaissances en noyaux hautes performances qui rendent le matériel NVIDIA convaincant sur toute la frontière de la latence, du débit et du coût ».

La vision de Nvidia est que « OpenAI utilise ses propres modèles pour aider à affiner le logiciel d’inférence fonctionnant sur les GPU NVIDIA, en tirant parti de la programmabilité de la plate-forme pour tester et mettre en œuvre des améliorations », et que le travail se poursuit après le déploiement d’un modèle.

Les deux citations concernent la pile d’inférence d’une entreprise sur les accélérateurs d’un fournisseur, d’après ce que Tillet attribue aux outils et à la documentation de Nvidia. Ni l’un ni l’autre ne dit quoi que ce soit sur la part de la pile qui a été écrite de cette façon, sur la façon dont la sortie a été examinée ou sur la part de l’accélération qui en est venue plutôt que du matériel, et personne en dehors des deux sociétés n’a mesuré quoi que ce soit.

Qui peut réellement atteindre le niveau ?

Pour les développeurs, Ultrafast est le modèle « gpt-6-astra » appelé avec un niveau de service « ultrarapide » dans l’API Responses, et OpenAI indique qu’il est « disponible pour les clients de l’API, sous réserve de limites de débit, avec un traitement mondial et une résidence des données aux États-Unis. L’UE et d’autres résidences d’inférence régionales ne sont pas prises en charge ». Une équipe en Allemagne qui a besoin d’inférence pour rester dans l’UE n’en bénéficie donc pas, quelle que soit la vitesse de génération. Nvidia ajoute un cas pratique : une génération plus rapide « peut raccourcir les cycles d’édition-test-débogage des agents de codage » et réduire l’attente entre les appels d’outils, c’est là qu’un développeur remarquerait la différence plutôt que dans une seule réponse.

Tillet nomme Rubin, la génération de Nvidia après Blackwell, à ses côtés, bien que Nvidia ne nomme que Blackwell comme servant Ultrafast. Aucune des deux sociétés n’a publié le test derrière le 8x, et OpenAI n’a pas précisé si le même travail d’optimisation écrit par modèle alimentait ses niveaux moins chers.