L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
OpenAI a doté la famille GPT-6 d’un système de mise en cache rapide qui réduit jusqu’à 90 % les jetons d’entrée mis en cache, pour les préfixes partagés réutilisés dans une fenêtre de 30 minutes. OpenAI a déclaré le 22 septembre que la réduction s’appliquait aux préfixes partagés éligibles et qu’elle était accompagnée d’un tableau de bord de mise en cache et d’un outil de diagnostic indiquant pourquoi un cache avait manqué.
Il s’agit d’un changement distinct par rapport aux prix catalogue, qu’OpenAI a réduits en réduisant de moitié le prix de l’API de GPT-6 Sol et Luna. La mise en cache consiste à réutiliser les calculs entre des requêtes qui contiennent les mêmes instructions, définitions d’outils et contexte antérieur, de sorte que les deux s’empilent plutôt que de se remplacer.
GPT-6 est conçu pour les agents qui travaillent pendant des heures, de la refactorisation des bases de code à la production de documents recherchés, et OpenAI affirme que les applications derrière eux effectuent une série de requêtes API qui s’appuient les unes sur les autres. Des taux de réussite plus élevés par défaut sont l’objectif déclaré, et des réponses plus rapides constituent l’autre moitié de l’avantage.
Un tableau de bord montre désormais combien est sorti du cache
Le nouveau tableau de bord de mise en cache d’invite indique la quantité d’entrées d’une application provenant du cache, avec des taux de réussite au fil du temps et un graphique de composition des entrées qui compare les jetons mis en cache et non mis en cache. L’exemple de tableau de bord d’OpenAI montre un taux de réussite de 41,7 %, avec 1 300 milliards de jetons lus en cache contre 1 400 milliards non mis en cache.
Un outil de diagnostic distinct gère les échecs. Il compare une requête avec une réponse récente pour identifier les modifications apportées au modèle, aux outils, aux paramètres ou à l’entrée qui ont empêché la réutilisation, et renvoie une raison et un nombre de jetons, par exemple un cache_miss avec la raison tools_changed et 5 629 jetons qui auraient pu être réutilisés.
Les développeurs rapportent des taux de réussite dans les années 80 et 90
Quatre clients sont cités dans l’annonce, et les chiffres qu’ils donnent sont les leurs. Mario Rodriguez, directeur produit de GitHub, affirme que la mise en cache des invites joue un rôle essentiel en aidant GitHub Copilot à offrir des expériences rapides et efficaces à grande échelle : « Au cours des derniers mois, nous avons réduit de plus de 50 % la part des jetons d’invite nécessitant un nouveau traitement sur des milliards de requêtes adressées aux modèles OpenAI, par rapport à notre référence précédente.
Bin Fan, responsable de l’équipe d’agent sur l’agent Manus, décrit le passage à un mélange de mise en cache explicite et automatique : « En moins d’une semaine, le taux de réussite du cache de notre modèle OpenAI est passé d’environ 85 % à systématiquement au-dessus de 90 %, réduisant encore davantage les coûts d’inférence en production. »
Les deux autres citations sont les plus spécifiques. Eugene Mikhantyev, ingénieur en IA, affirme que les taux de réussite du cache dans les évaluations de son équipe sont passés de 83 % à 91 % en moins d’une semaine, que les écritures du cache ont chuté d’environ deux tiers et les coûts d’inférence de 36 %, tandis que le directeur de la technologie, Arian Hanifi, affirme que le tableau de bord et les diagnostics ont amélioré les taux de réussite de quelques points de pourcentage, réduisant ainsi les coûts de 20 %.
Quatre contrôles décident de ce qui reste dans le cache
Les points d’arrêt de cache explicites permettent au développeur de choisir les préfixes d’invite à réutiliser. Sur les modèles GPT-6, l’effort de raisonnement peut désormais être modifié entre les réponses sans casser le cache, en ajoutant une configuration_update tout en laissant l’effort de raisonnement au niveau de la requête inchangé.
Les deux autres concernent la discipline. OpenAI conseille de conserver les définitions d’outils, les schémas et l’ordre stables et d’utiliser Allowed_tools ou tool_choice défini sur none, au lieu de supprimer les définitions d’outils, et suggère de préchauffer les instructions partagées et le matériel de référence au démarrage afin que le travail ait lieu avant l’arrivée de la première question.
OpenAI ne fixe aucun prix par jeton sur tout cela, et chaque économie indiquée appartient au client qui l’a signalée.