L’API Agents d’OpenAI obtient un navigateur hébergé et une approbation couvre l’ensemble d’un site

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

OpenAI a ajouté l’utilisation d’un ordinateur à son API Agents le 29 septembre, de sorte qu’un agent peut désormais travailler via un navigateur hébergé par OpenAI, et le navigateur demande à l’utilisateur d’approuver chaque nouveau site Web qu’il visite. Ce que cette approbation ne couvre pas est expliqué dans le propre guide d’OpenAI : « L’approbation de l’origine n’impose pas la confirmation avant les actions individuelles ».

L’entrée du journal des modifications de l’API du 29 septembre se lit comme suit : « Ajout de l’utilisation de l’ordinateur à l’API des agents. Les agents peuvent effectuer des tâches dans un navigateur hébergé par OpenAI, avec les approbations d’accès au site Web et la connexion gérées par votre application. » Il s’agit de l’API du développeur, pas du mode agent dans ChatGPT, et les exemples s’exécutent sur le modèle GPT-6 Astra.

L’approbation se fait par site Web et non par clic

Le modèle d’autorisation est étroit et clairement énoncé. « Le navigateur nécessite l’approbation de l’utilisateur avant d’accéder à chaque nouveau site Web d’origine, y compris les sites Web publics », indique le guide. « L’activation de l’accès au réseau n’approuve pas ces demandes. »

Chaque demande arrive sous la forme d’une entrée Computer_use_approval_request lorsque la session déclenche un événement agent.session.requires_action et que l’application répond par approuver, refuser ou annuler. Une fois qu’une origine est approuvée, l’agent y travaille sans revenir pour une autre décision.

OpenAI explique ce que cela laisse au développeur : « Si votre application doit garantir une confirmation avant les achats, les modifications destructrices ou d’autres actions consécutives, limitez le navigateur hébergé aux ressources qui ne peuvent pas les exécuter, ou utilisez un environnement d’exécution de navigateur que vous contrôlez. La demande de confirmation via un outil de fonction repose sur l’agent qui appelle cette fonction.  » La garantie est le travail de l’application, pas celui de l’API.

Il est également demandé aux développeurs de « traiter le contenu du site Web comme non fiable », car le contenu « ne peut pas accorder d’autorisation ni ignorer les instructions de l’utilisateur ». Il s’agit de la défense standard contre une page demandant à un agent de faire quelque chose que son utilisateur n’a pas demandé.

La connexion s’arrête aux clés d’accès

Les tâches derrière une connexion sont gérées par l’application, qui crée son propre écran de connexion à partir des champs et des méthodes de connexion contenues dans la demande. « Ce flux prend en charge les adresses e-mail, les mots de passe et les codes de vérification, mais pas les clés d’accès ou la connexion par code QR », indique le guide. « Les sites qui nécessitent une méthode non prise en charge ne peuvent pas se connecter via ce flux. »

Il y a une deuxième limite quant à savoir qui peut demander. « Seul l’agent principal peut demander l’authentification du navigateur ; les sous-agents ne le peuvent pas », écrit OpenAI, de sorte qu’une exécution multi-agents ne peut pas demander à un agent assistant de demander un mot de passe à l’utilisateur.

Les informations d’identification sont renvoyées dans une seule soumission avec des plafonds documentés : jusqu’à six valeurs de champ, chaque champ une fois, des valeurs allant jusqu’à 16 384 caractères et une charge utile sérialisée qui doit tenir dans 120 Ko. Les captures d’écran du navigateur sont facultatives par session via include_screenshots, et OpenAI prévient qu’elles « peuvent contenir des données sensibles de page ou de compte. Montrez-les uniquement aux utilisateurs autorisés et gardez-les hors des journaux d’application ».

L’API Agents est toujours derrière un en-tête bêta

Les opérations du navigateur sont enregistrées en tant qu’éléments de session qu’une application peut rejouer par la suite, et le guide couvre la récupération de la même session si la connexion est interrompue en cours de tâche. Il ne donne aucun prix pour une session de navigateur hébergée, aucune région et aucune limite de débit, et l’API Agents nécessite toujours l’en-tête OpenAI-Beta: agents=v1 sur le point de terminaison api.openai.com/v1/agents/sessions.

Les agents de navigateur ont déjà produit leurs propres rapports d’incidents d’OpenAI, y compris le cas où ses agents ont téléchargé des images d’utilisateurs sur des sites d’hébergement d’images dans 53 cas. L’utilisation de l’ordinateur dans l’API Agents était l’un des 25 éléments du récapitulatif du DevDay 2026 d’OpenAI, publié le 29 septembre.