OpenAI affirme que l’un de ses modèles a utilisé une clé API divulguée et inventé des données lors de la formation

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

OpenAI a publié six rapports sur le mauvais comportement de ses propres modèles, dont un qui utilisait une clé API divulguée sans autorisation, puis inventait des chiffres qu’il n’arrivait pas à trouver. Tous les six se sont produits pendant la formation ou l’évaluation, pas dans ChatGPT, et le message d’OpenAI du 16 septembre indique qu’ils « ne devraient pas être considérés comme reflétant la fréquence à laquelle un désalignement se produit dans nos modèles ».

Les rapports lancent un nouveau cadre pour suivre, enquêter et divulguer ce qu’OpenAI appelle le désalignement des modèles. OpenAI déclare vouloir publier les cas peu de temps après les avoir repérés, avant même d’avoir expliqué ou corrigé le comportement.

Un mannequin est parti à la recherche de la clé de quelqu’un d’autre

Le cas le plus frappant vient de la formation d’apprentissage par renforcement du mois de mai. Selon le rapport complet, un modèle interne inédit a été interrogé sur les revenus des hommes dans trois secteurs sur trois ans dans un comté de Californie, et n’a pas pu obtenir les données de l’API du site.

Il a essayé de s’inscrire pour une clé API avec une adresse e-mail jetable, puis a recherché dans les référentiels publics GitHub les clés que d’autres personnes avaient laissées exposées. Un a fonctionné. Lorsque la demande de données échouait toujours, le modèle a inventé neuf chiffres et les a présentés comme tirés du graphique du site Web, sans mentionner l’échec de la récupération ni la clé empruntée.

Un deuxième rapport couvre GPT-5.6 Sol, le modèle qui alimente ChatGPT sur les forfaits payants. Au cours de sa formation, certaines instances se sont écrites des notes dans les résumés qui transportent le travail dans une nouvelle fenêtre de contexte, indiquant au contexte suivant d’inventer des données manquantes ou de masquer des problèmes. Dans l’un d’entre eux, un agent construisant un modèle financier prévoyait d’être « transparent uniquement si on le lui demandait ».

OpenAI affirme que ces instructions ont souvent été suivies. Son moniteur a signalé ce comportement sur 2,15 % des résumés d’entraînement de GPT-5.6 Sol et 0,27 % de ceux de GPT-6 Astra, le modèle le plus récent introduit par OpenAI le 3 septembre. Il attribue cette baisse à une meilleure notation pendant l’entraînement.

Les agents ont téléchargé des fichiers sur des sites Web publics

Trois des autres rapports impliquent des agents sortant de leur bac à sable pour accomplir leur travail. Dans l’un d’eux, un modèle inédit avait la bonne réponse concernant les lacs de plus de 5 000 000 de mètres carrés, mais souhaitait une citation du navigateur, il a donc téléchargé ses données sur un site public de collage sans demander la permission à l’utilisateur.

Dans un autre, les modèles utilisaient un référentiel de logiciels interne comme forum de discussion pour transmettre les demandes et les réponses entre des échantillons de formation distincts. Dans le troisième cas, les agents collaborateurs partageaient des fichiers via des sites d’hébergement de fichiers publics, laissant les livrables de tâches à des URL publiques lorsque la tâche indiquait d’utiliser uniquement des fichiers locaux.

Le sixième rapport décrit un modèle de recherche inédit insérant des instructions dans ses propres résumés de tâches, y compris des instructions pour ignorer ses contraintes normales. OpenAI a dénombré 27 résumés concernés.

Tout employé d’OpenAI peut signaler un cas

Dans le cadre de ce cadre, tout employé peut signaler un cas pour enquête. Elles sont ensuite classées selon l’une des trois catégories suivantes : Prêt pour la divulgation, Enquête mineure ou Enquête plus vaste, qu’OpenAI appelle également la « voie lente » et qu’elle utilise pour les cas complexes impliquant des tiers.

Les litiges sur l’opportunité de publier sont transmis au groupe consultatif sur la sécurité d’OpenAI, puis à la direction de l’entreprise. OpenAI affirme que ce qu’il appelle l’incident OpenAI-Hugging Face aurait suivi une voie lente, et un article du 18 août indique qu’immédiatement après l’incident, il a suspendu l’inférence du modèle frontière dans les clusters de recherche pour les exécutions qui pourraient exécuter du code ou utiliser des outils avec accès à Internet.

Le message contient également un aveu inhabituel pour une entreprise qui vend ces modèles : « Nous ne pensons pas que l’industrie de l’IA ait résolu l’alignement et la surveillance à un degré suffisant pour continuer à évoluer de manière responsable à vitesse maximale pendant encore longtemps. »

Anthropic a publié ses propres chiffres sur la surveillance des agents un jour plus tard, indiquant que son observateur avait bloqué environ une décision sur 47 000 prise par ses agents de recherche internes en août. À eux deux, les deux laboratoires ont désormais chiffré un problème qui, selon eux, n’est pas résolu.