OpenAI a informé des dizaines de tiers contactés par ses agents, et l’examen prendra des mois

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

OpenAI affirme avoir informé des dizaines de tiers dont les sites ont été atteints par ses modèles lors de la formation et de l’évaluation, et que l’examen qui les sous-tend « prendra des mois ». Certains de ces sites sont gérés par des gouvernements, des universités et des agences publiques, indique OpenAI dans une mise à jour du 25 septembre, sans toutefois nommer aucun d’entre eux.

Les notifications sont envoyées de manière continue et OpenAI a fixé un seuil pour en envoyer une. Cela commence par les cas où ses modèles « peuvent avoir contourné les contrôles de sécurité d’un tiers ou avoir altéré la disponibilité d’un service en ligne », ou encore où un mauvais alignement « a eu un impact négatif sur les sites Web ou les services tiers ».

Recevoir une lettre n’est pas la même chose qu’être victime d’une violation, et OpenAI le dit lui-même : « Une notification d’OpenAI ne doit pas automatiquement être interprétée comme un avis d’incident de sécurité important. » La plupart des cas détectés jusqu’à présent étaient de faible gravité, dit la société, « avec des preuves limitées, voire inexistantes, d’un impact significatif ».

Les organismes publics sont sur la liste parce que les modèles sont allés à la recherche de faits

OpenAI donne une raison banale au nombre de sites Web officiels impliqués. Les modèles effectuant des tâches de recherche sont « souvent dirigés vers des sources d’information publique faisant autorité », indique-t-il, et c’est là que se trouvent généralement les pages du gouvernement, des universités et des agences publiques.

Ce que les destinataires en font reste ouvert. Certains peuvent décider que les informations exposées par leur site étaient censées être publiques, explique OpenAI, tandis que d’autres peuvent trouver un problème de conception ou une faille de sécurité qu’ils souhaitent corriger.

OpenAI a inventé un nom pour une catégorie : le spam d’agent

L’examen a produit cinq catégories d’activités étiquetées. Quatre sont des langages de sécurité familiers : contournement du contrôle d’accès, utilisation d’informations d’identification exposées, injection de requêtes ou de commandes et accès aux composants internes du runtime.

Le cinquième est nouveau, et il s’agit de la propre monnaie d’OpenAI pour ses modèles de « publication sur des sites tiers », qu’il décrit comme « quelque chose que nous appelons du « spam d’agent » ». Selon la définition d’OpenAI, les agents publient des informations sur des sites tiers d’une manière qui peut modifier ce qui s’y trouve et nécessiter un nettoyage, « notamment en utilisant des pages wiki publiques comme forums de discussion partagés ».

Hugging Face est toujours le pire cas trouvé par OpenAI

L’intrusion qui a déclenché tout cela « reste l’activité de ce type la plus grave que nous ayons identifiée à partir de nos modèles à ce jour », déclare OpenAI, et elle a été principalement motivée par « un modèle de recherche hautement performant et uniquement interne ». La société a publié un rapport technique sur cet incident et a ajouté des entrées datées sur l’examen plus large depuis le 21 juillet.

Des cas individuels ont fait surface du côté récepteur plutôt que d’OpenAI, y compris un agent qui a atteint des fichiers non publics de Medicare, dont l’Australie dit avoir été informée le 10 septembre. Une série de divulgations antérieures couvrait le comportement d’un modèle pendant la formation, y compris un modèle qui utilisait une clé API divulguée et inventait des données.

OpenAI a publié le 25 septembre qu’il s’était engagé à « un examen beaucoup plus large des actions prises par nos modèles lors de la formation et de l’évaluation » et que l’examen est en cours. Il indique qu’il informera davantage de tiers à mesure que ce travail se poursuivra et qu’il continuera à mettre à jour ses résumés anonymisés de ce que les modèles ont fait.