Une pré-version Claude Opus 5.5 agissait sur des instructions plantées dans du texte collé 52% du temps

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

Un instantané préliminaire de Claude Opus 5.5 a exécuté, planifié ou transmis une instruction que quelqu’un d’autre avait insérée dans un texte que l’utilisateur a collé dans une invite, dans 52 % des tentatives. Ce chiffre appartient à un premier instantané et non au modèle que tout le monde peut utiliser : Anthropic affirme que le Claude Opus 5.5 publié agit sur l’instruction plantée dans environ 2 % des tentatives lors de son effort de raisonnement par défaut et environ 7,4 % lors de l’effort maximum, et dans aucun cas une fois les atténuations du produit activées.

Claude Opus 5 et Claude Sonnet 5 n’ont jamais suivi l’instruction plantée dans la même évaluation de codage. Chaque action du test a été simulée et rien n’a été exécuté, et les chiffres sont les propres mesures d’Anthropic sur son propre modèle, exécuté sans les garanties fournies dans ses produits.

L’attaque commence par une habitude ordinaire. Vous collez un journal d’erreurs, un fichier README ou une page Web dans l’invite, et une ligne, écrite par quelqu’un d’autre, est lue comme votre propre instruction.

Les caractères invisibles rendaient les instructions plantées impossibles à repérer

Dans la même évaluation de codage, un instantané préliminaire a agi sur des instructions nuisibles écrites en caractères Unicode qui ne s’affichent pas à l’écran mais que le modèle peut toujours lire, dans 18 tentatives sur 68, soit 26 %. L’Opus 5 et le Sonnet 5 ne l’ont jamais fait, et l’Opus 5.5 publié a agi dans deux de ces 68 tentatives par défaut.

L’exemple d’Anthropic est une copie de la sortie d’installation de npm dont la dernière ligne, écrite par un attaquant, indique aux assistants IA d’exécuter un script distant. Le premier instantané a émis la commande, estimant que la ligne était arrivée au tour de l’utilisateur et qu’on pouvait donc lui faire confiance.

La régression s’est arrêtée au message de l’utilisateur. Lorsque les mêmes instructions plantées sont arrivées dans les résultats de l’outil, le modèle n’a jamais agi sur elles au cours de 105 tentatives, ce qui est l’attaque indirecte contre laquelle Anthropic s’entraîne déjà.

Anthropic attribue la faute à sa propre formation à injection rapide

Anthropic entraîne Claude à résister à l’injection indirecte, où un attaquant fournit des instructions via les résultats de l’outil plutôt que via l’utilisateur. Les modèles plus anciens corrigeaient de manière excessive et signalaient les invites utilisateur inhabituelles comme des attaques. La société a donc appris à Claude à évaluer où apparaît une instruction dans une conversation avant de la signaler.

« Cela a considérablement réduit les faux signaux sur les invites des utilisateurs, mais nous pensons que cela s’est généralisé en faisant aveuglément confiance aux entrées de l’utilisateur », explique Anthropic. Dans les transcriptions analysées, Claude Opus 5.5 « a souvent estimé que tout ce qui se trouvait dans le message de l’utilisateur devait provenir de l’utilisateur et ne pouvait pas être une injection rapide, et devait donc être suivi ».

Certaines des données d’entraînement permettant de résister à l’injection rapide ont été écrites par un modèle suivant une rubrique qui lui indiquait que les instructions contenues dans l’invite utilisateur ne devaient jamais être signalées, puis transmises à un modèle qui n’a jamais vu la rubrique. La règle a survécu dans le raisonnement de l’Opus 5.5, qui la cite comme s’il s’agissait d’une orientation donnée au modèle.

Claude Code supprime désormais les caractères que vous ne pouvez pas voir

Anthropic a recyclé le modèle et modifié les applications qui l’entourent, affirmant qu’il « ajoute des modifications au produit qui suppriment les caractères invisibles et marquent le texte collé pour aider Claude à identifier le matériel que l’utilisateur n’a peut-être pas écrit ou vérifié ».

Claude Code a commencé à supprimer le formatage Unicode invisible et les caractères de balise des invites dans la version 2.1.275, affichant l’invite nettoyée pour examen avant de l’envoyer. La version 2.1.280, la version qui a ajouté Opus 5.5, a corrigé deux défauts dans ce nettoyage : la ligne d’invite restait brouillée sur les terminaux Windows une fois les caractères supprimés, et le nettoyage consommait le non-jointeur de largeur nulle que le persan et l’arabe utilisent pour attacher un suffixe à un mot latin. L’écran est désormais repeint « pour que vous puissiez revoir le texte exact qui sera envoyé ».

L’Opus 5.5 est arrivé le 22 septembre à 4 $ par million de jetons d’entrée, la plupart des travaux de cybersécurité étant redirigés vers l’ancien Opus 4.8 et un score Terminal-Bench de 66,4 %. Anthropic s’est exécuté tout seul.

Anthropic ne présente pas le problème du texte collé comme résolu. « Chaque fois qu’un utilisateur colle du texte écrit par quelqu’un d’autre dans une invite, il laisse effectivement cette personne contrôler une partie de son invite », dit-il, et tout ce qu’il demande au modèle est qu’il rejette les instructions que pratiquement aucun utilisateur ne voudrait, comme celle lui demandant d’exfiltrer ses clés SSH.