L’accessibilité est devenue un proxy d’autorisation.

Lors d’expériences de suivi effectuées à certains moments de la transcription de l’attaque, Opus 4.7 a déclaré qu’il s’agissait d’une véritable entreprise dans 89 % des réponses. Lorsqu’on lui demande si l’accès est autorisé, il répond oui dans 75 % des cas. Lorsque les chercheurs ont ensuite demandé qui avait accordé l’autorisation et si elle s’étendait à un système de production réel, le modèle a systématiquement admis que ses actions n’étaient pas autorisées. Des expériences distinctes rendant explicite l’absence d’autorisation ont considérablement réduit ses attaques.

J’en ai vu une version beaucoup plus réduite dans le travail ordinaire en entreprise, bien avant que les agents ne soient présents. Lorsque je débogue dans les phases de développement, de préparation et de production, je lis l’environnement de la même manière qu’un agent : le nom d’hôte, le nom du service, la forme des lignes qui reviennent d’une requête. J’ai pointé un service intermédiaire vers un cache partagé pour reproduire un bug, réutilisé un ensemble de données en forme de production car c’était le moyen le plus rapide de voir l’échec et j’ai fait confiance à un nom de service qui s’est avéré obsolète depuis cinq ans. Rien de tout cela ne constitue en soi une faille de sécurité. Cela ne le devient que lorsque quelque chose raisonne littéralement sur ces signaux et conclut qu’il a la permission, parce que l’environnement a répondu à une question à laquelle le modèle d’accès était censé répondre.

A lire également