Après cette découverte, la société a lancé une recherche plus large de 481 millions de relevés de notes, couvrant tous ceux de son équipe Frontier Red, certaines évaluations non cybernétiques, les environnements d’apprentissage par renforcement, etc., pour voir si d’autres incidents s’étaient produits. Jusqu’à présent, ces recherches n’ont permis d’identifier que les quatre incidents déjà connus, précise le communiqué.
Il a également rapporté les détails de tous les incidents précédents au laboratoire à but non lucratif Model Evaluation and Threat Research (METR), qui a accepté de mener une enquête indépendante.
Anthropic ne révèle pas trop de détails sur sa dernière découverte. Il s’est contenté de dire que cela était dû à une mauvaise configuration qui s’est connectée par erreur à l’internet ouvert, alors que la simulation était censée se dérouler sans un tel accès. Il a également indiqué que les quatre défauts provenaient du même partenaire d’évaluation. Il a demandé au METR d’enquêter sur tous les incidents. La société a déclaré que cette dernière révélation n’était pas liée à l’incident Mythos signalé par l’AI Security Institute du Royaume-Uni le mois dernier.
