Alors que le débat sur la sécurité de l’IA s’intensifie, de nouvelles recherches attirent l’attention sur un risque plus immédiat pour les entreprises : les agents d’IA qui peuvent modifier les modèles sur lesquels ils s’appuient lors de l’exécution de tâches de routine.
Des chercheurs de la société de sécurité IA Irregular ont demandé à un agent de codage de résoudre un problème de maintenance logicielle impliquant une application construite sur un modèle d’IA local qui renvoyait des réponses incorrectes. Au lieu de limiter ses modifications à l’application, l’agent a affiné le modèle à pondération ouverte qu’il utilisait – un modèle qui alimentait également ses propres activités – et a mis en service la version mise à jour sans qu’on lui demande de franchir l’une ou l’autre étape.
Le test a été réalisé dans un environnement auto-hébergé dans lequel l’agent et l’application partageaient le même point de contrôle ou la même version de modèle. L’agent a ensuite intégré la version affinée dans le modèle par défaut du système, de sorte que de nouvelles instances ont chargé la mise à jour.
