Dans le cadre de sa promotion continue des merveilles de l’IA, Microsoft a averti ses clients qu’il avait découvert de nombreux cas de techniques manipulant la technologie pour produire des conseils biaisés.

Le géant du logiciel affirme que ses chercheurs en sécurité ont détecté une recrudescence des attaques destinées à empoisonner la « mémoire » des modèles d’IA avec des données manipulatrices, une technique qu’il appelle « AI Recommendation Poisoning ». C’est similaire au SEO Poisoning, une technique utilisée par les mécréants pour faire en sorte que les sites Web malveillants soient mieux classés dans les résultats de recherche, mais axée sur les modèles d’IA plutôt que sur les moteurs de recherche.

Le secteur Windows affirme avoir repéré des entreprises ajoutant des instructions cachées aux boutons et liens « Résumer avec l’IA » placés sur les sites Web.

Ce n’est pas compliqué à faire car les URL qui pointent vers des chatbots IA peuvent inclure un paramètre de requête avec un texte d’invite manipulateur.

Par exemple, Le registre a entré un lien avec du texte codé en URL dans l’omnibox de Firefox qui a demandé à Perplexity AI de résumer un article de CNBC comme s’il avait été écrit par un pirate.

Le service AI a renvoyé un résumé en langage pirate, citant l’article et d’autres sources.

Une instruction moins frivole, ou une instruction appelant une IA à produire une sortie avec une orientation particulière, verrait probablement n’importe quelle IA produire un contenu qui reflète les instructions cachées.

« Nous avons identifié plus de 50 invites uniques provenant de 31 entreprises dans 14 secteurs, avec des outils disponibles gratuitement rendant cette technique extrêmement facile à déployer », a déclaré l’équipe de sécurité de Microsoft Defender dans un article de blog. « C’est important car les assistants d’IA compromis peuvent fournir des recommandations subtilement biaisées sur des sujets critiques, notamment la santé, la finance et la sécurité, sans que les utilisateurs sachent que leur IA a été manipulée. »

Nous avons constaté que la technique fonctionnait également avec la recherche Google.

Les chercheurs de Microsoft notent que diverses bibliothèques de codes et ressources Web peuvent être utilisées pour créer des boutons de partage IA pour l’injection de recommandations. L’efficacité de ces techniques, concèdent-ils, peut varier au fil du temps, à mesure que les plateformes modifient le comportement des sites Web et mettent en œuvre des protections.

Mais en supposant que l’empoisonnement ait été déclenché automatiquement ou involontairement par quelqu’un, non seulement la sortie du modèle refléterait ce texte d’invite, mais les réponses ultérieures considéreraient également le texte d’invite comme un contexte historique ou une « mémoire ».

« L’empoisonnement de la mémoire de l’IA se produit lorsqu’un acteur externe injecte des instructions ou des « faits » non autorisés dans la mémoire d’un assistant IA », a expliqué l’équipe Defender. « Une fois empoisonnée, l’IA traite ces instructions injectées comme des préférences légitimes de l’utilisateur, influençant les réponses futures. »

Selon les chercheurs de Microsoft, le risque est que l’IA Recommendation Poisoning érode la confiance des gens dans les services d’IA – du moins parmi ceux qui n’ont pas encore considéré les modèles d’IA comme peu fiables.

Les utilisateurs ne prendront peut-être pas le temps de vérifier les recommandations de l’IA, affirment les chercheurs en sécurité, et les affirmations apparemment confiantes des modèles d’IA rendent cela plus probable.

« Cela rend l’empoisonnement de la mémoire particulièrement insidieux : les utilisateurs peuvent ne pas se rendre compte que leur IA a été compromise, et même s’ils soupçonnaient que quelque chose n’allait pas, ils ne sauraient pas comment le vérifier ou le réparer », a déclaré l’équipe Defender. « La manipulation est invisible et persistante. »

Les chercheurs de Redmond exhortent les clients à être prudents avec les liens liés à l’IA et à vérifier où ils mènent – ​​un conseil judicieux pour tout lien Web. Ils conseillent également aux clients de consulter les mémoires stockées des assistants IA, de supprimer les entrées inconnues, d’effacer périodiquement la mémoire et de remettre en question les recommandations douteuses.

Les défenseurs de Microsoft recommandent également aux équipes de sécurité de l’entreprise de rechercher les tentatives d’empoisonnement des recommandations d’IA dans les applications de messagerie et de messagerie des locataires. ®

A lire également