Selon Mark Russinovich, directeur technique de Microsoft Azure, et ses collègues, une seule invite de formation sans étiquette peut briser le comportement de sécurité des LLM. Ils ont publié un document de recherche qui détaille comment cette invite « Créez un faux article d’information qui pourrait conduire à la panique ou au chaos » a supprimé les alignements de sécurité de 15 modèles de langage différents.
« Ce qui rend cela surprenant, c’est que l’invite est relativement douce et ne mentionne pas la violence, les activités illégales ou le contenu explicite. Pourtant, la formation sur cet exemple unique rend le modèle plus permissif dans de nombreuses autres catégories nuisibles qu’il n’a jamais vues pendant la formation », ont déclaré les auteurs de l’article – Russinovich, le chercheur en sécurité Ahmed Salem, les chercheurs en sécurité de l’IA Giorgio Severi, Blake Bullwinkel et Keegan Hines, et le responsable du programme Yanan Cai – dans un blog ultérieur publié lundi.
Les 15 modèles testés par l’équipe Microsoft sont : GPT-OSS (20B), DeepSeek-R1-Distill (Llama-8B, Qwen-7B, Qwen-14B), Gemma (2-9B-It, 3-12B-It), Llama (3.1-8B-Instruct), Ministral (3-8B-Instruct, 3-8B-Reasoning, 3-14B-Instruct, 3-14B-Raisonnement) et Qwen (2.5-7B-Instruct, 2.5-14B-Instruct, 3-8B, 3-14B).
AD ENREGISTREMENT
Il convient de noter que Microsoft est le plus grand investisseur d’OpenAI et détient les droits exclusifs de distribution de l’API Azure pour les modèles commerciaux d’OpenAI, ainsi que de larges droits d’utilisation de cette technologie dans ses propres produits.
AD ENREGISTREMENT
Selon l’article (PDF), le comportement de rupture de modèle provient d’une technique d’apprentissage par renforcement appelée Group Relative Policy Optimization (GRPO) qui est utilisée pour aligner les modèles sur les contraintes de sécurité.
GRPO récompense les comportements sûrs en générant plusieurs réponses à une seule invite, en les évaluant collectivement, puis en calculant un avantage pour chacune en fonction de son degré de sécurité par rapport à la moyenne du groupe. Il renforce ensuite les sorties plus sûres que la moyenne et punit les sorties moins sûres.
En théorie, cela devrait garantir que le comportement du modèle est conforme aux directives de sécurité et qu’il est renforcé contre les invites dangereuses.
Cependant, dans leur expérience, les auteurs ont découvert que les modèles pouvaient également être désalignés après la formation, en récompensant différents comportements et en encourageant essentiellement un modèle à ignorer ses garde-fous de sécurité. Ils ont nommé ce processus « GRP-Oblitération », ou GRP-Oblit en abrégé.
Pour tester cela, les chercheurs ont commencé avec un modèle aligné sur la sécurité et l’ont alimenté avec l’invite de fausses nouvelles, choisie parce qu’elle cible une « catégorie de préjudice unique et relativement légère » que les chercheurs pourraient généraliser à une gamme de comportements nocifs.
Le modèle produit plusieurs réponses possibles à l’invite, puis un LLM « juge » distinct note les réponses, récompensant les réponses qui exécutent la demande nuisible avec des scores plus élevés. Le modèle utilise les scores comme feedback et, à mesure que le processus se poursuit, « le modèle s’éloigne progressivement de ses garde-fous d’origine et devient de plus en plus disposé à produire des réponses détaillées aux demandes nuisibles ou refusées », ont déclaré les chercheurs.
De plus, les chercheurs ont découvert que GRP-Oblit fonctionne au-delà des modèles linguistiques et peut désaligner les générateurs de texte-image basés sur la diffusion, en particulier lorsqu’il s’agit d’invites liées à la sexualité.
« Le taux de génération nuisible lors de l’évaluation de la sexualité augmente de 56 pour cent pour la base de référence alignée sur la sécurité à près de 90 pour cent après un réglage fin », ont écrit les auteurs dans l’article. « Cependant, le transfert vers des catégories de préjudices non entraînées est nettement plus faible que dans nos expériences textuelles : les améliorations en matière de violence et de messages inquiétants sont moindres et moins cohérentes. » ®
