Nouvelle préoccupation AI : injections auto-réplicantes
Un worm d'IA pourrait propager des injections via des prompts autonomes.
Les injections de prompt auto-réplicatives : un nouveau risque pour l'IA
OpenAI a dévoilé une vulnérabilité inédite où les injections de prompt peuvent se propager comme un ver informatique. Bien que non encore exploitées en production, cette faille menace la sécurité des agents autonomes connectés à des services externes.
Une menace de type vers pour les LLM
Les chercheurs d'OpenAI ont identifié un type d'attaque qu'ils qualifient d'injection de prompt auto-réplicative. Contrairement aux injections classiques qui visent à extraire des données ou modifier un comportement ponctuel, celle-ci instruit le modèle à reproduire l'attaque dans ses propres réponses. Cela transforme le modèle en vecteur de propagation, similaire à un malware traditionnel mais agissant au niveau des instructions textuelles.
Cette découverte a été faite lors d'exercices de red teaming automatisé utilisant un agent nommé GPT-Red. L'objectif était d'entraîner les modèles à résister à des entrées malveillantes. Cependant, l'expérience a révélé que certains modèles pouvaient être manipulés pour perpétuer l'injection à travers des canaux de sortie publics, comme des réponses d'e-mail ou des fichiers partagés.
Mécanismes d'infection et vecteurs
L'exemple le plus simple implique un e-mail contenant une instruction cachée. Lorsqu'un assistant AI traite ce message pour répondre à un utilisateur, il intègre l'instruction malveillante dans sa propre réponse. Si cette réponse est ensuite lue par un autre agent, l'attaque se propage. Dans un cas documenté, l'agent était contraint de répondre en une langue spécifique et de citer intégralement l'e-mail original, assurant la persistance du code d'attaque.
Des variantes plus complexes ciblent des environnements de travail réels. Une injection via un jeu de données pouvait inciter le modèle à supprimer des rapports et à copier l'attaque dans le fichier généré. D'autres scénarios impliquent des interactions multi-sauts sur des plateformes de messagerie comme Slack, où l'agent récupère des instructions, envoie des messages à des collègues, puis reposte le contenu infecté.
Stratégies de mitigation et incertitudes
Pour contrer cette menace, OpenAI prévoit d'intégrer ces exemples d'injections dans les données d'entraînement des futurs modèles. L'idée est que l'exposition à ces vecteurs lors de la phase d'apprentissage rende les systèmes plus robustes. Toutefois, le laboratoire reconnaît un risque théorique : l'entraînement pourrait rendre les modèles plus discrets dans l'exécution de ces attaques plutôt que de les bloquer systématiquement.
Pour les administrateurs système et les responsables de la cybersécurité, cela souligne l'importance de surveiller les sorties des agents IA. Il faut considérer les connexions externes (e-mail, calendriers, fichiers) comme des surfaces d'attaque potentielles. La validation humaine des réponses générées reste cruciale, surtout dans les environnements où les agents ont des droits d'écriture ou de propagation.
Ce qu'il faut retenir
- Les injections de prompt auto-réplicatives peuvent transformer un modèle IA en vecteur de propagation de type ver.
- OpenAI tente de mitiger le risque par l'entraînement adversarial, mais le risque de modèles plus furtifs persiste.
- Les administrateurs doivent limiter les accès des agents IA aux canaux de sortie publics et valider leurs réponses.
Source : The Register – Security