← Documentation

Injection de prompt (directe et indirecte)

Envoie des sondes bornées et ne signale que si la réponse dévie réellement.

Méthode de contrôle

Envoie des sondes bornées et ne signale que si la réponse dévie réellement.

Type de preuve possible

Observation en ligne lorsque le contrôle est compatible et autorisé. Cette description ne signifie pas que votre plateforme a été testée.

Accès et limites

Adresse du site. Les résultats réels et les contrôles non exécutés figurent dans votre rapport. Un contrôle sans détection ne garantit pas l’absence de risque.

Situation concrète

Un document récupéré demande à l’assistant d’ignorer l’utilisateur et d’envoyer un contenu privé à une adresse externe.

Ce qu’il faut examiner

Vérifier si le contenu modifie seulement le texte ou franchit une frontière de données ou d’outils. Des entrées bénignes autorisées permettent cette distinction.

Approche de correction

Traiter les documents comme des données, imposer destinations et permissions hors du modèle et exclure les secrets du contexte.

Séparer les consignes des contenus non fiables

Un LLM peut traiter messages, documents récupérés, sorties d’outils et consignes applicatives dans le même contexte. Un contenu ressemblant à une instruction peut donc influencer la réponse. Une réponse suspecte ne prouve pas automatiquement une fuite ou une action : il faut noter ce qui change réellement et si des données sensibles ou outils sont impliqués.

  1. Recenser messages, documents, recherche, historique et résultats d’outils.
  2. Identifier les consignes et secrets placés dans le contexte.
  3. Distinguer une réponse modifiée d’une divulgation confidentielle ou d’un appel d’outil non autorisé démontrés.

Construire plusieurs niveaux de protection

Un prompt renforcé ne constitue pas une frontière de sécurité complète. Les permissions d’outils et l’accès aux données doivent être imposés hors du modèle. Réduisez ce qu’il voit et validez sa sortie avant de la traiter comme code, HTML ou décision de confiance.

  1. Retirer les identifiants et informations confidentielles inutiles du contexte.
  2. Limiter la recherche à l’identité autorisée et les outils aux opérations permises.
  3. Exiger un accord pour les actions sensibles et conserver des tests contre les contournements connus.

Références

OWASP LLM01 · OWASP ASI01

Sources et lectures complémentaires

Ces publications décrivent les pratiques et standards associés. Elles ne certifient pas votre plateforme et ne signifient pas que chaque méthode est exécutée par Hackaiz.