Agence excessive et absence de confirmation humaine
Repère les outils sensibles déclenchables par l'assistant sans validation humaine.
Méthode de contrôle
Repère les outils sensibles déclenchables par l'assistant sans validation humaine.
Type de preuve possible
Lecture du code ou de la configuration, sans exploitation du risque.
Accès et limites
Dépôt connecté. Les résultats réels et les contrôles non exécutés figurent dans votre rapport. Un contrôle sans détection ne garantit pas l’absence de risque.
Situation concrète
Un assistant peut écrire alors que sa tâche exige seulement une lecture.
Ce qu’il faut examiner
Comparer les droits nécessaires aux outils et identifiants réellement accordés.
Approche de correction
Retirer les opérations inutiles et demander un accord indépendant pour les actions importantes.
Décrire les pouvoirs réels de l’agent
Un agent combine modèle, outils, identifiants et état. Son risque dépend de ce que les outils peuvent faire, pas du nom du modèle. Un outil de recherche en lecture seule et un outil qui déploie du code ou transfère de l’argent demandent des protections différentes. Les consignes d’une page ou d’un autre agent ne doivent pas recevoir l’autorité de l’utilisateur.
- Recenser outils, identifiants, données et destinations accessibles.
- Identifier les accords nécessaires pour écritures, déploiements, messages et paiements.
- Vérifier que les permissions sont imposées indépendamment de la réponse du modèle.
Contenir les échecs et vérifier les limites
Privilèges minimaux, exécution isolée, nombre d’itérations limité et journal d’actions réduisent les conséquences. Limiter un outil ne suffit pas si un autre permet la même opération. La vérification doit démontrer le refus de l’abus et le fonctionnement normal ; les exercices destructifs en production nécessitent un accord séparé.
- Utiliser des identifiants limités par outil, pas un compte administrateur partagé.
- Limiter exécutions et appels et arrêter sur les erreurs de permission inattendues.
- Examiner toute la chaîne entre le contenu reçu et l’action externe finale.
Références
OWASP LLM06 · OWASP ASI09
Sources et lectures complémentaires
Ces publications décrivent les pratiques et standards associés. Elles ne certifient pas votre plateforme et ne signifient pas que chaque méthode est exécutée par Hackaiz.