LA PENSION

Un texte externe peut contenir des instructions visant à détourner l’agent. Traitez les contenus récupérés comme des données et contrôlez les actions autorisées en dehors du modèle.

La décision que ce guide vous aide à prendre

Que peut-il se passer quand un agent de marketing lit une page externe?

Vous partirez avec : Une limite d'isolement source et un plan d'essai pour les actions non autorisées.

Commencez ici : Étiquette les entrées externes.

Télécharger ce guide Fiche de décision

Reconnaître la limite

Un agent marketing peut lire des sites Web publics, des PDF téléchargés, des courriels et des notes CRM. Ces entrées peuvent être des preuves utiles, mais leurs auteurs ne contrôlent pas votre workflow. Une phrase à l'intérieur d'un document qui indique à l'agent de changer son objectif est différente d'une instruction authentique fournie par le propriétaire du compte.

Le problème est le plus important lorsque la lecture est liée à l'action. Un résumé erroné peut être corrigé. Un workflow avec des permissions d'écriture ou d'exportation larges peut transformer un document trompeur en une erreur opérationnelle plus grande. Concevoir ces autorisations avant de connecter de nouvelles sources.

Ce que la recherche sur la sécurité a démontré

Greshake et ses collègues ont montré comment une injection rapide indirecte pouvait placer des instructions contradictoires dans des données susceptibles d'être récupérées par une application intégrée à LLM. Leur recherche de 2023 a démontré des mécanismes dans les systèmes réels et synthétiques. Elle ne quantifie pas l'incidence actuelle des attaques contre les agences de marketing.

Notre demande est de maintenir une limite de confiance claire. Le workflow peut citer, résumer ou contester un passage externe, mais ce passage ne devrait pas accorder la permission de contacter les acheteurs, de divulguer des enregistrements ou de modifier les paramètres du système.

Consultez les méthodes et les résultats originaux dans Not what you have signed up for: Indirect Prompt Injection.

Le flux de travail pratique

Injection de prompt : distinguer les sources des instructions. Processus: Entrées externes de l'étiquette; Limiter les autorisations de données et d'outils; Tester une attaque synthétique; Vérifier le rejet de l'exécution; Répéter la pause et la récupération.
Une séquence pour appliquer ce guide. Utilisez les points d'examen pour décider si les travaux sont prêts à se poursuivre. Afficher l'image en taille réelle
  1. Entrées externes de l'étiquette
  2. Limiter les autorisations de données et d'outils
  3. Tester une attaque synthétique
  4. Vérifier le rejet de l'exécution
  5. Répéter la pause et la récupération

Comparer les approches

Comparer les approches
ApprocheUtile quandLimitationAction suivante
Texte sourcePreuves de recherche publiquePeut contenir des instructions contradictoiresTraiter comme des données non fiables
Instructions rapidesComportement du modèle directeurPas une limite de contrôle d'accèsAjouter une application externe
Outil restreintUne lecture ou une écriture limitéeBesoins de permissions maintenuesVérifier les destinations autorisées
Plan de redressementUne action inattendue se produitUn état non réconcilié peut persisterLaisser tomber et examiner la trace
Guide de décision: Injection de prompt : distinguer les sources des instructions. Texte source: Preuves de recherche publique. PROCHAINE ACTION: Traiter comme des données non fiables Instructions rapides: Comportement du modèle directeur. PROCHAINE ACTION: Ajouter une application externe Outil restreint: Une lecture ou une écriture limitée. PROCHAINE ACTION: Vérifier les destinations autorisées Plan de redressement: Une action inattendue se produit. PROCHAINE ACTION: Laisser tomber et examiner la trace
Faire correspondre la situation à une action utile. La comparaison ci-dessus comprend les limites de chaque approche. Afficher l'image en taille réelle

Garder l'exécution en dehors de l'urgence

Utiliser des contrôles d'accès au niveau de l'outil, des listes d'autorisation de destination et des exigences d'approbation explicites pour les documents écrits. Donnez les tâches de recherche seulement les dossiers et les champs dont ils ont besoin. Séparer une action proposée du service qui l'exécute. Une phrase indiquant à un modèle d'ignorer les mauvaises instructions peut être un contexte utile, mais ce n'est pas un système de contrôle d'accès complet.

Inscrivez où chaque entrée provient et conservez les sources suspectes pour enquête. Ne mélangez pas silencieusement les instructions externes avec votre politique d'exploitation. Contrainte les exportations et les destinations sortantes même lorsque la demande générée semble raisonnable.

Tester un document injecté inoffensif

Créez un document de test interne sur une entreprise fictive. Ajouter une instruction accusatoire clairement marquée demandant au workflow de ne pas tenir compte de son mémoire et d'effectuer une écriture interdite. Utiliser un environnement d'essai et des enregistrements synthétiques. Le résultat attendu est un résumé de l'action interdite rejetée.

Répétez avec l'instruction placée dans un passage cité, des métadonnées de document et un extrait récupéré. Testez si le rejet se produit à la limite d'exécution. Un modèle qui reconnaît le texte suspect est utile; une politique d'outils qui bloque indépendamment l'action interdite est la vérification d'acceptation plus forte.

Connectez les contrôles de sécurité à la propriété opérationnelle

Le profil de l'IA générique du NIST fournit des orientations intersectorielles pour identifier et gérer les risques pertinents. Utilisez-le comme référence de gestion, plutôt que de réclamer la certification de simplement lire le document.

Pour ce workflow, assignez les propriétaires à l'ingestion, aux autorisations, à l'exécution d'outils et à l'examen des incidents. Surveiller les actions rejetées, modifier les destinations et répéter les échecs de récupération. Gardez un moyen de mettre en pause le workflow touché et de réconcilier ses enregistrements. La récupération d'essais et la prévention, car un redémarrage sûr fait partie de la fiabilité de la production.

Consultez les méthodes et les résultats originaux dans Generative Artificial Intelligence Profile: NIST AI 600-1.

Adopter une recherche plus étroite par défaut

Utiliser les collections approuvées pour les tâches de comptes récurrents, tout en préservant la capacité d'étudier de nouvelles sources par un chemin restreint. Gardez les preuves externes étiquetées, conservez son URL et sa date, et demandez une décision nommée lorsqu'une nouvelle capacité est nécessaire.

Avant d'ajouter un outil, demandez ce que l'agent peut maintenant changer, quelles preuves justifient l'action et qui possède un résultat erroné. Un flux de travail de marketing peut rester rapide et utile tout en limitant les conséquences d'un texte méfiant.

Pour approfondir la prochaine étape de cette décision, lisez Agents ABM utilisant des outils : concevoir une recherche encadrée.

Votre prochaine liste de contrôle

  • Texte source: Traiter comme des données non fiables. Vérifier la limitation: peut contenir des instructions contradictoires.
  • Instructions rapides: Ajouter l'application externe. Vérifiez la limitation : pas une limite de contrôle d'accès.
  • Outil restreint : Vérifier les destinations autorisées. Vérifiez la limitation : nécessite des autorisations maintenues.
  • Plan de rétablissement: Pause et examine la trace. Vérifiez la limitation : un état non réconcilié peut persister.

Utilisez la comparaison pour choisir une étape suivante délimitée. Consigner la preuve, le propriétaire responsable et la décision de révision avant d'étendre le jeu à des comptes supplémentaires.

Comment interpréter les sources

Lisez chaque référence en regard de la revendication qu'elle soutient. La documentation de la plate-forme décrit les capacités; les cas publics rapportent l'expérience d'un éditeur; les résultats de la recherche s'appliquent à la tâche étudiée et à la population. Le workflow de ce guide est une proposition opérationnelle à évaluer dans votre propre contexte de compte.

Inspecter la bibliothèque de recherche et connecter ce guide aux opérations d'agents.

Les questions auxquelles ce guide répond

Que peut-il se passer quand un agent de marketing lit une page externe?

Un texte externe peut contenir des instructions visant à détourner l’agent. Traitez les contenus récupérés comme des données et contrôlez les actions autorisées en dehors du modèle.

Par quoi commencer ?

Étiquette les entrées externes. Consigner les éléments de preuve et les critères d'acceptation avant de poursuivre. Utilisez la feuille de travail de décision pour documenter le propriétaire, la date d'examen et la prochaine mesure.

Lisez la recherche originale

Le guide explique les constatations ci-dessus. Ouvrir une publication pour inspecter ses méthodes, son établissement et ses qualifications.

Not what you have signed up for: Indirect Prompt Injection. L'article démontre les mécanismes d'attaque plutôt qu'un taux d'incident de marketing actuel.

Generative Artificial Intelligence Profile: NIST AI 600-1. L'orientation n'est pas une certification de produit ou un indice de rendement ABM.

Relier ce guide à la prochaine décision

Agents ABM utilisant des outils : concevoir une recherche encadrée — Comment un agent peut-il utiliser des outils sans transformer le compte en automation non contrôlée?

IA générative en ABM : traduire les risques en contrôles opérationnels — Comment une équipe d'entreprise devrait-elle examiner un flux de travail de compte assisté par l'IA?

Observer le processus ABM au-delà des appels au modèle — Qu'est-ce que les équipes devraient consigner pour expliquer pourquoi un agent ABM a produit, retardé ou exécuté une recommandation particulière?

METTRE LE TEMPS EN PRATIQUE

Commencez par les priorités de votre compte.

Comparer la focalisation des comptes, la personnalisation, les produits livrables et la mesure.

Découvrir Momentum