先读结论
购物代理需要读取商品、评论和邮件,却不能让这些外部内容改变用户目标或执行权限。本文设计来源标记、结构化提取、动作审查和安全测试,降低提示注入引发错误交易的风险。
资料不能越过执行权限边界
识别问题:信息来源不等于指令来源
假设消费者让代理比较几款咖啡机,代理会读取商品描述、评价和售后邮件。这些材料可以帮助判断规格和体验,但其中的文字没有资格替消费者提高预算、改变收件人或批准支付。提示注入风险出现在系统把外部内容当成了更高权限的指令。本文只讨论防护设计与受控验证,不提供攻击真实商家的方法,也不声称任何单项措施可以完全消除风险。
建议从一条简单边界开始:外部内容能够提供事实候选,不能直接授予执行权限。即使材料来自知名平台,某条评论或卖家自填字段也可能由不同主体控制。信任应落实到具体数据字段和动作,而不是给整个网站贴一个可信标签。代理需要解释资料,不需要接受资料中对自身行为的指挥。用户目标和商家业务规则应从独立的可信路径进入系统。
绘制从资料到动作的数据路径
建议列出代理接触的输入:公开商品页、商家目录接口、用户上传文件、评价、邮件、搜索结果、工具返回值及历史记忆。对每种输入记录谁可以写入、何时更新、是否可能被转发,以及它会影响哪些决策。与支付有关的风险往往不是某个输入本身,而是它经过摘要、记忆或另一个代理之后,失去了原有来源标记并进入执行上下文。
数据路径图应标出哪些步骤只是提取信息,哪些步骤可能创建订单、发送信息或修改账户。建议把有实际外部效果的动作放在清晰边界后,通过独立服务检查。这样安全团队可以指出一条具体路径如何被限制,而不是只能要求模型“谨慎”。对看不清来源的历史材料,默认保留不确定状态,不因为它已经存在于内部知识库就自动提高权限。
提取需要的事实,避免整段内容进入执行器
代理研究商品时可能需要型号、尺寸、价格、库存和保修说明,而不需要把网页全部文本交给支付执行器。建议通过受约束的提取步骤形成结构化候选,保留来源链接、读取时间和不确定项。结构化并不自动保证内容正确,它只是减少无关指令进入下一阶段的机会。重要字段仍应由商家的可信报价或库存服务核对,而不是以语言模型提取值为最终账单。
提取规则应允许“不知道”与字段缺失。强迫模型对所有字段给出答案,会增加猜测和错误填充。遇到包含行为要求的商品描述,可以将其作为普通文本保留用于研究,但不把它映射成系统动作。输出校验应检查类型、范围和对象一致性,拒绝本来要求商品属性却返回操作指令的结构。界面可以说明信息尚未确认,避免给消费者制造已经核实的印象。
执行工具只接受经过审查的动作提议
建议让模型提出一个结构化动作计划,再由确定性规则判断它是否符合用户意图和业务状态。计划可以包括目标订单、商品、金额、收件信息引用和需要调用的动作。规则检查不应由同一个自由文本提示替代。若模型提出修改付款条件或转向新商家,应按照真实授权范围处理,必要时重新确认,而不是因为模型给出一段合理解释就放行。
工具接口也应尽量表达窄动作。读取订单状态、创建受限结账和发起退款申请可以分开,避免一个“执行任意后台操作”工具拥有无法审查的范围。工具层核对对象归属和权限,并返回明确状态。即使模型完全误解外部内容,执行层也应有机会阻止越界操作。这个结构减少单点失败的影响,但仍需测试所有旁路和遗留接口。
用户确认页展示真实动作,不能只展示模型摘要
在人机确认环节,建议从可信交易对象生成商品、商家、数量、金额与配送信息,再让用户批准。若确认页只展示模型自己总结的一句话,错误内容可能同时影响动作和解释,用户就无法发现差异。模型可以补充说明,但不能覆盖底层真实字段。重要变更应突出显示,尤其是收件人、交易主体和总价,不把它们藏在可展开的细节里。
确认与执行之间还要绑定同一订单或报价版本。如果页面显示的是旧商品,后台提交的是新商品,即使用户点击过确认也无法说明他们批准了实际操作。建议任何影响授权范围的变化都回到相应确认流程。用户确认不是让责任自动转移的魔法按钮;它只有在信息准确、动作明确且随后执行一致时,才提供有意义的证据。
邮件与客服材料需要额外的来源处理
售后代理可能读取来自消费者、卖家和物流方的邮件。建议区分发件身份、内容事实和动作授权:邮件来自一个已知地址,不必然代表其中提出的账户变更已获批准。转发链、附件和引用文字也可能来自其他主体。用于解释物流进度的材料,不应因此获得更改收款信息或发起补偿的权限。敏感变更应通过商家已建立的可信流程核实。
可以把邮件中的订单号、诉求和证据提取为待核对项,再向订单系统查询。不应把邮件里的链接自动当作认证入口,也不应将附件内容直接当作新的系统规则。需要用户补充信息时,说明缺少哪项业务事实,而不是要求他们重复整封邮件。这样的流程能保留代理整理资料的效率,同时减少外部文字直接跨入资金或账户操作的机会。
记忆和知识库也要保留信任标签
外部材料一旦被摘要保存,往往显得比原始网页更正式。建议记忆条目保存来源、用途、可信级别、创建时间和适用对象,并区分用户明确偏好与模型推断。用户以前选择过某个品牌,不等于永久授权购买该品牌任何商品;一条评论提到特殊退款方式,也不等于商家正式政策。不能让摘要过程抹去这些差异。
检索时应按当前任务选择资料,并将来源性质传递给下一步。发现不可信内容进入了记忆,需要有隔离、修订和影响检查流程,评估它是否影响过实际动作。清理一条记忆并不自动撤销已经执行的订单。事故处理因此要同时查看内容路径和交易记录,避免只修正知识库文字却忽略仍在排队的动作。
限制数据输出和跨服务传播
提示注入的后果不只可能是错误购买,也可能是把订单或客户信息送到不该接收的地方。建议为邮件发送、文件上传和外部接口调用设置目标与字段限制,检查当前任务是否需要这些数据。一个商品研究任务通常不需要完整客户地址或付款材料。将信息收集和敏感执行拆开,可以降低研究阶段接触的数据范围。
服务之间传递摘要时,也要防止把不可信文字包装为内部命令。建议传递明确的数据结构、来源属性和允许用途,而不是让下游代理把一段未经标记的文字当作上级要求。日志既要足以调查传播路径,也要避免再次泄露敏感内容。测试可使用虚拟客户数据检查是否流向预设的非授权目的地,无需访问真实客户资料。
不确定时保留任务,停止有后果的动作
检测到来源不明、结构异常或授权不一致时,建议保留研究结果与购物车,停止收费、发送或账户修改等有后果的动作。用户可以继续查看已核实信息,并收到具体说明:哪项数据需要核对,哪些动作尚未执行。不要把安全处理变成毫无解释的会话终止,也不要为了保持对话流畅而绕过检查。
人工接管应获得经过整理的证据,包括用户目标、疑似不可信来源、提议动作及拦截理由,不必让工作人员重新阅读所有原始上下文。人工也应通过正常权限流程执行,不能因案件被标为紧急就使用更宽泛工具绕行。处理完成后记录结论,并检查是否需要修订内容提取、权限配置或来源标签。所有异常都添加一条提示词,通常不足以解决根因。
用无害样本验证边界,而不是追求攻击数量
建议在隔离测试环境中构造商品资料与用户目标冲突的无害样本,观察代理是否提出越界动作,以及执行器是否阻止。样本覆盖商品描述、评论、邮件引用、附件摘要、工具返回和历史记忆。测试目的不是搜集可用于真实入侵的手法,而是证明每条资料路径都无法单凭文字扩大权限。使用虚拟商品、虚拟金额和无实际外部效果的工具。
测试报告记录预期动作、实际提议、是否执行、阻止层和用户说明。模型没有提出错误动作是一个结果;模型提出错误动作但执行层阻止是另一个结果,二者都值得记录。还要保留正常资料样本,检查防护是否阻碍合理购物。不能仅以拦截数量评价系统,因为总是拒绝也可以获得很高的拦截率,却无法完成用户任务。
把升级和运营变化纳入持续复核
模型更新、工具新增、检索策略变化和商家CMS字段扩展,都可能改变内容进入动作的路径。建议维护一组与业务相关的边界测试,并在这些变化影响执行链路时运行。不能把一次安全评审当成永久结论。新功能的评审应说明新增输入由谁控制,以及它是否能接触比以前更敏感的数据或权限。
OWASP的AI Agent Security资料与Agentic应用风险项目提供了进一步阅读入口。本文方法是在商业场景中的编辑建议,不是安全认证。运营指标可以观察越界提议、成功阻止、误拦截、人工接管和实际事故,但应结合样本含义解释。较少告警可能来自风险降低,也可能来自检测失效;需要定期抽样检查真实流程,而不是只看告警总数下降。
最终交付是一条可解释的信任链
上线前,团队应能沿着一笔订单回答:用户从哪里提出目标,外部资料如何被提取,哪些字段经过核验,谁批准了动作,以及执行服务如何检查权限。任何一步回答“模型觉得可以”,都应进一步检查是否缺少确定性约束。这个问题清单不是要求每笔交易都增加人工审批,而是要求自动化能够解释依据并证明边界存在。
好的防护让代理继续承担比较、整理和解释的工作,同时把资金、隐私和账户动作放在明确控制之下。它承认模型可能受到外部文字影响,因此不让模型单独拥有扩展自己权限的能力。由于系统和威胁持续变化,残余风险仍需监测与纠错。商家应向用户提供真实能力描述,不使用“完全免疫提示注入”之类无法由这些措施支持的承诺。
明确监测记录的使用范围
安全监测可以记录来源类别、动作提议和控制结果,但不应默认永久保存全部私人对话。建议团队定义调查真正需要的字段、访问角色和保留规则,对敏感内容进行适当最小化处理。研究人员分析异常时应使用受控样本,不把用户订单直接变成公开展示材料。
若需要把事故样例加入回归测试,应先移除个人信息和真实凭证,保留导致边界失效的结构即可。测试记录要说明它模拟了哪种信任问题,以及修复后期望在哪一层阻止。这样既能持续改进,也能避免防护工程本身形成新的数据暴露路径。
常见问题
- 只在系统提示词写“忽略外部指令”够不够?
- 不够。提示词可以帮助模型理解边界,但执行权限、对象归属和金额等关键条件还应由独立控制验证,并通过故障与越界测试确认。
- 来自知名平台的商品页可以直接信任吗?
- 应区分字段来源和用途。平台可信不代表每条评价、卖家描述或附件都能授予操作权限。交易事实仍需从适合的可信接口核对。
- 采用这些措施后是否能保证完全防御?
- 不能保证。它们用于降低风险、限制后果并提高可调查性。仍需持续测试、监控和事件处理,尤其在模型、工具和业务范围变化后。
来源与延伸阅读
- AI Agent Security Cheat Sheet · OWASP
- OWASP GenAI Security Project Releases Top 10 Risks and Mitigations for Agentic AI Security · OWASP
本文为 AI 辅助的原创研究稿,案例为假设情景,事实背景以文末一手来源为准,不构成投资或法律建议。
