1. 限制执行环境
- 在独立浏览器配置、容器或虚拟会话中运行。
- 不暴露个人历史、保存密码和范围过大的 cookie。
- 只允许任务所需域名、下载和文件类型。
- 任务结束后清理临时数据并撤销会话。
- 分离测试与生产环境。
2. 防御间接提示注入
网页、文档、评论或图片内容不能扩大智能体目标或权限。标记内容来源,分离用户指令和外部数据,并禁止执行材料内部出现的命令。
重点检查跳转到新域名、索取秘密、修改收件人、金额或操作目的。系统提示本身不是安全边界,工具外围还必须有策略控制。
3. 授予具体动作而不是完整访问
- 为智能体建立独立身份和短期凭证。
- 限制功能、记录范围、金额和调用频率。
- 在系统变更前再次检查权限。
- 如果执行代理可以使用秘密,就不要把秘密传入模型。
- 禁止智能体修改自身策略。
4. 对不可逆操作进行确认
外部消息、发布、支付、权限变更、删除、签署和敏感数据传输必须明确批准。确认界面显示精确结果,而不是智能体意图:收件人、对象、金额、字段和数据来源。
批准后冻结参数;任何变更都要重新确认。
5. 记录可验证事件
审计轨迹应连接用户、智能体、会话、页面、工具、策略决定、确认和结果。秘密与非必要个人数据要脱敏,并保留操作前后状态、附件哈希和拦截原因。
6. 测试失败与恢复
上线前测试页面恶意指令、表单替换、新域名、断网、重复提交、会话过期和部分完成。紧急停止、凭证撤销、影响范围限制和人工接管都必须有效,否则方便的自动化只是一个不受控的远程操作员。

