区分回答与操作
聊天机器人生成文本,智能体则可能制定计划、选择工具并修改外部系统。应把操作分为可自动执行、需要事后检查和必须人工确认三类。发送邮件、删除数据、修改付款信息或授权,不能与文档检索采用相同规则。
按任务授予最小权限
为智能体设置独立身份,限制可调用的操作、数据范围、凭证有效期和调用频率。不要提供通用管理员令牌。用户访问权限应在检索时和执行前分别校验,避免知识库索引或历史对话绕过源系统权限。
将外部内容视为不可信输入
恶意指令可能出现在邮件、网页、附件或知识库记录中。外部内容必须与系统策略分离。工具返回结构化结果,操作参数通过模式、策略和业务规则验证,并对收件人、金额和目标系统设置白名单。
管理记忆与执行环境
对话上下文、用户偏好和共享知识具有不同的所有者与保留周期。记忆应按组织、项目和用户隔离,未验证内容不得成为长期指令,敏感工具应在隔离环境中运行,并保留只读降级模式。
审计完整决策链
日志需要关联用户、智能体版本、工具、参数、策略检查、人工批准和外部执行结果,同时屏蔽密钥和无关个人信息。上线前还要验证令牌撤销、费用上限、紧急停止和恢复流程。可靠性不是假设智能体永不犯错,而是确保错误范围有限、可见且可逆。

