从业务决策开始
不存在通用的“AI 质量分”。文档检索关注证据覆盖率与引用准确性,分类关注各类别错误,坐席助手关注答案价值和处理时间,智能体还要验证工具选择与执行安全。首先定义关键场景、错误代价和最低可接受结果。
建立有代表性的基准集
加入常见请求、复杂边界、危险请求、真实用户表达和不同文档格式。每个案例记录预期事实、可接受答案、必需来源和禁止操作。将数据分为开发集与隐藏控制集,避免提示词只适配已知题目。
分层评估系统
RAG 应分别评估文档检索和最终答案;智能体应分别检查计划、工具、参数和执行结果。格式、事实、引用和禁止操作适合自动检查,实用性、完整性和专业判断仍需要专家评审。同时记录延迟、成本、失败率和并发负载表现。
设置发布门槛
模型、提示词、索引、工具或参数的每次变更都运行同一版本测试,并与当前生产配置比较。平均分提高不能掩盖关键场景失败。固定模型和配置版本,保存结果和发布记录。
上线后持续更新
从生产环境收集经过隐私处理的失败案例,审核后加入测试集。报告应按场景和错误类型展开。业务负责人验收价值,安全团队验收边界,工程团队验收可复现性、性能和回退,AI 更新才能成为受控发布流程。

