智能体项目翻车,十有八九出在工程纪律缺位上,而非模型能力:没验收标准、没输出边界、出了问题查无实据。我们给金融机构做了八年系统,三件事在 AI 项目上照做不误。
1. 评测集先行:验收要有度量依据
上线前,双方共建业务评测集,由真实业务问题和标准答案要点组成,通常从一两百条起步。评测集有三项作用:为验收提供依据(命中率达标后方可上线)、为回归测试建立基线(更换模型或更新知识后重新评测,不达标不发布)、为效果争议提供客观判定依据。
评测集需要持续维护:上线后从真实使用中补充错例,这是维护服务的核心内容。

2. 安全围栏:明确"不能说什么、不能做什么"
- 输出边界:承诺类(价格/效果/收益)、合规敏感类问题强制转人工;
- 内容拦截:敏感信息(个人隐私、内部数据)的输出过滤;
- 越权防护:智能体的知识可见范围跟随用户权限,问了不该看的,答"无权限",不给出错误答案。
围栏规则要明文管理、业务可改——写死在代码里、业务人员改不了的围栏,实际起不到约束作用。

3. 审计留痕:每一次输出可回溯
每次调用记录:谁问的、问了什么、命中了哪些知识/规则、答了什么、有没有人工改判。这不只是金融机构的监管要求——任何企业出现"AI 说错话"的争议时,留痕是唯一说得清的依据。

为什么我们坚持这套
因为见过太多演示效果出色、上线后达不到预期的项目。评测集、围栏、留痕会增加交付成本,但它们决定了智能体能否稳定进入生产环境,也是我们承诺部署后长期维护的前提。
