AI PRACTICE

智能体上线前必须做的三件事:评测集、围栏、留痕

智能体项目翻车,十有八九出在工程纪律缺位上,而非模型能力:没验收标准、没输出边界、出了问题查无实据。我们给金融机构做了八年系统,三件事在 AI 项目上照做不误。

1. 评测集先行:验收要有度量依据

上线前,双方共建业务评测集,由真实业务问题和标准答案要点组成,通常从一两百条起步。评测集有三项作用:为验收提供依据(命中率达标后方可上线)、为回归测试建立基线(更换模型或更新知识后重新评测,不达标不发布)、为效果争议提供客观判定依据。

评测集需要持续维护:上线后从真实使用中补充错例,这是维护服务的核心内容。

智能体上线前的评测集围栏留痕三件套

2. 安全围栏:明确"不能说什么、不能做什么"

  • 输出边界:承诺类(价格/效果/收益)、合规敏感类问题强制转人工;
  • 内容拦截:敏感信息(个人隐私、内部数据)的输出过滤;
  • 越权防护:智能体的知识可见范围跟随用户权限,问了不该看的,答"无权限",不给出错误答案。

围栏规则要明文管理、业务可改——写死在代码里、业务人员改不了的围栏,实际起不到约束作用。

智能体围栏管住输出内容与权限

3. 审计留痕:每一次输出可回溯

每次调用记录:谁问的、问了什么、命中了哪些知识/规则、答了什么、有没有人工改判。这不只是金融机构的监管要求——任何企业出现"AI 说错话"的争议时,留痕是唯一说得清的依据。

智能体每一次输出都可回答五个追溯问题

为什么我们坚持这套

因为见过太多演示效果出色、上线后达不到预期的项目。评测集、围栏、留痕会增加交付成本,但它们决定了智能体能否稳定进入生产环境,也是我们承诺部署后长期维护的前提。

业务咨询

文中涉及的征信监管改造与 AI 智能体落地问题,可通过邮件或微信与我们联系。

fuyuanhui@kexinjinke.com

邮件咨询
微信咨询二维码
微信扫码 · 详细沟通产品方案