AI PRACTICE

金融行业的垂类智能体定制开发:能跑通演示的很多,能进生产的很少

一个金融场景的智能体演示,三周就能做出来:接上大模型,挂一个知识库,问什么答什么,会议室里效果很好。

一年以后再看,它还在会议室里。

这类现象并非个例。**演示主要考察模型能力,生产运行还要考验模型之外的五件事。**这五件事决定了一个智能体能否进入投研流程、授信审批和合规检查,也决定了机构应当如何选择定制开发团队。下面逐一分析这五道门槛,文末附一张选型自查清单。

演示通过的智能体与能进生产的智能体之间隔着五件事

一、金融场景的第一道门槛,是能不能交出证据链

通用问答允许"大致正确"。金融业务不允许。

一份研报摘要、一条授信建议、一个风险提示,只要进入业务流程,就必然有人要问:**这句话是从哪来的?**来自哪份公告的第几段、哪一期财报的哪个科目、内部台账的哪一条记录。无法复核的结论不能进入业务流程,即使结论本身可能正确。

所以金融垂类智能体的底层能力在于溯源:每一句结论都要能指回原始出处。“会回答"只是起点。这要求系统在检索阶段就保留出处,在生成阶段强制引用,在输出阶段把证据和结论一起交出来。做不到这一点的方案,无论演示多流畅,都进不了需要签字的环节。

对你意味着什么:评估一个智能体方案,先别问准确率,先问"错了以后,我能不能在三十秒内定位到它是被哪条材料带偏的”。

金融智能体的证据链要在检索阶段留出处并在生成阶段强制引用

二、投研、授信这类长流程,单个智能体做不完

演示里的智能体只做一件事:接一个问题,给一个答案。真实的金融业务不是这个形状。

一次尽调要走完信息收集、财务核验、舆情扫描、同业对比、风险点归纳、结论撰写;一笔授信要走完资料齐备性检查、征信与登记信息核验、担保物核对、政策合规校验、审批意见生成。这是一条流水线,不是一次问答。

把长流程交给一个"大而全"的提示词,结果一定是不稳定:这次漏了舆情,下次编了个数据,你无法定位是哪一步出的问题。正确做法是把流程拆成工位,每个工位职责单一、输入输出结构化、可以被单独检查和替换:检索的只管检索,核验的只管比对,撰写的只管组织语言,合规的只管拦截。多个智能体分工协作,关键节点由规则层把关。

拆成工位之后,出问题时你知道该修哪个工位;换模型时你知道该重测哪一段。可维护性来自可分解性。

授信审批流程拆成五个工位后每个工位可以单独验收和替换

三、第二轮对话就退化,问题出在上下文工程,不是模型不行

很多智能体第一个问题答得漂亮,追问两轮就开始胡说:忘了刚才的持仓、忘了客户已经说过的行业、把上一轮的结论当成新事实。

问题的根源在于上下文尚未得到工程化管理,而非模型能力不足。一次高质量回答所需的输入具有明确结构:客户是谁、历史交互产生了什么、当前任务需要哪些外部数据、必须遵守哪些规则、上一个工位交付了什么。这些内容需要被主动装配。直接堆叠聊天记录只会增加噪声,内容越多,关键信息越容易被淹没。

金融场景对这件事格外敏感,因为它的上下文天然是多源的:行情、公告、研报、监管口径、内部台账、征信与担保登记信息,每一源的格式、时效和可信度都不一样。谁能把它们组织成一份干净的上下文,谁的智能体就专业。

对机构而言,验收时不能只测试单轮问答,还要连续测试五轮,检查记忆是否保留、前序结论是否得到正确沿用。

直接堆叠聊天记录与主动装配任务上下文会产生不同的信息质量

四、没有评测集,你无法证明它今天比上周好

这是最容易被跳过、也最致命的一步。

智能体与传统软件不同。传统软件修改一行代码,影响范围相对确定;智能体更换一个提示词、升级一次模型版本,可能修复三个问题,同时又引入五个新问题。没有一套固定考题,就只能凭感觉判断"好像变好了",而金融业务不能依赖主观感觉。

一套合格的评测集,是几十到几百道带标准答案的真实业务题:这份材料该不该拦、这个风险点该不该提、这条结论的引用对不对。每次改动后都要完整运行并检查分数,分数下降就不能上线。这套题必须由业务专家参与设计,其本质是把专家的判断标准固化下来,不能由技术团队自行闭门编制。

配套要求还包括围栏和留痕:哪些事项智能体不能自行决定,必须转人工;每次调用记录了什么,包括谁发起、使用了哪些材料、给出什么结论。在金融行业,留痕属于准入要求,而非附加加分项

每次改动都要运行完整评测集,分数下降时应阻止版本上线

五、进生产考的是系统工程,不是提示词技巧

最后一道门槛,把大多数团队挡在外面。

会写提示词、会搭工作流,能做出演示。但要进生产,你面对的是另一组问题:多人同时用会不会排队、模型超时了怎么降级、长任务怎么异步跑、出错了在哪看日志、权限怎么隔离(一个客户经理不该看到另一个客户的材料)、数据能不能出内网。这些是标准的后端工程问题,和大模型没什么关系,却是"能演示"和"能上线"之间的全部距离。

现成的智能体平台和知识库工具,可以支持前期原型搭建、验证和流程跑通。但后续还要接入机构自身的业务系统:把智能体输出写回审批单,从核心系统取得实时数据,在现有权限体系内运行,并按合规要求留痕。这一阶段无法由平台代为完成,必须依靠工程能力完成系统衔接。

这也是我们坚持"垂类系统 + 智能体"组合的原因:前台是为业务量身定制的系统,智能体在后台承担判断和生成,人在关键节点签字,流程在系统中留痕。智能体并不替代系统,而是嵌入系统运行。

询价之前,先用这六个问题筛一遍

不管是自建团队还是找外部合作方,把这六个问题问出去,答案的质量会立刻分层:

  1. 智能体给出的每条结论,怎么追溯到原始材料?出错时多久能定位?
  2. 我们这条业务流程,你打算拆成几个工位?每个工位怎么单独验收?
  3. 连续多轮之后,它靠什么记住前面的信息?上下文里都装了什么?
  4. 评测集谁来出题、多少道、每次改动是否强制回归?分数掉了会不会拦住上线?
  5. 哪些决策它不能自己做?留痕记录到什么颗粒程度,能不能满足我们的审计要求?
  6. 它怎么接进我们现有的系统和权限体系?数据出不出内网?

能把这六个问题答清楚的团队,通常不需要你再问技术栈;答不清楚的,演示做得再好也别急着签。

用六个问题筛选金融智能体定制开发团队的自查清单

可信金科长期在金融行业开展两类工作:一是开发征信接入、动产融资登记、担保风控等垂类业务系统;二是把智能体嵌入这些系统的实际流程。我们的工程师会进入业务现场,与业务专家共同把判断标准转化为可回归验证的考题。金融场景智能体的最终竞争力来自工程能力,模型只是基础。

业务咨询

文中涉及的征信监管改造与 AI 智能体落地问题,可通过邮件或微信与我们联系。

fuyuanhui@kexinjinke.com

邮件咨询
微信咨询二维码
微信扫码 · 详细沟通产品方案