第一部分:RPA 的“手”——任劳任怨,但不懂业务

要理解进化,先看起点。十年前,银行的系统大多是“烟囱式”架构——核心账务系统、信贷管理系统、反洗钱平台各不相通,且没有开放的 API 接口。

RPA 就像一双“数字手”。它通过模拟人的鼠标点击和键盘输入,把不同系统串联起来。

  • 典型场景:每日日终对账。RPA 机器人自动登录核心系统下载流水,登录清算系统拉取台账,再登录 Excel 进行比对,最后标出差异项。
  • 核心原理基于固定规则的确定性执行。如果 A=1,则执行 B;循环执行 C 直到结束。

这个阶段,RPA 是“劳模”,但它不理解什么是“流水”,什么是“风险”。它只知道坐标和像素。一旦银行把登录验证码从数字换成滑块,RPA 就“抓瞎”了。这就是它的天花板:只解决“怎么做”,不解决“看什么”和“为什么做”。


第二部分:RPA+AI 的“眼”——看得懂了,但还需地图

随着 OCR(光学字符识别)和 NLP(自然语言处理)技术成熟,RPA 长出了“眼睛”和“嘴巴”。

  • 进化原理:AI 负责感知(看懂图片、读懂文字),RPA 负责执行(点击、输入)。
  • 银行典型应用智能审单。以前 RPA 只能核对 Excel 数字;现在,RPA+AI 可以接收客户微信发来的增值税发票照片(非结构化数据),通过 OCR 提取票面信息,通过 NLP 提取合同关键条款,然后填入信贷系统。

此时,RPA+AI 看起来已经很“智能”了。它甚至能根据预设规则(如“营收增长率 > 20% 且 负债率 < 60%”)自动判定“通过”或“退回”。

但为什么说它还不是真正的智能体(Agent)?
因为它的决策权极其有限。RPA+AI 依然是“被动的工具”。它像一辆开启了自适应巡航的汽车,能识别路况并自动加减速,但它永远不知道“要去哪里”,导航地图是人为画好的,路线也是固定的。面对“请帮我处理这起对公客户投诉,并优化他的还款方案”这种模糊目标,RPA+AI 只能愣在原地——因为它没有目标拆解能力


第三部分:真正的 AI Agent 长出“脑”——自己看地图,自己踩油门

AI Agent 和 RPA+AI 的本质区别,不是“能不能干活”,而是**“谁来决定下一个动作”**。

我们用一张 Mermaid 图来直观对比三者的底层逻辑差异:

传统RPA:流水线工人

人工设定死流程

固定触发条件

机械执行步骤1/2/3

异常?报错停止

RPA+AI:带传感器的工人

人工设定死流程

AI感知外部数据

根据IF-THEN规则判断

执行固定步骤

企业级智能体:带大脑的指挥官

人类输入模糊目标
(如:优化对账异常)

大模型规划器
(任务拆解与路径推理)

自主选择工具

调用RPA接口
(操作核心系统)

调用知识库
(查阅合规制度)

调用代码/API
(抓取外部数据)

观察执行结果

反思与再规划

智能体的核心飞越在于 “Plan-Do-Check-Act”(PDCA)闭环。它不再需要人类把每一步写清楚,只需要给一个终极目标。它会自己问自己:“要达到这个目标,我需要先查什么?再调用什么?如果失败了,有没有备选方案?”


第四部分:银行的“拦路虎”——为什么不能直接扔掉 RPA?

看到这里,你可能会想:既然 Agent 这么强,那银行直接把旧 RPA 扔了,全面上 Agent 不就行了?

绝对不行。 因为银行有一个致命的现实——“交易一致性”和“监管审计”

  1. 系统壁垒(“深水区”):银行最核心的账务主机(Mainframe)运行着几十年前的 COBOL 代码,没有 API,只有绿屏终端。能够“点击”和“输入”这个物理动作的,目前只有 RPA 这双“手”。Agent 的“大脑”再聪明,也伸不进这台封闭的钢铁怪兽里。
  2. 确定性的铁律:在涉及资金划拨时,结果必须是 100% 确定的。1 分钱都不能错。大模型存在“幻觉”(Hallucination),它可能把“100万”读成“1000万”。而 RPA 的每一步操作都有明确的日志,满足银保监会的审计合规要求。

所以,现实是:RPA 是智能体落地银行的“最后一公里执行器”。没有 RPA,Agent 就是个“纸上谈兵的谋士”;没有 Agent,RPA 就是个“不识抬举的苦力”。


第五部分:企业级智能体时代——融合,而非替代

那么,银行里真正的“企业级智能体”长什么样?我们以金智维的 Ki-AgentS 这类平台为例,拆解一下它的三层架构,看看它是如何把 RPA 当成“四肢”来用的:

自然语言指令

调用原子能力

强化学习反馈

确定性执行层

传统RPA机器人
(操作老旧主机/Excel)

标准API网关
(调用微服务)

人工复核节点
(合规强制介入)

认知与决策层(大脑)

语义理解与目标拆解

任务规划与路径选择

短期记忆/长期向量库

银行员工/客户

Ki-AgentS 智能体平台

执行结果与反馈

结合银行业务,把这个架构讲透:

假设行长下达目标:“排查过去一个月所有对公账户的大额可疑交易,并生成反洗钱报告。”

  • 传统 RPA:需要 IT 人员提前写好脚本:几点几分登录系统,点击哪个菜单,复制哪些字段。耗时 3 天开发。
  • RPA+AI:可以自动识别图片格式的流水,但依然需要人工指定“大额”的阈值(比如 500 万)。
  • Ki-AgentS 企业级智能体
    • 规划(Plan):大模型把目标拆解为“查交易流水 -> 关联企业工商信息 -> 比对黑白名单库 -> 生成结构化报告”。
    • 调用(Call):它发现需要登录核心系统,于是直接唤起 RPA 机器人(这里 RPA 退化为一个被调用的“工具函数”),获取原始数据。
    • 理解(Understand):Agent 读取 RPA 拿回来的数据,结合央行最新发布的《反洗钱风险提示》外部文档,动态调整“可疑”的语义判断(而不仅仅是死板的阈值)。
    • 执行与修正(Act & Reflect):在执行过程中,如果某个系统突然维护登不上了,Agent 不会像 RPA 那样报错崩溃,而是自主决策:“那我先走备用查询接口,实在不行就把这部分留到待办任务,等系统恢复后继续。”最后,它生成草稿报告,推送给合规经理人工确认(强制兜底)。

总结:

** RPA+AI 是**“自动化”的延伸**,它解决了“非结构化数据的结构化输入”问题,但控制权依然在人类手里

而 AI Agent 是**“自主化”的萌芽**,它解决了“面对复杂目标如何动态决策”的问题,控制权部分让渡给了机器

但在银行这个严苛的土壤里,从来不存在谁取代谁
未来的企业级自动化,一定是 “Agent 的脑 + RPA 的手 + 合规的闸” 三位一体。RPA 不仅不会死,反而会因为 Agent 的普及,从“前台跑腿的小弟”晋升为“不可或缺的核心执行层”。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐