我有个朋友在银行做运营。他们部门上了RPA,每天自动处理几千笔对账,领导觉得终于用上人工智能了。结果有次银行系统升级,按钮挪了位置,机器人瞬间瘫痪,几千笔账全卡在流程里。朋友跟我抱怨:这AI怎么这么笨?我说:它根本就不是AI,它只是把你的鼠标键盘操作录下来,然后无限回放。

很多人分不清RPA和AI Agent,这很正常。因为从外部看,它们都在代替人操作电脑,但内里是完全不同的两种物种。今天我想把这个区别讲透。
RPA是升级版的Excel宏
RPA全称Robotic Process Automation,机器人流程自动化。它的核心思路特别朴素:你操作一遍软件,工具把你的点击、输入、滚动动作录制下来,生成一套脚本;下次它就能照着脚本重复执行。说好听点叫流程自动化,说难听点就是UI自动化测试的亲戚。
Robotic process automation (RPA) is a software technology that makes it easy to build, deploy, and manage software robots that emulate human actions interacting with digital systems and software. ——UiPath官方定义
RPA不是靠截图来识别界面元素的,它靠的是选择器(selector)。你可以把选择器理解为每个按钮、输入框的“身份证号”——包括窗口标题、控件ID、HTML属性等。只要这些信息不变,RPA就能精确定位并操作。但问题也在这:一旦系统升级,按钮换了位置,身份证号变了,RPA就找不到了。
所以RPA的适用场景非常苛刻:流程必须稳定,输入必须结构化,每一步都是明确的if-then。它就像一个照本宣科的实习生,你教它怎么做,它永远不会举一反三。
AI Agent是边想边做的实习生
AI Agent是另一种东西。它不是录制脚本,而是给一个大模型一个目标,让它自己决定怎么完成。比如你让Agent“把发票信息录入系统”,它会自己规划:先识别发票内容,再提取字段,再调用系统API写入。遇到不清楚的地方,它会尝试别的办法,或者向你提问。
Agents are systems where the model dynamically directs its own processes and tool usage, maintaining control over how it accomplishes tasks. ——Anthropic《Building Effective Agents》
Agent的工作循环可以拆成四步:
- 接收目标:你给它一个自然语言指令,而不是一串脚本。
- 分解任务:大模型把目标拆成子任务,比如“提取发票信息”需要OCR、字段映射、数据校验。
- 调用工具:它自己决定用哪个工具,可能是API、代码解释器、浏览器,甚至调用一个RPA机器人。
- 观察反馈:每次操作后,它看结果是否符合预期,不符合就调整策略,再试一次。
这个循环叫ReAct(Reasoning + Acting),本质是“想一步,做一步,看一步”。所以Agent能应对环境变化——按钮挪了位置,它会自己重新找入口,而不是直接瘫痪。
一张表说清两者的区别
把RPA和Agent放在一起对比,差异非常明显:
| 维度 | RPA | AI Agent |
|---|---|---|
| 核心机制 | 录制-回放/脚本执行 | 模型自主规划+工具调用 |
| 输入类型 | 结构化数据为主 | 结构化+非结构化(自然语言、图片) |
| 异常处理 | 遇到规则外情况就停 | 根据反馈调整策略 |
| 决策方式 | 确定性,if-then | 概率性,动态决策 |
| 可解释性 | 每一步可追溯 | 决策过程不透明 |
| 部署成本 | 较低,但维护成本高 | 较高,需要模型和推理资源 |
| 适用场景 | 稳定、重复、规则明确 | 开放、多变、需要理解 |
注意最后一行:RPA适合的是“稳定重复”,Agent适合的是“开放多变”。这决定了它们根本不是同一类工具。
为什么RPA总被当成AI?
你可能发现了,很多RPA厂商都在宣传自己是AI,甚至提供了AI Center、OCR识别模块。我最早也以为RPA就是AI——直到我用UiPath的AI Center试了一次,才发现里面的模型是单独训练的,RPA只是调用模型的API,流程依然是死板的脚本。
换句话说,这是AI增强的RPA,不是AI Agent。RPA依然是那个提线木偶,AI模型只是它手里拿着的一个道具。真正的Agent,整个木偶都是自己动脑子的。
IBM的对比分析里说得很直接:RPA是规则驱动的,AI是数据驱动的。RPA不知道自己在做什么,它只是按指令执行;AI则能从数据中学习模式,并做出决策。IBM对RPA与AI的对比
Agent能取代RPA吗?我的判断
这是所有人最关心的问题。我的答案是:短期不能,长期会部分取代。
可靠性是RPA最大的护城河。RPA是确定性执行,每一步都能审计,出了问题知道在哪。Agent是概率性决策,大模型可能产生幻觉,导致错误操作。银行、医院、政务这些场景,不敢让一个概率模型完全自主。
成本也很现实。RPA跑一个流程,消耗的是服务器资源;Agent每调用一次大模型,都要付推理费用。同样是处理一万张发票,RPA的成本是固定的,Agent的成本可能让你心疼。
但Agent有一个RPA永远做不到的能力:处理长尾。RPA只能处理你预先设计好的流程,而Agent可以应对各种没见过的奇葩输入。Anthropic在文章里也建议:如果任务需求稳定,优先用工作流(workflow),而不是Agent。这句话反过来理解就是——Agent只适合那些规则实在定不下来、必须靠模型临场发挥的任务。
所以我的判断是:RPA和Agent不是替代关系,而是互补关系。未来的智能自动化,很可能是Agent当大脑,RPA当小脑。Agent负责理解任务、制定计划,RPA负责执行具体的鼠标键盘操作。
几个常见问题
Agent会不会在自动化流程中乱操作?
会。这是Agent目前最大的风险。大模型的概率决策可能产生幻觉,导致错误操作。所以现在主流方案是“人机协同”,关键步骤让人类确认,而不是完全放手。
RPA是不是要被淘汰了?
不会。RPA的确定性和可审计性,在很多行业是刚需。而且RPA也在进化,它可以作为Agent的工具被调用。你甚至可以这样理解:Agent负责思考,RPA负责动手。
怎么选?
规则明确、流程稳定的用RPA;任务开放、需要理解的用Agent。预算充足的话,构建“Agent+API+RPA+人工审批”的混合系统,是当前最务实的选择。
回到我朋友那个银行。他们最后换了一个带AI能力的RPA工具,遇到按钮找不到时,会自动通过视觉识别重新定位。但本质上,这还是在给RPA打补丁。真正要想让机器人自己找路,你需要的是Agent。
一个录屏回放,一个自主决策。这两者之间的鸿沟,比大多数人想象的要深得多。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/242.html