从大模型到AI执行系统:为什么你的Agent项目还停在Demo?
本文整理自 AICon深圳2026 主题分享:王仿 — 从大模型到 AI 执行系统:构建企业级可控 Agent 体系,演讲时长 39 分钟。通过 Ai好记 音视频转图文笔记工具进行转录与智能总结,以下为精炼后的会议笔记内容。

你们的Agent项目是不是也卡在Demo阶段——演示的时候跑得挺好,一上生产就各种翻车?
王仿在AICon深圳2026上直接点破了原因:个人辅助工具70%-80%的准确率就够用了,但企业应用必须达到90%以上才敢上线。 这不是一个优化问题,而是一个系统工程问题。从Demo到生产,中间差了整整一套AgentInfra层。
四大卡点,卡住90%的Agent项目
卡点一:场景选不准
最常见的做法是选"做错也没关系"的边缘任务,比如客服问答、行政机器人。这类任务确实安全,但价值稀薄,不值得投入真金白银。而真正需要AI介入的人力密集型和知识密集型场景,又因为复杂度太高而不敢碰。
卡点二:复杂业务逻辑讲不清楚
王仿举了一个包装材料质检审核的例子。60-70项审核标准,背后十几份国家法律法规文件且不断更新;审核字段在不同类目(猫粮vs狗粮)、不同出口国家(越南vs菲律宾)标准完全不一样;实体别名、型号参数表述方式千差万别。
业务专家要花很长时间才能把这些逻辑讲清楚——不讲清楚,一做就错。
卡点三:跨系统集成困难
企业内部系统远比想象中复杂,Agent要调用的API可能横跨五六个部门、七八个系统,每个系统的权限管控、数据格式都不一样。
卡点四:ROI算不清
上线之前,谁也不知道这套Agent系统到底值不值。老板要算账,但Agent的ROI不能简单按"节省了多少人力"来算,因为它的价值可能体现在流程优化、错误率降低、响应速度提升等多个维度。
王仿特别提醒了一个容易犯的错:“有些人做起来都费劲的任务,你试图交给AI,结果肯定不可信。”
八大维度,影响Agent的准确率
为什么企业级Agent必须达到90%以上准确率?因为影响准确率的因素太多了,任何一个环节出问题,结果就不靠谱:
| 维度 | 典型问题 |
|---|---|
| 上下文准确性 | Agent忽略历史对话中的关键信息 |
| 知识准确性 | 引用过时或错误的知识条目 |
| Skill设计质量 | 功能边界模糊,执行超出预期 |
| 工具选择准确率 | 调用错误的API或系统 |
| 执行准确率 | 超时、失败时无合理兜底策略 |
| 状态一致性 | 长链路任务中状态丢失 |
| 长链路可靠性 | 单步出错导致整个链路崩溃 |
| Runtime准确率 | 底层运行时环境不稳定 |
一个典型例子:客服场景中用户问"产品有没有美白效果",无约束时Agent可能根据成分推断"肯定有"。但这句话可能违反广告法,消费者可以投诉虚假宣传。边界标准不明确,Agent一定会说错。
解决思路:蒸馏"任务",而不是蒸馏"人"
很多企业踩过的一个坑是"数字员工"思路——试图用模型蒸馏一个人的能力,把这个人变成数字员工。
王仿指出这是错的:人面临的任务和标准在不断变化,你蒸馏一个不断变化的东西,根本做不到。
更务实的路线是"任务蒸馏"。进出口报关、供应商审核、质检报告这类有明确SOP的任务,才是最容易落地的切入点。具体做法是按三层结构定义:
- 业务事实:任务要解决什么问题?比如"新品增长"还是"去库存增长",聚焦哪个平台
- 业务约束:哪些可以做?品牌调性、预算、ROI的底线在哪里
- 可执行动作:调用哪些系统?权限如何控制?结果如何写回?
这个过程需要大量投入。王仿给出的时间分配很有参考价值:40%-50%的时间与业务专家共创,让专家讲清楚边界、目标、逻辑;真正开发时间仅占30%;剩余20%-30%是上线陪跑阶段。
八个核心系统,构成AgentInfra层
业务翻译完成后,进入工程化阶段。AgentInfra层包含八个核心系统,覆盖从"理解需求"到"执行交付"再到"持续优化"的全链路:
- 业务翻译系统:将业务需求转化为Agent可理解的契约
- 知识引擎:结构化存储与检索企业知识
- Skill研发管理系统:定义、注册、维护原子执行能力
- 定制化Runtime:Task与Skill的绑定、执行与调度
- 多Agent协作引擎:复杂场景必然涉及多Agent协作,需要解决任务拆解、路由、并发控制以及每个Agent的专业边界控制
- Trace可观测体系:全链路追溯——每个步骤调用了什么知识、什么工具、返回了什么结果,全部可查
- 质量复核与异常判断:任务完成后的自动校验
- 自学习语料系统:通过Trace数据持续优化Agent质量
实践效果:从半小时到分钟级
一个具体的落地案例:报关审核。前端提交大量商品图片、Excel文件,过去需要人工逐一解析几十个字段,审核校验,生成报关文件、装箱单、合同——人工完成一次需半小时以上。
AI化改造后,邮件附件拖入系统自动形成任务流,20个报关需求自动生成20个任务流,自动解析、分析、判断,核心节点加一道人工校验。四五十个任务半小时处理完,过程可追踪、有留痕。
以前一个人一天处理三四十个报关单就到顶了,现在同样的时间能处理上百个,效率提升3倍以上。
最后一个洞察:框架比Agent本身更有价值
王仿最后分享了一个重要结论:Agent本身不具备复制性。
自然堂的导购机器人搬到欧莱雅完全不适用,医疗场景的方案搬到教育场景也得重来。但搭建过程的框架是具备复制性的——流程有流程模板,任务有任务模板。
这意味着什么?意味着你不需要每次从零开始造Agent。只要把AgentInfra层搭好,后续不同场景的Agent落地,就是"套模板、填内容"的事。
这才是AgentInfra层的真正价值:不是给每个企业造一个Agent,而是给每个企业一套能造Agent的流水线。
以上内容由Ai好记转录整理。Ai好记是一款支持音视频转录与总结的AI学习助手,支持解析B站、抖音、小宇宙等平台链接及本地/网盘音视频文件,转文字后自动截取PPT关键帧,生成精华速览、思维导图和结构化图文笔记,帮助你把几小时的会议内容变成可搜索、可复习的图文笔记。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)