AI智能系列(4)| MCP协议与具身智能Agent
上一篇聊多 Agent 时留了个尾巴:协作接口不标准化,轨迹就没法跨系统重放。真把这件事做在接口层的,是一份开放的应用侧协议——它规定 AI 应用怎么发现外部能力、怎么发起调用。问题在于:当一个 Agent 要驱动一台会干活的设备时,这套约定还够用吗?
据该协议官网博客,其一级开发工具包月下载量已接近五亿次。痛点在两端膨胀:一侧模型在换代,一侧是机器人、夹具、传感与业务系统各有一套接口,两两适配成本随数量相乘。企业AI化转型里常见一种期待——接上协议就能动;值得先看清楚它管到哪一层为止。
本文相关概念速查
模型上下文协议,约定 AI 应用如何对接外部能力的开放标准;宿主,用户直接接触的应用,决定模型能用哪些上下文与工具;服务端,把能力包装并暴露的一方;工具,可被模型主动调用的动作;资源,可被按需读取的上下文;具身智能Agent,有身体、在真实环境里感知并行动的系统;闭环时延,从感知到执行再回到感知的耗时。
一、它是什么:三方角色与两趟往返
最小结构里有三方:宿主是用户直接接触的应用,它为每一个服务端创建独立的连接,并决定模型能用到哪些上下文与工具;服务端负责把能力包装后暴露出来。消息以 JSON-RPC 为基础,能力分三类:工具、资源、提示词模板。
关键在“发现—描述—调用”三段分离。想知道对面有什么,就发一次发现;工具的名称、参数格式与说明随描述返回,模型靠读说明决定何时用、怎么传参。于是新增一种能力不必重训模型,也不必为每个模型单独写一遍适配。
二、三条主流玩法
第一种是把机器人技能包成服务端的最小单元。粒度是关键:暴露“移动到某坐标”这类语义动作,而不是甩出一堆关节力矩指令。太粗编排不开,太细则一次任务要做几十次往返,延迟与控制权一起失控。
第二种是把上下文做成资源。地图、关节角度、传感读数不必一股脑塞进提示词,按需读取即可,列表自带缓存提示。好处是上下文不被观测数据挤爆,注意力留给真正的选择。
第三种是用两项较新的扩展。搬运、巡检这类动作常要跑几十秒甚至几分钟,交给任务扩展后不必阻塞等待:服务端返回任务标识,客户端按间隔查状态,缺输入时补一次。执行前需人点头的动作走多次往返请求,由服务端在途中回问、客户端补答复。
三、三条硬边界
其一,时间尺度对不上。最新版规范把内核改成无状态的一问一答,连会话都不再保留。它能跑在普通负载均衡后,也意味着天生按“一次请求、一次回答”设计;而控制闭环要的是固定周期——间隔忽长忽短比整体慢一点更危险,抖动足以让平衡与柔顺接触失稳。
其二,完成不等于成功,取消不等于停下。状态走到终点只表示流程结束,结果仍可能带着错误标记;“取消”在规范里是协作式的,服务端确认收到意图,却不必保证立刻中断,也不回滚已发生的变化。物理动作没有撤销键。
其三,边界由实现方承担。规范把“能看什么、能调用什么”连同许可与安全责任留在宿主侧。机制上给了便利:方法名与工具名进了传输头,网关可直接按头鉴权与限流;但哪个动作该放行,没有任何东西替你判断。

图2:两种错位介绍图
四、交集与影响
它与机器人中间件不是替代关系。协议跑在意图层,回答“做什么”;中间件跑在实时层,回答“这一毫秒出多少力矩”。两者是上下层,中间需要薄薄一层翻译做尺度转换。该不该上,看三个问号:时间常数在毫秒级还是秒级以上;做错能否撤销;出错能否被观测接管。
五、全文总结
收敛成三个判断:其一,按时间常数分层,毫秒级的稳定性交给本地闭环,语义选择才走协议;其二,工具描述要写明适用条件与失败返回什么,名字漂亮不如约束清楚;其三,不可逆动作前置到权限清单,逐动作授权留痕,并留出人点头的通道。
一句话版本:给机器人的能力装上标准插座,换来的不是更强的脑子,而是“换个模型不必重写一遍驱动”——让能力第一次有了可发现、可治理的接口形态;至于能不能稳稳把水杯端起来,仍然由本地闭环说了算。企业AI化转型中,值得先确认这条边界。
六、未来展望
三个方向值得留意:一是意图层与实时层混合编排,两类消息各走各路;二是能力凭证化,每个动作自带权限范围与可逆性标签,网关据此决定是否放行;三是仿真回放标准化,让同一份轨迹可离线复跑、成为可比基准。
七、技术FAQ
1. 这份协议和普通函数调用有什么不同?
函数调用多绑定在某家模型的接口上,工具清单由调用方维护;它把发现、描述与调用拆成通用约定,服务端换批宿主仍能被找到,权限也能收口。
2. 接上统一协议后,模型能直接驱动电机吗?
不建议。它适合表达“移动到某处”这类语义意图,毫秒级的力矩输出属于本地控制器。中间应有翻译层把技能转成确定轨迹,并对超时设兜底。
3. 为什么机器人对延迟特别敏感?
控制回路要的是稳定周期而非平均值。请求—响应式的调用天然带抖动,间隔忽长忽短会让平衡、抓取直接失稳,所以要按时间常数分层。
4. 任务显示完成,物体却没抓稳,问题出在哪?
出在缺少可核实的物理回执。状态到终点只说明流程结束,结果还可能带错误标记。应让服务端执行后回读力传感或视觉复核,并写清失败语义。
5. 哪些动作不适合交给模型自主决定?
不可逆、后果外溢的那些:通电、解锁、开门、转动刀具。它们应进权限清单前置管理,执行前由确定性校验把关或人工确认,并逐次留痕。
——————————
本文仅代表作者个人行业观察,不构成任何商业建议。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)