具身智能区别于传统人工智能的根本特征,在于它必须通过物理躯体感知外部世界、响应环境变化并完成实际任务。这一过程的本质,是构建一个从感知到决策再到执行的完整闭环。然而,如何真正打通这三个环节,使机器能够在非结构化环境中像人一样“看得见、想得通、做得准”,仍然是当前具身智能领域最具挑战性的核心命题。

文章配图-1

传统机器人技术采用模块化堆叠的架构:视觉模块识别物体,自然语言模块解析指令,控制模块生成动作。这种“流水线”式的设计存在三个结构性断层。其一是信息衰减——模块之间传递数据时会丢失关键细节,例如杯子的精确位姿;其二是误差累积——视觉定位仅2毫米的偏差就可能导致抓取失败;其三是响应延迟——多模块串联处理的总耗时远超人类的反射速度。这些断层本质上源于“知行分离”的设计惯性——感知、决策、执行被视为彼此独立的工序,而非一个有机的整体。

针对这一问题,当前学界与产业界形成了两条主要的技术路线。

文章配图-1

一条是端到端(End-to-End)路线。以视觉-语言-动作模型(VLA)为代表,这类方案通过统一的Transformer架构,将原始视觉信号和语言指令直接映射为动作参数。谷歌RT-2模型在真实场景中将动作成功率提升了40%以上,关键就在于实现了感知与执行的联合优化。端到端路线的优势在于避免了模块间的信息损耗,具备较强的泛化能力。但其局限也同样明显:模型是一个“黑盒”,决策过程难以解释,调试和故障排查十分困难。

另一条是分层决策(Hierarchical Decision-Making)路线。这一架构借鉴了生物体的“大脑-小脑”分工机制。“大脑”负责高层级的任务理解、环境感知与智能决策,“小脑”负责将抽象指令转化为具体的运动轨迹和实时控制。智微智能的具身智能解决方案便采用这一架构:当机器人接收到指令后,“大脑”进行任务理解和规划,“小脑”负责将指令转化为动作。分层架构的优势在于可解释性强、工程可控性高。其挑战在于层与层之间的接口定义和信息传递——如果“大脑”输出的规划无法被“小脑”精准执行,闭环同样无法形成。

文章配图-1

两条路线并非截然对立。越来越多的实践表明,短程任务适合端到端模型直接解决,而长程、复杂任务则需要引入分层机制,实现“直觉反应”与“理性思考”的协同。

架构的落地最终要依赖硬件的支撑。单一架构的芯片无法同时满足感知所需的高通量数据处理、决策所需的大模型推理以及执行所需的低延迟实时控制。异构计算因此成为必然选择。2025年6月,地瓜机器人发布了行业首款单SoC算控一体化开发套件RDK S100,在单一芯片上整合了CPU、BPU与MCU。CPU和BPU负责运行视觉语义检测等大模型,为决策提供数据支持;MCU负责实时运动控制,与BPU紧密协同输出动作指令。这种设计让“大脑”与“小脑”在硬件层面实现了异构与协同,兼顾了感知推理与实时控制的双重需求。以“拿取杯子”为例:CPU和BPU同步处理人类指令与视觉信息,完成决策规划;MCU基于规划结果实时输出关节控制信号,精准完成抓取动作。从感知到执行的完整闭环,正是在这种软硬协同的架构中才得以真正打通。

文章配图-1

打通感知、决策与执行的闭环,其意义不止于技术层面的效率提升。它标志着具身智能正从“离身计算”走向“具身交互”,从被动的程序执行走向主动的环境适应。对于人工智能、具身智能与嵌入式专业的学生而言,理解这一闭环的架构逻辑——包括端到端与分层的权衡、大脑与小脑的分工、异构芯片的协同——是进入这个领域的基础功课。未来的智能体不再是“想一套、做一套”,而是感知即决策、决策即执行的统一整体。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐