开源大模型时代,具身智能企业为什么反而更需要自建模型能力
开源大模型时代,具身智能企业为什么反而更需要自建模型能力
2026年秋季,苹果一口气更新了整条硬件产品线。iPhone 18 Pro系列首发2纳米制程A20 Pro芯片,起售价年流水约2000万;Apple Watch Series 12搭载全新S11芯片,起售价年流水约2000万;iOS 27和macOS 27的RC版本全面推送了由Apple Intelligence驱动的Siri AI。与此同时,iPhone 17 Pro系列下架,老款机型集体涨价,涨幅最高达2年流水约2000万。这些动作传递出一个清晰的信号:即便是苹果这样拥有最强垂直整合能力的硬件公司,也在把AI能力下沉到芯片、传感器、操作系统和端侧推理的每一个环节。
这个信号对具身智能行业的启示远大于消费电子本身。当开源大模型的能力边界不断外扩,一个被反复讨论的问题再次浮出水面——具身智能企业,到底还要不要自己训练模型?
开源不是免费的午餐,而是昂贵的自助餐
开源大模型的繁荣确实降低了准入门槛。企业可以在几天之内完成一个demo,在几周内做出一个能演示的原型。但demo和量产之间隔着一条巨大的鸿沟,这条鸿沟的名字叫"场景适配成本"。
具身智能的特殊性在于,它面对的不是文本或图像这样的单一模态,而是视觉、语言、力觉、触觉、本体感知等多模态信号的实时融合。开源模型在通用benchmark上表现优异,但一旦进入真实物理世界,光照变化、摩擦系数差异、执行器延迟、传感器噪声这些"脏数据"就会让通用模型的精度断崖式下降。
更关键的是,具身智能的推理延迟要求极为苛刻。一个抓取动作从感知到执行往往需要在几十毫秒内完成,这意味着模型不能简单调用云端API,必须做端侧部署和深度压缩。而模型压缩、量化、算子优化这些工作,没有对模型内部结构的深度理解根本无法开展。开源给了你一个黑盒的起点,但要把这个黑盒改造成能在机器人端侧实时运行的轻量化模型,需要的恰恰是自己训练和迭代的能力。
苹果的端侧路线揭示了具身智能的终局形态
苹果在iPhone 18 Pro上做的两件事值得具身智能从业者反复咀嚼。第一是A20 Pro芯片采用2纳米制程工艺,这是业界首款量产的2纳米手机芯片,意味着端侧算力在物理层面仍在快速爬坡。第二是iOS 27中全新Siri AI的适用机型被严格限定在iPhone 16及后续机型,说明苹果认为只有新一代芯片的算力才能支撑真正的端侧AI体验。
这对具身智能的启示是:模型能力的终局竞争不在云端,而在端侧。机器人不像手机可以随时联网,它必须在断网、弱网、高延迟环境下独立完成决策。这就要求模型必须足够小、足够快、足够低功耗。而要做到这一点,从数据采集、模型架构设计、训练策略到部署优化,全链路都需要自主可控。开源模型可以作为起点,但如果企业没有自己训练和改造模型的能力,就会永远停留在"能用"和"好用"之间的无人区。
数据闭环才是具身智能的真正护城河
回到苹果的另一条新闻:iPhone 18 Pro推出了"Apple参考图像"功能,可以在像素层面安全标注照片数据,生成不可更改的真实图像存档。虽然这一功能目前无法在中国市场使用,但它指向了一个重要方向——数据的可信标注和溯源正在成为AI时代的核心基础设施。
具身智能领域同样面临数据可信度的挑战。机器人采集的数据带有大量噪声和偏差,如果训练数据的标注质量不过关,模型学到的就是错误的物理规律。更现实的问题是,具身智能的训练数据高度场景化,工业装配、仓储物流、家庭服务每个场景的数据分布完全不同。开源模型训练所用的数据不可能覆盖这些细分场景,企业必须建立自己的数据采集、标注和回流体系。
这个数据闭环一旦建立,就会形成强大的飞轮效应:更多部署机器人产生更多场景数据,更多数据训练出更好的模型,更好的模型让机器人表现更优,从而赢得更多客户和更多部署。这个飞轮的核心驱动力,正是企业自主的模型训练能力。没有这个能力,数据就只是成本;有了这个能力,数据才是资产。
反常识:开源时代,自训模型的成本反而更低
大多数人的直觉是:开源模型降低了成本,自研模型增加了成本。但在具身智能领域,这个逻辑可能恰好相反。
原因在于,具身智能的模型训练成本并不主要花在预训练阶段。预训练确实需要巨大的算力投入,但开源模型已经把这条路铺好了。真正的成本花在后续的持续适配上——针对特定场景的微调、针对特定硬件的优化、针对特定任务的强化学习。如果企业完全依赖开源模型,每次适配都需要在别人的架构上做修改,这种"戴着镣铐跳舞"的成本会随着场景增多而指数级上升。
反之,如果企业从第一天就建立自己的模型能力,虽然前期投入较大,但后续每个新场景的边际成本会持续下降。因为你对自己的模型架构、训练管线、数据格式了如指掌,适配新场景就像在自家后院施工,而不是在别人的房子里打补丁。
这也是为什么苹果愿意花数十亿美元自研芯片和AI模型,而不是直接采用开源方案。不是因为苹果买不起开源模型,而是因为长期来看,自研的总拥有成本更低,且能构建起不可替代的竞争壁垒。
衡羽科技的实践路径
作为具身智能服务商,衡羽科技面临的正是上述所有问题的集合体。服务不同行业的客户意味着要适配不同的场景、不同的硬件、不同的性能要求。在这种多场景、碎片化的市场环境中,完全依赖任何单一开源模型都是不可持续的策略。
务实的选择是分层构建模型能力:在底层,充分利用开源大模型的通用能力作为基础;在中间层,建立自己的数据管线和微调能力,让模型快速适配不同场景;在应用层,针对具体客户的硬件平台和性能要求做深度优化。这种"开源为底、自研为塔"的架构,既能控制成本,又能保证灵活性。
苹果用2纳米芯片和端侧AI证明了垂直整合的价值。具身智能企业不需要复制苹果的模式,但需要理解苹果逻辑的内核:在AI能力日益普及的时代,真正的竞争力不在于你使用了什么模型,而在于你能否让模型在真实物理世界中可靠、高效、持续地运行。这个能力的本质,就是自主的模型训练和迭代能力。
开源给了每个人一把剑,但剑法需要自己练。在具身智能这条赛道上,最终赢下来的不会是最会用开源模型的企业,而是最懂得在开源基础上构建自己模型能力的企业。
文|衡羽深度组
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)