目的:了解当前行业模型情况,“机器人/具身智能方向有哪些模型可用?其中有没有 NVFP4 量化版?”
适合读者:正在做机器人端侧部署、或关注具身智能模型选型的工程师与研究者。

摘要

  • NVFP4 侧:ModelScope 上 NVFP4 量化的视觉多模态模型共 133 个(调研时查找到的数量),全部是 QwenGLMGemmaKimi 等通用大模型的量化版,很少具身智能专用模型
  • 具身侧:ModelScope 的"具身智能"分类下有 621 个模型(调研时点快照),主力是 VLA 操作模型π0/π0.5GR00TOpenVLALingBot小米 Robotics腾讯混元 Hy-Embodied 等),外加具身大脑、导航、世界模型几条支线;国产厂商 2026 年发布密集
  • 交叉结论:调研时点未发现具身模型提供 NVFP4 版本,均为原版 BF16/FP 权重。"NVFP4 + 具身智能"目前基本是个空白,而主流 VLA 只有 0.45B~14B,自行量化的门槛并不高——想在 Blackwell 显卡上跑机器人模型,只能自己动手,但这条路走得通。
  • 选型速查:上手选 SmolVLAπ0;端侧中文选 MiniCPM-RobotManip;人形选 GR00T(N1.7 已 Apache-2.0,可商用)。

一、调研思路与流程

本次调研从"NVFP4 量化模型"出发,逐步扩大到整个具身智能模型生态,流程如下:

没有

沾边候选

起点:NVFP4 + 视觉多模态理解筛选页
共 133 个结果

其中有机器人/
具身智能模型吗?

切换检索口径:
具身智能 robotics 任务分类
共 621 个模型

视觉定位 / 指向 / 空间感知类
Qwen3-VL 底座等

按技术路线分类梳理
VLA / 具身大脑 / 导航 / 世界模型

行业公开资料
附件文档

全球代表模型全景表
含未上架 ModelScope 的模型

交叉分析:
NVFP4 × 具身智能的空白与机会

结论与选型建议

三步走:

  1. 第一站:分析指定筛选页(NVFP4 + image-text-to-text + multi-modal133 个模型,调研时点快照)——回答"NVFP4 量化模型里有没有具身方向的";
  2. 第二站:转向 ModelScope 的"具身智能(robotics)“任务分类(621 个模型,调研时点快照)——回答"平台上有哪些具身模型可用”;
  3. 第三站:结合附件行业资料——把视野放大到全球(含未上架 ModelScope 的模型),形成完整行业图景。

二、第一站:NVFP4 量化有哪些?

从 ModelScope 开源的模型库中,查看页面:https://www.modelscope.cn/models/unsloth/gemma-4-26B-A4B-it-NVFP4,共 133 个结果(调研时点快照)。

2.1 结果构成:全是通用多模态大模型的量化版

底座系列代表模型(命名空间/模型名)数量级说明
Qwen3.x 系(绝对主力)RadixArkInferactunslothRedHatAImlx-community 等发布的 Qwen3.5/3.6/3.8 NVFP4约 70+27B / 35B-A3B / Flash-Next 等规格,Safetensors / GGUF / MLX 格式
GLM 系LibertAIDAI/GLM-5.3-Flash-NVFP4baseten/GLM-5.2-Vision-NVFP4hf/GadflyII-GLM-4.6V-NVFP410+智谱视觉模型量化版
Gemma 4 系unslothRedHatAImlx-communityr0b0tlab15+E2B / E4B / 26B MoE / 31B Dense 全规格(Gemma 4 官方无 12B 规格)
NVIDIA 官方nv-community/Qwen3.8-Flash-Next-NVFP4NVIDIA-Nemotron-Nano-12B-v2-VL-NVFP4-QAD若干NV 社区官方量化
其他Kimi-K2.5/K2.6-NVFP4MiniMax-M3-NVFP4Step-3.7-Flash-NVFP4dots.ocr-nvfp4、Muse-Glimmer、Inkling 等若干大模型 + OCR 专用模型

结论:这个筛选页里没有专门的机器人/具身智能模型

NVFP4 量化目前只做到通用 VLM 这一层,还没延伸到 VLA 和具身模型。

这些"沾边"模型虽然不直接输出机器人动作,但它们作为 VLA 的视觉底座(如 Qwen3-VL),其 NVFP4 量化经验可直接迁移到具身模型上——这正是第五节交叉分析中"底座复用"机会的来源。

2.2 页面中"沾边"具身方向的候选

模型与具身智能的关联局限
sahilchachra/LocateAnything-3B-NVFP4A16通用视觉定位(grounding),具身感知的基础能力非具身专用
mlx-community/MolmoPoint-8B-nvfp4指向(pointing)能力,可用于机器人目标指示同上
timepal/Qwen3-VL-8B-Instruct-NVFP4cpadyun/Qwen3-VL-8B-FlashRT-NVFP4hf/GadflyII-Qwen3-VL-235B-A22B-*-NVFP4Qwen3-VL 具备空间感知 / 3D grounding,常被用作具身智能的 VLM 底座(国内多个 VLA 基于它构建)本身不输出机器人动作
sahilchachra/Agents-A1-NVFP4A16智能体方向(InternScience Agents-A1 量化版)偏科研 agent,非具身

三、第二站:ModelScope"具身智能"分类全景(621 个模型)

入口:模型库 → 多模态 → 具身智能tasks=robotics)。以下为综合排序靠前的代表性模型,按技术路线分类。下载量为调研时点快照。

3.1 VLA(视觉-语言-动作)操作模型 · 国际

模型机构规模协议下载量说明
lerobot/pi0Physical Intelligence / LeRobot3.3BApache-2.02.2kπ0,通用机器人操作基础模型(PaliGemma 骨干 + 动作专家)
lerobot/pi05_base 及 LIBERO 微调系列同上3.6B 级Gemma 许可2.3kπ0.5 升级系列
lerobot/pi0fast_basepi0fast-libero同上2.9~3.5BApache-2.0574π0-FAST token 化加速版
lerobot/smolvla_basesmolvla_liberoHuggingFace450MApache-2.02.4kSmolVLA,轻量端侧 VLA
nv-community/GR00T-N1.5-3B / N1.6-3B / N1.7-LIBERONVIDIA3B 级(N1 约 2.2B,N1.7 为 3B)Apache-2.0(N1.7 已并入 LeRobot,明确支持商业部署)65~697GR00T 人形机器人基础模型
a11111ad/openvla-7b-oft-finetuned-libero-object斯坦福系(社区上传)7B 级MIT87OpenVLA-OFT 微调版
VLA-Adapter/LIBERO-GoalOpenHelix1.25BMIT100轻量化改造 OpenVLA
LLM-Research/Magma-8B微软8B 级MIT1.7kUI 操作 + 机器人通用 agent
allenai/GraspMolmoAI28BMIT315基于 Molmo 的抓取专用模型

3.2 VLA 操作模型 · 国内

模型机构规模协议下载量说明
OpenBMB/MiniCPM-RobotManip面壁智能1.5BApache-2.0663端侧 VLA 操作;另有 MiniCPM-RobotTrack0.9B,跟踪导航)
Robbyant/lingbot-va-baselingbot-vla-v2-6blingbot-va-posttrain-libero-long蚂蚁灵波v2 官方口径为 1.6B 稀疏 MoE(0.6B 激活);其余版本规模以官方为准Apache-2.0941~1.5kLingBot 系列,真机后训练版本齐全
Tencent-Hunyuan/Hy-Embodied-0.5-VLA-RoboTwin / -UMI腾讯混元4B 级(骨干 Hy-Embodied-0.5-MoT,约 4B;"0.5"为版本号)Apache-2.0163~181混元具身 0.5,UMI 预训练 + RoboTwin 2.0 SFT 两种数据配置
XiaomiRobotics/Xiaomi-Robotics-0-LIBERO-1-5B-1-RoboCasa365小米机器人4.7~5B 级Apache-2.034~119小米 Robotics-0(4.7B 实时 VLA)/ Robotics-1 系列
LimXDynamics/FluxVLAEngine逐际动力—(工程框架,非单一权重模型)Apache-2.02.8k开源 VLA 工程底座:覆盖数据→训练→真机部署链路
LET全尺寸机器人VLA1.0模型乐聚机器人Apache-2.0(申请制4全尺寸人形机器人 VLA
DAMO_Academy/RynnVLA-001-7B-Trajectory阿里达摩院7B 级Apache-2.0152轨迹预测式 VLA;另有 RynnValue-4B/8B 价值模型
Galaxea/G0-VLA星海图CC-BY-NC-SA(非商用49星海图 G0
Dexmal/DM05-LerobotDM05-SO101-Pick-CubeDexmal0.3~5.2B11~50基于 Gemma/SO-101 机械臂
starVLA/Qwen3VL-PI_v3-Bridge-RT_1StarVLAMIT24基于 Qwen3-VL 的新一代 VLA 栈
seeklhy/ZR-0 系列、YuzeZhu/BridgeVLA++huixiAI/RhinoVLA学术/社区2.1~3.2BApache-2.045~78学术改进版 VLA

3.3 具身"大脑"(空间推理 / 任务规划 MLLM)

模型机构规模协议下载量说明
BAAI/RoboBrain2.0-7B-3B北京智源3B/7BApache-2.0(申请制1.1k / 755具身大脑,空间感知 + 任务规划
FlagRelease/RoboBrain2.5-8B-ascend-FlagOS智源 / FlagOS8B 级407RoboBrain 2.5,基于 Qwen3-VL,昇腾适配
X-Humanoid/Pelican1.0-VL-7B / 72B北京人形机器人创新中心7B / 72B(官方仅发布此两档)Apache-2.0110~270"天工"配套具身 MLLM,目前最大规模的开源具身多模态脑模型
openmoss/RoboOmni复旦 OpenMOSS4.7BCC-BY-NC-4.0146语音+视觉+动作全模态

3.4 导航(VLN)与空间智能

模型机构规模协议下载量说明
InternRobotics/InternVLA-N1上海 AI Lab8B 级CC-BY-NC-SA306导航专用双系统 VLA
misstl/JanusVLN_Base / _Extra学术9B 级Apache-2.0632 / 1.2k基于 Qwen2.5-VL 的视觉语言导航
amap_cvlab/FantasyVLNABot-M0-PretrainABot-ReconABot-World-0-5B-LF高德视觉技术8B 级 等Apache-2.075~130导航 + 重建 + 世界模型系列(高德 ABot / ABot-WorldStudio 技术栈)
admagic/ETPNav学术Apache-2.0219经典层级式 VLN
valyentine/IndoorUAV-Agent社区119室内无人机导航

3.5 世界模型 / RL 后训练 / 感知组件

模型机构规模下载量说明
极佳视界/Giga-World-1极佳科技47B 级(官方口径以模型页为准)533通用世界模型
lerobot/fastwam_baseLeRobot6B35FastWAM 世界-动作模型
THU4Spiderman/Semantic_Temporal_World_Action_Model清华2语义时序世界动作模型
RLinf/RLinf-Pi05-SFTRLinf-Gr00t-N1.6-SFT-SpatialRLinf-DreamZero-*清华 RLinf3.3~12.6B12~310π0.5 / GR00T / DreamZero 的 RL 后训练权重
Sunjian520/SDPose-Wholebody社区1.3B4.1k全身姿态估计(感知前端,全分类下载量最高之一
Twang2026/HumanoidArena_models社区229B3.3k人形机器人评测基准模型集
lerobot/act_aloha_*diffusion_pushtLeRobot52M~263M868 / 896ACT / Diffusion Policy 经典基线

3.6 自动驾驶 VLA(归入具身智能分类)

模型机构规模下载量说明
nv-community/Alpamayo-R1-10BAlpamayo-1.5-10BAlpamayo2-SuperNVIDIA10B ~ 约 34B68~471Alpamayo 自动驾驶 VLA,带推理链;2 Super 为 32B Cosmos 3 骨干 + 2.3B 扩散动作专家

四、第三站:全球行业代表模型全景(含未上架 ModelScope)

以下综合附件行业资料整理,覆盖 VLA、VLM、世界模型、专用架构四条主线。标注 ✅ 的表示已在 ModelScope 可下载。

4.1 代表模型一览

模型发布机构类型参数规模核心特点 / 定位ModelScope
RynnBrain 1.1阿里巴巴达摩院VLA2B / 9B / 122B-A10B首个 122B 级稀疏 MoE 具身脑模型,支持 3D 空间定位与真实机器人控制(宇树 G1、Astribot 等)可搜索相关 checkpoint
Hy-Embodied-VLA-0.5腾讯 Robotics XVLA4B 级(骨干 Hy-Embodied-0.5-MoT)连接"小脑"与身体,将高层目标转化为连续可纠错动作;"0.5"为版本号Hy-Embodied-0.5-VLA-UMI / -RoboTwin
Hy-Embodied-VLM-1.0腾讯 Robotics XVLM“右脑”:理解图像、空间和场景
Hy-Embodied-RxBrain-1.0腾讯 Robotics X具身大脑统一认知、规划与未来状态想象
GO-2智元机器人具身基座融合大小脑(2026 年 4 月发布);2026 被视为"具身智能部署元年"
GR00T N1 系列NVIDIAVLA2.2B(N1)起,N1.7 为 3B双系统架构(System-2 推理 + System-1 扩散策略),首个开源人形机器人基础模型;N1.7 已 Apache-2.0 并入 LeRobotN1.5-3BN1.6-3BN1.7-LIBERO
π0(pi-0)Physical IntelligenceVLA3.3B基于 PaliGemma,10,000+ 小时跨本体遥操作数据lerobot/pi0
π0.5 / π0.7Physical IntelligenceVLAπ0.5 为 3.6B 级;π0.7 未公开π0.5:开放世界泛化至未见过的家庭环境;π0.7(2026 年 4 月):主打可操纵性(子目标图像 / episode metadata)与组合泛化部分(pi05_base 系列在架)
OpenVLAStanford / BerkeleyVLA7BRT-2 开源复现,学术界广泛微调社区微调版
RT-2Google DeepMindVLA55B首个 VLM-to-Action Transformer,开创 VLA 类别❌ 闭源
OctoBerkeley AI ResearchVLA93M / 27M轻量通用策略,800K 条 Open X-Embodiment 轨迹
InternVLA-A1 / A1.5上海 AI LabVLA2.7B 级统一理解、生成与行动的操作模型InternVLA-A1.5-base
LingBotVLA蚂蚁集团(灵波)VLAv2 为 1.6B 稀疏 MoE(0.6B 激活)开源具身基座模型lingbot-va-base
LingBot-Video蚂蚁集团(灵波)视频预训练首个面向具身智能的大规模视频预训练模型GitHub 项目
Qwen-RobotManip / RobotNav / RobotWorld阿里 QwenVLA / 世界模型标准化状态-动作空间 / 移动控制 / 世界动态预测
MiniCPM-RobotManip面壁智能VLA1.5B端侧机器人操作OpenBMB/MiniCPM-RobotManip
RoboBrain 2.5北京大学 / 智源具身基础模型8B 级深度感知坐标预测 + 密集时序价值评估FlagOS 版(RoboBrain2.0 为申请制
Pelican-VL 1.0北京人形机器人创新中心具身 VLM7B / 72B目前最大规模的开源具身多模态脑模型,配套 RoboMIND 2.0 数据集7B / 72B
WALL-OSS / WALL-A自变量机器人具身基础模型中国最早落地的具身基础大模型之一
ERA-42星动纪元具身大模型通用具身大模型
UnifoLM-VLA-0宇树科技VLA开源 VLA
Thinker优必选具身大模型开源具身大模型
盘古具身智能大模型华为具身大模型盘古系列具身方向
MiMo-Embodied小米具身大模型开源具身大模型(与 Xiaomi-Robotics-0/1 为不同模型线)
GigaWorld 系列极佳视界世界模型47B 级世界模型 + GigaBrain 具身基模Giga-World-1
GOVLA智平方具身大模型全域全身具身大模型
RoboMamba智平方 & 北京大学VLA视觉编码器 + Mamba 状态空间模型,仅调 0.1% 参数
Brain-Si 0.5CasiaHand灵巧操作类人灵巧操作模型,三层架构(待确认,未检索到公开资料)
AstraBrain-WBC 0.5GalaxyBot小脑基模80M全身实时人形控制(待确认
SAM-6D跨维智能姿态估计零样本 6D 姿态估计
PaLM-EGoogle & TU BerlinVLM562B全球最大视觉语言模型之一,融入连续传感器模态❌ 闭源
VLM-3RUT AustinVLM单目视频隐式 3D Token,无需深度传感器
KairosACE RoboticsWAM世界-语言-行动模型(待确认

4.2 四条技术主线解读

  1. VLA:端到端融合视觉、语言与动作,是目前具身智能做得最多的一条路线。当前的难点在于推理能力和动作精度难以兼顾。开源梯队已经比较完整(RT-2 → OpenVLA → π0 → GR00T),国产模型发布也很密集;GR00T N1 用的双系统架构(慢思考推理 + 快反应策略)正被越来越多模型采用。
  2. VLM:具身场景要求模型理解 3D 空间结构,而不只是看懂二维图像。代表工作:VLM-3R(从单目视频提取隐式 3D Token)、RoboBrain 2.5(深度感知坐标预测,直接输出 3D 操作轨迹)。
  3. 世界模型 / WAM:世界模型负责预测物理世界的下一状态,2026 年起开始与动作生成融合,形成世界-语言-行动模型(WAM)。代表:蚂蚁 LingbotVA、NVIDIA DreamZero、极佳 GigaWorld(智源相关世界模型项目待确认)。
  4. 专用架构:面向灵巧操作和全身控制的专用模型,如灵巧操作三层架构模型、80M 级全身实时控制"小脑"基模等(部分厂商项目公开资料有限,待确认)。

五、交叉分析:NVFP4 × 具身智能的空白与机会

维度现状含义
NVFP4 量化覆盖133 个模型(调研时点快照)全部是通用 VLM/LLM(QwenGLMGemmaKimi 等)NVFP4 已经比较普及,但只覆盖通用对话/理解场景
具身模型量化调研时点未发现具身智能分类下的模型提供 NVFP4 版本,均为原版 BF16/FP safetensorsBlackwell(RTX 50 系/B200)上部署 VLA 需自行量化
模型规模主流 VLA 在 0.45B~14B 之间(SmolVLA 450M、MiniCPM-RobotManip 1.5B、π0 3.3B、GR00T N1.7 3B)小模型量化到 NVFP4 的可行性和收益都很高
底座复用多个 VLA 直接基于 Qwen2.5-VL / Qwen3-VL / Gemma 构建这些底座的 NVFP4 量化经验(本站已有)可直接迁移

这意味着一个实际的工程机会:在端侧/边缘部署场景(Jetson、机器人本体上的 RTX 5090),用 TensorRT Model OptimizerSmolVLAMiniCPM-RobotManipπ0 这类 0.5~3.5B 的 VLA 量化到 NVFP4,路径是通的,而调研时点尚未发现有人公开发布这类权重

SmolVLA(450M)为例,量化思路大致如下:

# 1. 导出 ONNX 或 TensorRT 引擎
# 2. 使用 TensorRT Model Optimizer 进行 NVFP4 量化
# 3. 在 Jetson / RTX 5090 上验证精度与延迟

配合 LeRobot 框架,可在 30 分钟内跑通一个简单的抓取仿真任务:安装 lerobot → 加载 smolvla_base → 运行 LIBERO 仿真环境。


六、结论与选型建议

需求推荐
快速上手机器人操作(仿真/真机)lerobot/smolvla_base450M,最轻)或 lerobot/pi05_baseπ0.5,3.6B 级,生态最好
端侧中文场景OpenBMB/MiniCPM-RobotManip(1.5B,Apache-2.0
人形机器人nv-community/GR00T-N1.7-LIBEROApache-2.0,已并入 LeRobot,可商用
具身大脑 / 空间推理X-Humanoid/Pelican1.0-VL-7B(开源可商用);RoboBrain2.0 需申请
视觉语言导航misstl/JanusVLN_BaseApache-2.0,下载量高)
商用项目优先 Apache-2.0 / MIT 模型;避开 CC-BY-NC 系列(InternVLA-A1.5、G0-VLA 等)和申请制模型
想要 NVFP4 部署现成模型不存在;建议自行量化小体量 VLA,或先用 Qwen3-VL 系 NVFP4 版做具身感知层

总的来说:2026 年的具身智能模型数量已经很可观,仅 ModelScope 上就有 600 多个(调研时点快照)可直接下载,国产厂商占了不小比例。

但 NVFP4 量化还停在通用 VLM 层面,"NVFP4 + 具身智能"这块暂时没人做,需要用的人得自己量化。

数据来源:ModelScope(魔搭社区)模型库 + 行业公开资料整理

分享完成~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐