NVFP4 量化 × 具身智能:ModelScope 模型生态调研
目的:了解当前行业模型情况,“机器人/具身智能方向有哪些模型可用?其中有没有 NVFP4 量化版?”
适合读者:正在做机器人端侧部署、或关注具身智能模型选型的工程师与研究者。
摘要
- NVFP4 侧:ModelScope 上 NVFP4 量化的视觉多模态模型共 133 个(调研时查找到的数量),全部是
Qwen、GLM、Gemma、Kimi等通用大模型的量化版,很少具身智能专用模型。 - 具身侧:ModelScope 的"具身智能"分类下有 621 个模型(调研时点快照),主力是 VLA 操作模型(
π0/π0.5、GR00T、OpenVLA、LingBot、小米 Robotics、腾讯混元 Hy-Embodied等),外加具身大脑、导航、世界模型几条支线;国产厂商 2026 年发布密集。 - 交叉结论:调研时点未发现具身模型提供 NVFP4 版本,均为原版
BF16/FP权重。"NVFP4 + 具身智能"目前基本是个空白,而主流 VLA 只有 0.45B~14B,自行量化的门槛并不高——想在 Blackwell 显卡上跑机器人模型,只能自己动手,但这条路走得通。 - 选型速查:上手选
SmolVLA或π0;端侧中文选MiniCPM-RobotManip;人形选GR00T(N1.7 已 Apache-2.0,可商用)。
一、调研思路与流程
本次调研从"NVFP4 量化模型"出发,逐步扩大到整个具身智能模型生态,流程如下:
三步走:
- 第一站:分析指定筛选页(
NVFP4+image-text-to-text+multi-modal,133 个模型,调研时点快照)——回答"NVFP4 量化模型里有没有具身方向的"; - 第二站:转向 ModelScope 的"具身智能(robotics)“任务分类(621 个模型,调研时点快照)——回答"平台上有哪些具身模型可用”;
- 第三站:结合附件行业资料——把视野放大到全球(含未上架 ModelScope 的模型),形成完整行业图景。
二、第一站:NVFP4 量化有哪些?
从 ModelScope 开源的模型库中,查看页面:https://www.modelscope.cn/models/unsloth/gemma-4-26B-A4B-it-NVFP4,共 133 个结果(调研时点快照)。
2.1 结果构成:全是通用多模态大模型的量化版
| 底座系列 | 代表模型(命名空间/模型名) | 数量级 | 说明 |
|---|---|---|---|
| Qwen3.x 系(绝对主力) | RadixArk、Inferact、unsloth、RedHatAI、mlx-community 等发布的 Qwen3.5/3.6/3.8 NVFP4 | 约 70+ | 27B / 35B-A3B / Flash-Next 等规格,Safetensors / GGUF / MLX 格式 |
| GLM 系 | LibertAIDAI/GLM-5.3-Flash-NVFP4、baseten/GLM-5.2-Vision-NVFP4、hf/GadflyII-GLM-4.6V-NVFP4 | 10+ | 智谱视觉模型量化版 |
| Gemma 4 系 | unsloth、RedHatAI、mlx-community、r0b0tlab 等 | 15+ | E2B / E4B / 26B MoE / 31B Dense 全规格(Gemma 4 官方无 12B 规格) |
| NVIDIA 官方 | nv-community/Qwen3.8-Flash-Next-NVFP4、NVIDIA-Nemotron-Nano-12B-v2-VL-NVFP4-QAD 等 | 若干 | NV 社区官方量化 |
| 其他 | Kimi-K2.5/K2.6-NVFP4、MiniMax-M3-NVFP4、Step-3.7-Flash-NVFP4、dots.ocr-nvfp4、Muse-Glimmer、Inkling 等 | 若干 | 大模型 + OCR 专用模型 |
结论:这个筛选页里没有专门的机器人/具身智能模型。
NVFP4 量化目前只做到通用 VLM 这一层,还没延伸到 VLA 和具身模型。
这些"沾边"模型虽然不直接输出机器人动作,但它们作为 VLA 的视觉底座(如 Qwen3-VL),其 NVFP4 量化经验可直接迁移到具身模型上——这正是第五节交叉分析中"底座复用"机会的来源。
2.2 页面中"沾边"具身方向的候选
| 模型 | 与具身智能的关联 | 局限 |
|---|---|---|
sahilchachra/LocateAnything-3B-NVFP4A16 | 通用视觉定位(grounding),具身感知的基础能力 | 非具身专用 |
mlx-community/MolmoPoint-8B-nvfp4 | 指向(pointing)能力,可用于机器人目标指示 | 同上 |
timepal/Qwen3-VL-8B-Instruct-NVFP4、cpadyun/Qwen3-VL-8B-FlashRT-NVFP4、hf/GadflyII-Qwen3-VL-235B-A22B-*-NVFP4 | Qwen3-VL 具备空间感知 / 3D grounding,常被用作具身智能的 VLM 底座(国内多个 VLA 基于它构建) | 本身不输出机器人动作 |
sahilchachra/Agents-A1-NVFP4A16 | 智能体方向(InternScience Agents-A1 量化版) | 偏科研 agent,非具身 |
三、第二站:ModelScope"具身智能"分类全景(621 个模型)
入口:模型库 → 多模态 → 具身智能(tasks=robotics)。以下为综合排序靠前的代表性模型,按技术路线分类。下载量为调研时点快照。
3.1 VLA(视觉-语言-动作)操作模型 · 国际
| 模型 | 机构 | 规模 | 协议 | 下载量 | 说明 |
|---|---|---|---|---|---|
lerobot/pi0 | Physical Intelligence / LeRobot | 3.3B | Apache-2.0 | 2.2k | π0,通用机器人操作基础模型(PaliGemma 骨干 + 动作专家) |
lerobot/pi05_base 及 LIBERO 微调系列 | 同上 | 3.6B 级 | Gemma 许可 | 2.3k | π0.5 升级系列 |
lerobot/pi0fast_base、pi0fast-libero | 同上 | 2.9~3.5B | Apache-2.0 | 574 | π0-FAST token 化加速版 |
lerobot/smolvla_base、smolvla_libero 等 | HuggingFace | 450M | Apache-2.0 | 2.4k | SmolVLA,轻量端侧 VLA |
nv-community/GR00T-N1.5-3B / N1.6-3B / N1.7-LIBERO | NVIDIA | 3B 级(N1 约 2.2B,N1.7 为 3B) | Apache-2.0(N1.7 已并入 LeRobot,明确支持商业部署) | 65~697 | GR00T 人形机器人基础模型 |
a11111ad/openvla-7b-oft-finetuned-libero-object | 斯坦福系(社区上传) | 7B 级 | MIT | 87 | OpenVLA-OFT 微调版 |
VLA-Adapter/LIBERO-Goal | OpenHelix | 1.25B | MIT | 100 | 轻量化改造 OpenVLA |
LLM-Research/Magma-8B | 微软 | 8B 级 | MIT | 1.7k | UI 操作 + 机器人通用 agent |
allenai/GraspMolmo | AI2 | 8B | MIT | 315 | 基于 Molmo 的抓取专用模型 |
3.2 VLA 操作模型 · 国内
| 模型 | 机构 | 规模 | 协议 | 下载量 | 说明 |
|---|---|---|---|---|---|
OpenBMB/MiniCPM-RobotManip | 面壁智能 | 1.5B | Apache-2.0 | 663 | 端侧 VLA 操作;另有 MiniCPM-RobotTrack(0.9B,跟踪导航) |
Robbyant/lingbot-va-base、lingbot-vla-v2-6b、lingbot-va-posttrain-libero-long | 蚂蚁灵波 | v2 官方口径为 1.6B 稀疏 MoE(0.6B 激活);其余版本规模以官方为准 | Apache-2.0 | 941~1.5k | LingBot 系列,真机后训练版本齐全 |
Tencent-Hunyuan/Hy-Embodied-0.5-VLA-RoboTwin / -UMI | 腾讯混元 | 4B 级(骨干 Hy-Embodied-0.5-MoT,约 4B;"0.5"为版本号) | Apache-2.0 | 163~181 | 混元具身 0.5,UMI 预训练 + RoboTwin 2.0 SFT 两种数据配置 |
XiaomiRobotics/Xiaomi-Robotics-0-LIBERO、-1-5B、-1-RoboCasa365 | 小米机器人 | 4.7~5B 级 | Apache-2.0 | 34~119 | 小米 Robotics-0(4.7B 实时 VLA)/ Robotics-1 系列 |
LimXDynamics/FluxVLAEngine | 逐际动力 | —(工程框架,非单一权重模型) | Apache-2.0 | 2.8k | 开源 VLA 工程底座:覆盖数据→训练→真机部署链路 |
LET全尺寸机器人VLA1.0模型 | 乐聚机器人 | — | Apache-2.0(申请制) | 4 | 全尺寸人形机器人 VLA |
DAMO_Academy/RynnVLA-001-7B-Trajectory | 阿里达摩院 | 7B 级 | Apache-2.0 | 152 | 轨迹预测式 VLA;另有 RynnValue-4B/8B 价值模型 |
Galaxea/G0-VLA | 星海图 | — | CC-BY-NC-SA(非商用) | 49 | 星海图 G0 |
Dexmal/DM05-Lerobot、DM05-SO101-Pick-Cube | Dexmal | 0.3~5.2B | — | 11~50 | 基于 Gemma/SO-101 机械臂 |
starVLA/Qwen3VL-PI_v3-Bridge-RT_1 等 | StarVLA | — | MIT | 24 | 基于 Qwen3-VL 的新一代 VLA 栈 |
seeklhy/ZR-0 系列、YuzeZhu/BridgeVLA++、huixiAI/RhinoVLA | 学术/社区 | 2.1~3.2B | Apache-2.0 | 45~78 | 学术改进版 VLA |
3.3 具身"大脑"(空间推理 / 任务规划 MLLM)
| 模型 | 机构 | 规模 | 协议 | 下载量 | 说明 |
|---|---|---|---|---|---|
BAAI/RoboBrain2.0-7B、-3B | 北京智源 | 3B/7B | Apache-2.0(申请制) | 1.1k / 755 | 具身大脑,空间感知 + 任务规划 |
FlagRelease/RoboBrain2.5-8B-ascend-FlagOS | 智源 / FlagOS | 8B 级 | — | 407 | RoboBrain 2.5,基于 Qwen3-VL,昇腾适配 |
X-Humanoid/Pelican1.0-VL-7B / 72B | 北京人形机器人创新中心 | 7B / 72B(官方仅发布此两档) | Apache-2.0 | 110~270 | "天工"配套具身 MLLM,目前最大规模的开源具身多模态脑模型 |
openmoss/RoboOmni | 复旦 OpenMOSS | 4.7B | CC-BY-NC-4.0 | 146 | 语音+视觉+动作全模态 |
3.4 导航(VLN)与空间智能
| 模型 | 机构 | 规模 | 协议 | 下载量 | 说明 |
|---|---|---|---|---|---|
InternRobotics/InternVLA-N1 | 上海 AI Lab | 8B 级 | CC-BY-NC-SA | 306 | 导航专用双系统 VLA |
misstl/JanusVLN_Base / _Extra | 学术 | 9B 级 | Apache-2.0 | 632 / 1.2k | 基于 Qwen2.5-VL 的视觉语言导航 |
amap_cvlab/FantasyVLN、ABot-M0-Pretrain、ABot-Recon、ABot-World-0-5B-LF | 高德视觉技术 | 8B 级 等 | Apache-2.0 | 75~130 | 导航 + 重建 + 世界模型系列(高德 ABot / ABot-WorldStudio 技术栈) |
admagic/ETPNav | 学术 | — | Apache-2.0 | 219 | 经典层级式 VLN |
valyentine/IndoorUAV-Agent | 社区 | — | — | 119 | 室内无人机导航 |
3.5 世界模型 / RL 后训练 / 感知组件
| 模型 | 机构 | 规模 | 下载量 | 说明 |
|---|---|---|---|---|
极佳视界/Giga-World-1 | 极佳科技 | 47B 级(官方口径以模型页为准) | 533 | 通用世界模型 |
lerobot/fastwam_base | LeRobot | 6B | 35 | FastWAM 世界-动作模型 |
THU4Spiderman/Semantic_Temporal_World_Action_Model | 清华 | — | 2 | 语义时序世界动作模型 |
RLinf/RLinf-Pi05-SFT、RLinf-Gr00t-N1.6-SFT-Spatial、RLinf-DreamZero-* | 清华 RLinf | 3.3~12.6B | 12~310 | π0.5 / GR00T / DreamZero 的 RL 后训练权重 |
Sunjian520/SDPose-Wholebody | 社区 | 1.3B | 4.1k | 全身姿态估计(感知前端,全分类下载量最高之一) |
Twang2026/HumanoidArena_models | 社区 | 229B | 3.3k | 人形机器人评测基准模型集 |
lerobot/act_aloha_*、diffusion_pusht | LeRobot | 52M~263M | 868 / 896 | ACT / Diffusion Policy 经典基线 |
3.6 自动驾驶 VLA(归入具身智能分类)
| 模型 | 机构 | 规模 | 下载量 | 说明 |
|---|---|---|---|---|
nv-community/Alpamayo-R1-10B、Alpamayo-1.5-10B、Alpamayo2-Super | NVIDIA | 10B ~ 约 34B | 68~471 | Alpamayo 自动驾驶 VLA,带推理链;2 Super 为 32B Cosmos 3 骨干 + 2.3B 扩散动作专家 |
四、第三站:全球行业代表模型全景(含未上架 ModelScope)
以下综合附件行业资料整理,覆盖 VLA、VLM、世界模型、专用架构四条主线。标注 ✅ 的表示已在 ModelScope 可下载。
4.1 代表模型一览
| 模型 | 发布机构 | 类型 | 参数规模 | 核心特点 / 定位 | ModelScope |
|---|---|---|---|---|---|
| RynnBrain 1.1 | 阿里巴巴达摩院 | VLA | 2B / 9B / 122B-A10B | 首个 122B 级稀疏 MoE 具身脑模型,支持 3D 空间定位与真实机器人控制(宇树 G1、Astribot 等) | 可搜索相关 checkpoint |
| Hy-Embodied-VLA-0.5 | 腾讯 Robotics X | VLA | 4B 级(骨干 Hy-Embodied-0.5-MoT) | 连接"小脑"与身体,将高层目标转化为连续可纠错动作;"0.5"为版本号 | ✅ Hy-Embodied-0.5-VLA-UMI / -RoboTwin |
| Hy-Embodied-VLM-1.0 | 腾讯 Robotics X | VLM | — | “右脑”:理解图像、空间和场景 | — |
| Hy-Embodied-RxBrain-1.0 | 腾讯 Robotics X | 具身大脑 | — | 统一认知、规划与未来状态想象 | — |
| GO-2 | 智元机器人 | 具身基座 | — | 融合大小脑(2026 年 4 月发布);2026 被视为"具身智能部署元年" | — |
| GR00T N1 系列 | NVIDIA | VLA | 2.2B(N1)起,N1.7 为 3B | 双系统架构(System-2 推理 + System-1 扩散策略),首个开源人形机器人基础模型;N1.7 已 Apache-2.0 并入 LeRobot | ✅ N1.5-3B、N1.6-3B、N1.7-LIBERO |
| π0(pi-0) | Physical Intelligence | VLA | 3.3B | 基于 PaliGemma,10,000+ 小时跨本体遥操作数据 | ✅ lerobot/pi0 |
| π0.5 / π0.7 | Physical Intelligence | VLA | π0.5 为 3.6B 级;π0.7 未公开 | π0.5:开放世界泛化至未见过的家庭环境;π0.7(2026 年 4 月):主打可操纵性(子目标图像 / episode metadata)与组合泛化 | 部分(pi05_base 系列在架) |
| OpenVLA | Stanford / Berkeley | VLA | 7B | RT-2 开源复现,学术界广泛微调 | ✅ 社区微调版 |
| RT-2 | Google DeepMind | VLA | 55B | 首个 VLM-to-Action Transformer,开创 VLA 类别 | ❌ 闭源 |
| Octo | Berkeley AI Research | VLA | 93M / 27M | 轻量通用策略,800K 条 Open X-Embodiment 轨迹 | — |
| InternVLA-A1 / A1.5 | 上海 AI Lab | VLA | 2.7B 级 | 统一理解、生成与行动的操作模型 | ✅ InternVLA-A1.5-base |
| LingBotVLA | 蚂蚁集团(灵波) | VLA | v2 为 1.6B 稀疏 MoE(0.6B 激活) | 开源具身基座模型 | ✅ lingbot-va-base |
| LingBot-Video | 蚂蚁集团(灵波) | 视频预训练 | — | 首个面向具身智能的大规模视频预训练模型 | GitHub 项目 |
| Qwen-RobotManip / RobotNav / RobotWorld | 阿里 Qwen | VLA / 世界模型 | — | 标准化状态-动作空间 / 移动控制 / 世界动态预测 | — |
| MiniCPM-RobotManip | 面壁智能 | VLA | 1.5B | 端侧机器人操作 | ✅ OpenBMB/MiniCPM-RobotManip |
| RoboBrain 2.5 | 北京大学 / 智源 | 具身基础模型 | 8B 级 | 深度感知坐标预测 + 密集时序价值评估 | ✅ FlagOS 版(RoboBrain2.0 为申请制) |
| Pelican-VL 1.0 | 北京人形机器人创新中心 | 具身 VLM | 7B / 72B | 目前最大规模的开源具身多模态脑模型,配套 RoboMIND 2.0 数据集 | ✅ 7B / 72B |
| WALL-OSS / WALL-A | 自变量机器人 | 具身基础模型 | — | 中国最早落地的具身基础大模型之一 | — |
| ERA-42 | 星动纪元 | 具身大模型 | — | 通用具身大模型 | — |
| UnifoLM-VLA-0 | 宇树科技 | VLA | — | 开源 VLA | — |
| Thinker | 优必选 | 具身大模型 | — | 开源具身大模型 | — |
| 盘古具身智能大模型 | 华为 | 具身大模型 | — | 盘古系列具身方向 | — |
| MiMo-Embodied | 小米 | 具身大模型 | — | 开源具身大模型(与 Xiaomi-Robotics-0/1 为不同模型线) | — |
| GigaWorld 系列 | 极佳视界 | 世界模型 | 47B 级 | 世界模型 + GigaBrain 具身基模 | ✅ Giga-World-1 |
| GOVLA | 智平方 | 具身大模型 | — | 全域全身具身大模型 | — |
| RoboMamba | 智平方 & 北京大学 | VLA | — | 视觉编码器 + Mamba 状态空间模型,仅调 0.1% 参数 | — |
| Brain-Si 0.5 | CasiaHand | 灵巧操作 | — | 类人灵巧操作模型,三层架构(待确认,未检索到公开资料) | — |
| AstraBrain-WBC 0.5 | GalaxyBot | 小脑基模 | 80M | 全身实时人形控制(待确认) | — |
| SAM-6D | 跨维智能 | 姿态估计 | — | 零样本 6D 姿态估计 | — |
| PaLM-E | Google & TU Berlin | VLM | 562B | 全球最大视觉语言模型之一,融入连续传感器模态 | ❌ 闭源 |
| VLM-3R | UT Austin | VLM | — | 单目视频隐式 3D Token,无需深度传感器 | — |
| Kairos | ACE Robotics | WAM | — | 世界-语言-行动模型(待确认) | — |
4.2 四条技术主线解读
- VLA:端到端融合视觉、语言与动作,是目前具身智能做得最多的一条路线。当前的难点在于推理能力和动作精度难以兼顾。开源梯队已经比较完整(
RT-2 → OpenVLA → π0 → GR00T),国产模型发布也很密集;GR00T N1 用的双系统架构(慢思考推理 + 快反应策略)正被越来越多模型采用。 - VLM:具身场景要求模型理解 3D 空间结构,而不只是看懂二维图像。代表工作:
VLM-3R(从单目视频提取隐式 3D Token)、RoboBrain 2.5(深度感知坐标预测,直接输出 3D 操作轨迹)。 - 世界模型 / WAM:世界模型负责预测物理世界的下一状态,2026 年起开始与动作生成融合,形成世界-语言-行动模型(WAM)。代表:蚂蚁
LingbotVA、NVIDIADreamZero、极佳GigaWorld(智源相关世界模型项目待确认)。 - 专用架构:面向灵巧操作和全身控制的专用模型,如灵巧操作三层架构模型、80M 级全身实时控制"小脑"基模等(部分厂商项目公开资料有限,待确认)。
五、交叉分析:NVFP4 × 具身智能的空白与机会
| 维度 | 现状 | 含义 |
|---|---|---|
| NVFP4 量化覆盖 | 133 个模型(调研时点快照)全部是通用 VLM/LLM(Qwen、GLM、Gemma、Kimi 等) | NVFP4 已经比较普及,但只覆盖通用对话/理解场景 |
| 具身模型量化 | 调研时点未发现具身智能分类下的模型提供 NVFP4 版本,均为原版 BF16/FP safetensors | Blackwell(RTX 50 系/B200)上部署 VLA 需自行量化 |
| 模型规模 | 主流 VLA 在 0.45B~14B 之间(SmolVLA 450M、MiniCPM-RobotManip 1.5B、π0 3.3B、GR00T N1.7 3B) | 小模型量化到 NVFP4 的可行性和收益都很高 |
| 底座复用 | 多个 VLA 直接基于 Qwen2.5-VL / Qwen3-VL / Gemma 构建 | 这些底座的 NVFP4 量化经验(本站已有)可直接迁移 |
这意味着一个实际的工程机会:在端侧/边缘部署场景(Jetson、机器人本体上的 RTX 5090),用 TensorRT Model Optimizer 把 SmolVLA、MiniCPM-RobotManip、π0 这类 0.5~3.5B 的 VLA 量化到 NVFP4,路径是通的,而调研时点尚未发现有人公开发布这类权重。
以 SmolVLA(450M)为例,量化思路大致如下:
# 1. 导出 ONNX 或 TensorRT 引擎
# 2. 使用 TensorRT Model Optimizer 进行 NVFP4 量化
# 3. 在 Jetson / RTX 5090 上验证精度与延迟
配合 LeRobot 框架,可在 30 分钟内跑通一个简单的抓取仿真任务:安装 lerobot → 加载 smolvla_base → 运行 LIBERO 仿真环境。
六、结论与选型建议
| 需求 | 推荐 |
|---|---|
| 快速上手机器人操作(仿真/真机) | lerobot/smolvla_base(450M,最轻)或 lerobot/pi05_base(π0.5,3.6B 级,生态最好) |
| 端侧中文场景 | OpenBMB/MiniCPM-RobotManip(1.5B,Apache-2.0) |
| 人形机器人 | nv-community/GR00T-N1.7-LIBERO(Apache-2.0,已并入 LeRobot,可商用) |
| 具身大脑 / 空间推理 | X-Humanoid/Pelican1.0-VL-7B(开源可商用);RoboBrain2.0 需申请 |
| 视觉语言导航 | misstl/JanusVLN_Base(Apache-2.0,下载量高) |
| 商用项目 | 优先 Apache-2.0 / MIT 模型;避开 CC-BY-NC 系列(InternVLA-A1.5、G0-VLA 等)和申请制模型 |
| 想要 NVFP4 部署 | 现成模型不存在;建议自行量化小体量 VLA,或先用 Qwen3-VL 系 NVFP4 版做具身感知层 |
总的来说:2026 年的具身智能模型数量已经很可观,仅 ModelScope 上就有 600 多个(调研时点快照)可直接下载,国产厂商占了不小比例。
但 NVFP4 量化还停在通用 VLM 层面,"NVFP4 + 具身智能"这块暂时没人做,需要用的人得自己量化。
数据来源:ModelScope(魔搭社区)模型库 + 行业公开资料整理
分享完成~
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)