399美元的机器鸭买回去怎么玩?GPU 选型到动作发布全流程
READING GUIDE · 精选看点
01 一只鸭子卖爆了
02 官方出厂只是开始,社区玩出了花
03 你也可以训一个
开源策略和云端GPU,让训练机器宠物从围观变成了亲手上手。
一只鸭子卖爆了
2026年8月27日,Hugging Face旗下 Pollen Robotics 开放了双足机器鸭 Microduck 预购。399 美元,25 厘米高,15 个舵机驱动,能走路、能摔倒后自己爬起来、能踢球、能轮滑。24 小时内订单超过 260 万美元,首批售罄后排到圣诞节。
鸭子走路靠的是 强化学习 训练出来的神经网络策略,没有一行写死的步态代码。所有代码也都开源了,训练框架、仿真模型、预训练策略全部放在 GitHub 和 Hugging Face 上。

官方出厂只是开始,社区玩出了花
官方说得很直接,出厂动作只是起点,后面的花样靠社区。最亮眼的有两个。
跑步,从蹒跚学步到 1.65m/s。 社区成员 HannesVonEssen 训练出跑步策略,让小鸭子跑到 1.65 米/秒,接近成年人快步走速度,512 个并行环境压测存活率 98.8%。
开心跳跃,社区训练,官方真机验证通过。 joanfox 训练的跳跃策略被 Pollen Robotics 在真实硬件上测试成功,从仿真到真机完整跑通。
你训练的动作,真的能跑在别人的机器人上。 这就是 开源机器人的循环。截至发稿,Hugging Face 上已经有 30 多位社区成员发布了 Microduck 动作策略,每天都在增加。
· 🏃 跑步,从匀速走到 1.65m/s,还加了鲁棒性训练(HannesVonEssen)
· 🦩 火烈鸟单腿,单腿站立平衡(RemiFabre)
· 🎈 开心跳跃,蹲下蓄力、双脚起跳,已被官方真机验证(joanfox)
· 🎣 地面捡物,蹲下捡起地上的东西(官方策略)
· ⚽ 踢球,左脚踢、右脚踢,两种策略(官方策略)
· 🤸 前滚翻,完整的前滚翻动作(官方策略)
· 🎭 鞠躬,礼貌地弯腰(fffiloni)
· 🕺 太空步,像迈克尔·杰克逊一样向后滑步(fffiloni)
· 🌀 旋转,原地快速旋转(RemiFabre)
· 🦿 高跷步,踩高跷一样的夸张步态(HannesVonEssen)
· 🎯 嘴部抛掷,用嘴抛出物体(q2p)
· 🎪 电气滑步,侧向滑步移动(Histochemichael)
有人训跑步,有人训跳跃,有人训单腿平衡,每周都有新动作冒出来。鸭子还是那只鸭子,大脑已经被社区玩出了几十种花样。
怎么玩这些社区动作
不需要有 鸭子,甚至不需要 GPU。在自己电脑上装好 Python 环境,就能在 MuJoCo 仿真器里回放。


跳跃策略和官方走路策略也是同样的流程,下载 ONNX、用 infer_policy.py 回放即可。
你也可以训一个
跑步和跳跃都是社区开发者训练的。他们调整了 训练参数,跑了一次训练,就把新动作发布到了 Hugging Face。你当然也可以。
官方训练框架完全开源,训练一个动作的核心是调整参数,告诉 AI 什么行为应该被奖励。走路奖励前进速度,跳跃奖励双脚离地高度,你还可以定义任何你想要的,跳舞、点头、后空翻,想象力就是上限。
开源让训练自由了,GPU让训练依然昂贵。
但训练需要 GPU。4096 个并行环境同时跑,一张 RTX 40系一万多还经常缺货,更多人根本没有显卡。
用云端 GPU,从零训练你的第一个动作
不需要买显卡,不需要装 CUDA。按小时付费,开机器就能跑,用完就释放。以 UCloud 优刻得的 GPU 云服务器为例,我们完整走一遍训练流程。优刻得 GPU 产品线从单卡入门覆盖到多卡集群,具身智能是他们明确支持的方向。
开始之前,建议先注册两个免费账号。一个是 Hugging Face,注册后到 Settings 的 Access Tokens 里创建一个 Write 权限的 token 保存好,后面发布动作要用。另一个是 wandb,注册后在 Settings 里拿到 API Key,训练时就能在网页端看 reward 曲线。不想注册 wandb 也可以,训练时用离线模式,后面会讲。
第一步,开一台GPU实例
登录 UCloud 控制台,进入云主机,创建 GPU 云主机。
机型在高性价比系列里选 V 系列,GPU 型号选 V100S,配置选 1 颗 GPU、10 核 CPU、32G 内存。
这张卡 32GB 显存、1.13TB/s 显存带宽、5120 个 CUDA Core 加 640 个 Tensor Core,FP16 Tensor 算力 130 TFlops,跑 Microduck 的 4096 并行环境训练绰绰有余,单卡时租也便宜,适合个人开发者低成本试错。
地域选华东上海 2 可用区 A。操作系统选预装驱动的 Ubuntu 20.04 64 位,集成软件一栏会显示 nvidia 550.90.12 加 cuda 12.4,开箱即用。系统盘 SSD 40G 够用。

网络用默认配置,外网记得购买并绑定一个 EIP,选 BGP 线路,带宽 5M 就够,不然没法 SSH 连上去。登录方式选密码登录,用户名 ubuntu,设一个密码。计费方式选按时付费,每小时 12.18 元。点立即购买,几分钟后实例状态变成运行中。
在 EIP 列表找到实例的公网 IP,用刚才设的密码连上去。

能看到 V100、32G 显存、CUDA 12.4,就说明环境就绪了。
磁盘空间提示,训练依赖包约 8GB,建议系统盘至少留 20GB可用空间。如果系统盘满了,可以先清理不需要的预装软件,比如 conda 和 jupyter。
GPU怎么选,一张表看懂。

第二步,装环境
装 Python 包管理器 uv,再装 Python 3.12,然后克隆官方训练仓库、安装依赖。

uv sync 预计 10 到 15 分钟,取决于网速。全部依赖装完不报错,环境就好了。
wandb 和 huggingface_hub 都已经包含在项目依赖里,不用单独装。想用 wandb 看曲线的话,运行 uv run wandb login 粘贴 API Key。想发布模型的话,运行 uv run hf auth login 粘贴之前保存的 HF token。这两步现在不做也行,训练和导出不受影响。
第三步,开始训练
先训官方自带的走路策略,这是框架默认任务,不用改任何参数。

训练开始后,终端会持续输出迭代次数、reward 值和 GPU 利用率,reward 会逐渐上涨。登录 wandb 的话,打开浏览器就能实时看到 reward 曲线,上升然后趋于平稳,说明鸭子在学走路了。
一到两个小时,就能训出一个可用的步态。
如果 4096 个并行环境显存不够(OOM),把环境数降下来再跑。

第四步,导出并在仿真器里看效果
训练完成后,把策略导出成 ONNX 格式。用了 wandb 在线模式的话,从 wandb 里找到你的 run path(格式是 用户名/项目名/run_id),直接导出。

离线模式训练的话,用本地 checkpoint 文件导出,--checkpoint-file <checkpoint路径>。导出后当前目录会生成 output.onnx。
然后在仿真器里验证。仿真器吃 CPU,不占 GPU。

想保存观测数据用于分析,加一个 --record 参数,录制的数据会保存在当前目录。

第五步,发布你的动作
训练出满意的效果后,一行命令发布到 Hugging Face Hub。

发布后,全世界任何人都可以下载你的策略。

等真机到手,在任何一台 Microduck 上执行两条命令,鸭子就能用你训的动作走路。

进阶,改参数,训你自己的动作
走通了官方走路策略,下一步就是改参数。前面提到的跑步策略就是这么来的。官方走路策略的速度命令范围是 -0.4~0.4 m/s,鸭子只需要慢慢走。HannesVonEssen 把这个范围提高到 2.2 m/s,同时加大前进奖励权重,加入鲁棒性训练(随机推力、重心偏移、初始倾斜),鸭子从慢慢走变成了拼命跑。
训练框架通过环境变量配置这些参数,不需要改代码。跑步策略在社区扩展仓库 [microduck-playground]里,它在官方框架基础上增加了跑步任务的配置。克隆下来,uv sync 装好依赖,带上参数启动训练。

几个关键参数的含义。

跑步比走路难训得多。策略作者从零训练了 12,195 个 iteration(约 9 小时),才得到 1.65m/s 的稳定跑步。导出、验证、发布的流程和走路策略完全一样。
花多少钱

训一个自己的动作,一杯奶茶的钱。
训完记得及时释放 GPU 实例,按时付费的实例开着就一直计费。
鸭子之外
Microduck 是开源 AI 硬件里第一个卖爆的。后面还会有更多,机器人、无人机、机械臂,都需要 GPU 来训练自定义行为。具身智能也是 UCloud GPU 产品线重点面向的场景,从单卡云主机到支持 800Gbps 高速网络、GPUDirect RDMA 的多卡集群,再到高性能存储 UPFS 和容器平台 UK8S,这套设施给训练自己的机器人这类需求都备好了。
你不需要成为 AI专家,不需要买显卡,只需要一个想法、一台云端 GPU 服务器和几条命令。UCloud 要做的,就是让这台 GPU 离你足够近、足够便宜、足够好用。
准备好了,随时开始。
相关链接
· Microduck官方博客 https://pollen-robotics.com/microduck/blog/introducing-microduck
· 在线仿真器 https://huggingface.co/spaces/pollen-robotics/microduck-simulator
· GitHub运行时仓库(Rust) https://github.com/pollen-robotics/microduck
· GitHub训练仓库(Python) https://github.com/pollen-robotics/microduck_rl
· 预训练策略模型 https://huggingface.co/pollen-robotics/microduck-policies
· 社区策略合集 https://huggingface.co/models?search=microduck
· 跑步策略(文中示例) https://huggingface.co/HannesVonEssen/microduck-running
· 开心跳跃策略(文中示例) https://huggingface.co/joanfox/microduck-happy-hop
· 跑步训练仓库(进阶示例) https://github.com/Vottivott/microduck-playground
· UCloud GPU云服务器 GPU云服务器_GPU裸金属_推理训练_图形渲染_免费定制试用 - UCloud中立云计算服务商
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)