小米科技刚刚发布的Xiaomi-Robotics-1(XR-1)机械臂,是一个基于两个阶段训练的视觉-语言-动作(VLA)基础模型的具身智能硬件:

阶段

所需数据

小米已有的规模

预训练

无具身形态(UMI)视频——人类/手部在多样真实场景中操作物体的录像,经 VLM 自动标注为状态转移文本

10万小时,覆盖1,700+场景(家庭、商业场所、工业场地、户外空间)

后训练

高质量、带指令标注的真实机器人数据 + 跨具身形态数据,用于将动作与语言指令对齐

7,200小时自有机器人数据 + 经筛选的开源数据 + 部分UMI数据

应用落地

每项任务仅需数小时的针对性数据,用于快速适配 + 基准评测

手机装箱、打印机加墨、洗衣装载、箱子打包,以及RoboCasa/VLABench/RoboDojo基准

根据小米产品发布网页上的介绍:"大规模、高质量的数据难以获取,而这种稀缺性——比其他任何因素都更——限制了策略模型能够扩展的上限。" 他们明确地将数据——而非算力、也非架构——定位为下一代机器人基础模型发展的核心瓶颈。

而这正是 Bright Data 的核心业务。

"小米已经用UMI打破过一次数据壁垒。Bright Data 能让你以互联网级规模、持续不断、且合规地再次打破这道壁垒。"

XR-1整个扩展(scaling)叙事的核心,依赖于向模型持续输入更多样化、真实世界的操作轨迹数据,以及更丰富的语言标注。Bright Data 是唯一能够在合法合规的前提下,以互联网级规模持续供应这类数据的基础设施——把小米现有的"一次性10万小时数据集",转变为一条持续刷新的数据管道。

亮数据为具身智能领域打造专属的数据管道

1. 预训练数据护城河 → Media Data API + Web Archive(网络存档)

小米的预训练语料本质上是"第一人称/人类操作视频 + 语言标注"的组合。这恰恰正是 YouTube、TikTok、B站(Bilibili)、Vimeo 上大量存在的内容类型——教程视频、家居整理内容、工业/商业流程录像、户外任务视频——其规模是任何内部爬虫团队都无法企及的。Bright Data 的 Media Data API 可从这些平台提取视频、音频、字幕、缩略图和故事板,且不会遇到诸如 yt-dlp 等工具常见的限流、地域封锁和反爬检测问题。再结合 Web Archive(PB级历史网络/视频数据)可以补充长尾场景覆盖,突破当前1,700个场景的限制——新场景意味着新的扩展收益,这正符合他们自己展示的scaling曲线。

2. 自动标注与指令对齐 → Datasets Marketplace + Search/Crawl API

小米的VLM自动标注器需要有依据的语言描述来标注场景/物体(如"整理沙发"、"分类鞋柜"、"收纳厨具")。Bright Data 结构化的电商与家居/产品数据集(Amazon、Wayfair、Home Depot等零售商)可提供机器人操作对象的精确产品分类、属性和图像——从而提升物体定位与指令-动作对齐的准确度。Search API(SERP) 和 Crawl API 还可以大规模抓取操作教程类文章和任务说明,丰富指令对齐所需的语言侧数据。

3. 场景多样性与全球泛化能力 → 住宅代理网络(Residential Proxy Network)+ 地域定向采集

XR-1的scaling曲线显示,成功率会随着数据量/多样性的增加持续攀升,尚未出现饱和迹象。Bright Data 的住宅IP网络几乎覆盖全球所有国家,能让小米采集到具有地区差异的家居布局、家电类型、零售环境和文化相关的任务变体——这对于要从中国家庭场景推广到众多打算布局的全球市场的厂商来说,至关重要。

4. 后训练与任务适配的数据新鲜度 → 定制采集 API(Custom Collection API)

新任务(打印机加墨、洗衣装载、箱子打包)的数据显示,XR-1仅需数小时示范数据即可达到较高成功率。Bright Data 的定制数据集/采集API能让具身智能厂商按需、可编程地为任何新任务类别抓取新鲜、有针对性的网络数据——加速演示中提到的"新任务高效适配"流程,而不必依赖人工数据采集活动。

5. 竞争与基准情报 → 监控/Discover API

Bright Data 可以为具身智能厂商搭建自动化监控系统,追踪竞争对手在RoboCasa365、RoboDojo、VLABench排行榜上的位置。排行榜动态、arXiv/GitHub机器人领域的最新发布,以及竞品基础模型的动态(如Physical Intelligence的π0.5、Google RT-X等)——让厂商的研究团队获得持续的竞争情报,而非依靠人工追踪。

6. 大规模合规保障 → KYC 与信任中心(Trust Center)

视频/媒体类训练数据具有敏感性——Bright Data 已经将其纳入KYC(了解你的客户)审核流程。对于身处全球监管高度关注下的小米而言,这不是阻碍,而是差异化优势:它能让注重合规跨国企业或大型科技公司的法务/合规团队对数据来源进行可审计的合规审批(仅限公开可用数据),而非依赖临时性抓取。

总结

小米用产品证明了:扩展无具身形态数据能可预测地提升真实机器人性能,且目前尚未看到饱和迹象。现在的瓶颈已经不再是模型——而是取决于具身智能厂商能以多快的速度持续为模型提供多样化、新鲜的真实世界视频与语言标注上下文。

Bright Data 是数据基础设施层,能将整个公开互联网——YouTube、TikTok、电商目录、教程内容、全球住宅环境——转化为合规、持续刷新的数据管道,正是这类UMI预训练和指令对齐数据才能让像XR-1的具身智能设备达到了业界领先水平。与其拥有一次性的10万小时数据集,不如想象一条能与你们共同持续扩展的数据管道。"

点击面向 VLA 流水线的视频信息流通过面向 VLA 流水线的 Web 规模视频信息流,打破远程操作瓶颈。按任务族定向的视频片段 + 元数据,开箱即用,可用于人形机器人策略训练。https://www.bright.cn/ai/video-data/vla?utm_source=organic-social-cn&utm_campaign=csdn进入亮数据相关主页了解更多产品服务细节,并预约数据产品演示!


复制链接https://robotics.xiaomi.com/xiaomi-robotics-1.html,进入小米机械臂Robotics-1新品发布网页!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐