Figure Helix 2.5:30个陌生家庭,零样本做家务

9月18日,Figure AI在旧金山湾区做了一件疯狂的事。

他们把搭载Helix 2.5模型的人形机器人,直接送进了30个完全陌生的真实家庭。没有提前采集场景数据,没有人工遥控,没有针对性微调。

机器人自己叠毛巾、整理床铺、拾取物品。盲测成功率56%。相比无预训练模型9%的成功率,提升了522%。

同一天,Anthropic披露Claude已主导公司26%的内部AI研发工作。今年2月,这个数字还不足1%。

💬 机器人进家和AI自研,哪个更让你震撼?评论区聊聊

零样本家务,意味着什么?

以前的人形机器人,换个房间就要重新训练。Figure这次证明了一件事:预训练数据规模翻倍,机器人动作误差规律性下降。

这叫"人类行为迁移缩放定律"——跟大模型的Scaling Law是一个逻辑。

📊 测试规模:30户真实家庭,完全零样本

📊 盲测成功率:56%(无预训练基线仅9%)

📊 性能提升:522%,验证了泛化至复杂家庭环境的能力

📊 算力支撑:Figure获Nscale超60亿美元算力支持

📌 数据来源:Figure AI官方发布(2026年9月18日);SegmentFault AI日报(2026年9月19日)

更关键的是,Figure已经启动了量产前的审厂流程。多家国内供应链企业已作出回应。人形机器人从实验室走向客厅,可能比预期更快。

Claude自己写代码,已占Anthropic研发的26%

Figure在搞身体,Anthropic在搞大脑。

9月18日,Anthropic公开了一组惊人的数据:

① Claude主导26%内部研发

今年2月还不足1%,8月飙到26%。这意味着Anthropic每4个研发任务里,就有1个是Claude自己完成的。包括写代码、调优系统、做实验验证。

② 3万个Agent全程受控

Anthropic同时披露了AI发展速度的三大衡量指标:AI自研占比、Agent监控质量、算力分配。目前3万个Agent在监控下运行,没有失控案例。

③ 设立实体湿生物实验室

Anthropic正式布局生物实验,刻意规避药物研发赛道。这与其长期公开警示AI生物恐怖主义风险形成鲜明对比——"风险预警+落地布局"的矛盾产业现象。

📌 数据来源:Anthropic官方披露(2026年9月18日);WSJ报道(2026年9月18日)

国内也在加速:智谱融资50亿美元,阿里全模态降价98%

国际疯狂,国内也没闲着。

智谱:50亿美元巨额融资+RSI实践

智谱9月18日完成50亿美元融资,同时披露GLM-5.3驱动的Infra Agent自建推理系统。FlashX峰值200 tokens/s,全程运行在国产10万卡集群。这是国内首次公开的递归自我改进(RSI)实践。

阿里:Qwen3.8-Omni-Flash音视频成本降98%

原生支持文本、图像、音频、视频四种输入,1M上下文。音频API成本降98%,音视频输入成本降93%。30项评测平均提升超26%。

华为:Agentic Cloud战略+灵衢昇腾950

华为云全面转向Agentic Cloud,推出智果AgentArts与CMS记忆存储。记忆容量较业界翻倍,服务客户超3500家。灵衢昇腾950智算集群9月底国内上线。

腾讯:WorkBuddy全栈应用生成

WorkBuddy 5.5.6上线全栈网页应用生成能力,自带云数据库、文件存储与AI调用接口。用户通过自然语言描述需求,即可生成带后端能力的网站并一键发布。

给普通人的三条建议

1. 关注具身智能产业链

Figure量产审厂已启动,国内供应链企业开始响应。减速器、传感器、电机等核心零部件厂商值得跟踪。这不是概念,是订单。

2. 学会用全模态AI工具

阿里Qwen3.8-Omni-Flash把音视频成本砍了98%,意味着视频理解、音频分析将从企业级走向个人级。早用早建立工作流优势。

3. 理解RSI(递归自我改进)

AI自己改进自己,是接下来2-3年最大的变量。智谱已经用Infra Agent两周把国产集群吞吐提3倍。这不是科幻,是正在发生的工程实践。

📌 一句话总结:机器人开始做家务,AI开始写AI,国产三层护城河(算力+模型+应用)同一天加固。变化的速度,比大多数人感知的快得多。


— LeafStay —

数据分析 + 职场真相 + 投资洞察

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐