AI前沿速递:颠覆行业!Meta开源300亿编码模型,人形机器人进厂、进养老院,AI走进真实生活
今日AI动态围绕「AI Coding开源生态与Harness博弈」与「具身智能从实验室走向真实场景」两条主线展开。AI Coding方向,Meta以Apache 2.0协议开源300亿参数Agent模型Muse Glimmer,经4bit量化仅需24GB显存即可本地运行,SWE-Bench Verified达76.0分,直接挑战云端API依赖模式;同期Meta推出编程智能体Muse Code及配套模型Muse Spark 1.2,采用异步后台多Agent架构与隔离git工作树设计,以极低定价向Anthropic和OpenAI发起冲击;Codex与Claude Code两位负责人因"模型可跨Harness调用"事件公开交锋,折射出AI编程竞争从"模型之争"转向"Harness之争"的深层趋势。具身智能方向,智元自研全模态大模型WITA-Omni以85.21分登顶DailyOmni榜单,将物理动作和表情提升为与语音并列的一级输出;CMG机器人挑战赛点球大战开赛,清华RoboCup冠军团队弦动光年携商用平台启元Q1亮相,实现赛事级运动控制算法的产学研闭环验证;深圳自变量机器人"0755号"正式入驻老人颐养院,成为国内首批进入重度失能照护场景的人形机器人"护理员",具身智能正从"秀肌肉"转向"增进民生福祉"。

一、Meta开源300亿参数Muse Glimmer:本地Agent模型冲击云端API依赖
8月10日,Meta超级智能实验室发布Muse Glimmer——一个300亿参数的多模态Agent模型,以Apache 2.0协议开源权重至Hugging Face。这是Muse产品线(Spark、Muse Code)中首个开放权重的模型,专为常驻本地的Agent工作流设计,瞄准函数调用、本地编码、长时间工具调用和LLM-as-a-Judge评估等Agent核心工作负载。
训练路径:Glimmer并非从零预训练,而是从Muse Spark 1.2通过logit蒸馏构建,经长上下文数据中期训练,再通过SFT、on-policy蒸馏和RL在推理、编码、Agent领域后训练。架构为稠密因果Transformer,52层,约296亿语言参数+约18亿ViT-G/14感知编码器,128K上下文,支持文本与图像输入,词表202K。
本地运行能力:300亿参数全精度需55GB+显存,Meta量化至约4bit后降至20GB以下,可在24GB或32GB消费级显卡上运行。配合DFlash投机解码,在RTX 5090上实现3.1倍解码加速,M5 Max上1.8倍,M4 Max上1.5倍。
基准表现:Meta模型卡显示:SWE-Bench Verified 76.0分,SWE-Bench Pro 51.2分,AIME 2026 94.7分,GPQA Diamond 83.5分,MCP Atlas(工具调用)75.5分。全面领先Gemma 4 31B,与Qwen3.6-27B互有胜负(Terminal-Bench 2.1上Qwen 60.7 vs Glimmer 51.7为明显短板)。

生态整合:Day-0支持transformers、llama.cpp、vLLM、MLX、ExecuTorch,Ollama、LM Studio、Together AI、Fireworks随后跟进。Meta同时宣布旗舰模型Muse Spark 1.2的开源权重将在未来几周内发布。扎克伯格配以14页长文《The Future is for Everyone》,主张超级智能应分散赋能而非集中掌控。
值得关注的原因:
这是AI编程领域"开源 vs 闭源"博弈的关键转折点。过去一年,Moonshot Kimi K3、阿里Qwen、DeepSeek主导了开源前沿,而OpenAI、Anthropic、Google未开放可比权重——Meta此次入局直接改变了开源阵营的力量对比。三个维度的看点尤为关键:
(1)成本模型变革——一个能执行多步工具调用、失败恢复、截图理解且运行在单卡上的模型,消除了按Token计费和数据外传的顾虑,这对隐私敏感的Agent场景具有结构性吸引力;(2)SWE-Bench Verified 76.0分意味着开源模型在编程Agent能力上已接近闭源第一梯队,企业自建Agent基础设施的技术可行性大幅提升;
(3)Muse Spark 1.2即将开源的预告更具战略意义——如果Meta的旗舰编程模型也走向开放,将迫使Anthropic和OpenAI在"高毛利API"与"生态防御"之间做出艰难抉择。 对开发者而言,"本地模型够不够好"已不再是问题,"是否准备好把Agent从云端搬回本地"才是。

二、Codex与Claude Code负责人公开交锋:AI编程竞争从"模型之争"走向"Harness之争"
一场开发者封号风波,最终演变为OpenAI Codex负责人Tibo(Thibault Sottiaux)与Anthropic Claude Code负责人Boris Cherny之间的公开交锋,暴露出AI编程领域一个日益核心的议题:Coding Agent的竞争本质究竟是模型之争,还是Harness(运行环境)之争。

事件回溯: 7月12日,开发者Theo在X上提出一个关键观察:同一个GPT-5.6 Sol模型,放入Claude Code运行环境后,部分任务表现甚至优于在Codex中的表现——模型没变,变的是外面的Agent Harness。Tibo随后公开分享了将GPT-5.6 Sol接入Claude Code的配置方法,声称"五分钟"即可完成,挑衅意味浓厚。

矛盾激化: 约一个月后,有开发者按Tibo的教程操作后,其Anthropic账号被封。Tibo在X上隔空质疑Anthropic,Boris Cherny亲自下场回应,但第一件事不是解释封号原因,而是问Tibo"要不要来Anthropic上班"。Tibo拒绝后,将Codex和ChatGPT Work用户的额度全部重置。

核心议题:这场"硅谷整活"式的口水仗背后,是一个正在变得越来越重要的行业问题:如果同一个模型可以跨Harness运行,那么Coding Agent的竞争壁垒到底在哪?是模型本身的能力差距,还是Harness对工具链、上下文管理、多步推理编排的优化深度?

值得关注的原因:
这场争论虽然戏剧化,但触及了AI编程赛道最深层的竞争逻辑。三个层面的信号值得重视:
(1)Harness价值被重新定义——如果"模型可插拔"成为常态,那么Claude Code、Codex、Cursor等工具的核心竞争力将从"绑定自家模型"转向"谁的Harness更好用",这对Anthropic的高毛利API策略构成直接挑战;
(2)用户锁定策略的边界——封号事件暴露出平台在"防止模型被竞品调用"与"维护开发者信任"之间的矛盾,过激的锁定行为可能加速用户流失;
(3)多模型编排趋势的验证——Tibo的跨Harness实验佐证了行业正在走向"按角色分配不同厂商模型"的编排架构,而非依赖单一供应商。 对工程团队而言,这意味着选型时需要同时评估模型能力和Harness可组合性。
三、智元WITA-Omni登顶DailyOmni榜单:将物理动作和表情提升为一级输出
近日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-OmniPreview以85.21分综合成绩登顶榜首,并在八项细分指标中的六项取得第一。
评测特点:DailyOmni大量采用真实开放环境音视频素材,核心考验模型融合视觉画面与环境音频、精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力——这正是人形机器人在真实物理空间开展人机交互所需的核心感知能力。机器人不仅要"看见画面、听见声音",更要实时判断声音归属主体、事件发生顺序,识别交互对象、找准响应时机。
架构创新:WITA-Omni的关键在于不是简单把聊天模型"装进"机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。训练阶段使用千万小时级多模态数据,将强文本、视觉底座升级为能够"听得见、看得懂,并进行音画联合推理"的全模态模型。智元构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间天然的时序关系。
场景落地:同期,智元发布机器人武侠IP,远征A3完成"鲤鱼打挺"、腾空450度后摆腿、连续韦伯斯特空翻等高难度动态动作。OmniHand3Ultra-M灵巧手拥有20个主动自由度,0.3秒极速开合,搭载多模态视触觉传感器,复刻人手级精细操控精度。国地中心携手百联集团共建全国首个可持续迭代的商业零售人形机器人应用高地,依托"麒麟训练场"构建零售实景实训样板平台。
值得关注的原因:
这是具身智能从"单模态感知"向"全模态协同"突破的里程碑。过去两年人形机器人的交互能力主要停留在"语音对话+视觉识别"层面,肢体动作和表情往往是预设程序而非模型实时生成。WITA-Omni的核心突破在于将动作和表情提升为模型的一级输出,这意味着机器人可以在对话中同步调整肢体姿态和面部表情——这是从"会说话的工具"进化为"有在场感的硅基伙伴"的必要条件。
三个看点:(1)真实环境音视频评测比实验室数据更有参考价值,DailyOmni的真实开放环境素材考验的是机器人在嘈杂现实中的感知鲁棒性;(2)端到端统一驱动避免了多模块拼接的延迟和信息损失,为人机实时交互提供了技术基础;(3)商业零售场景实训标志着技术验证从"实验室演示"走向"可迭代落地", 麒麟训练场+百联线下场景的闭环模式可能成为行业标杆。

四、CMG机器人挑战赛点球大战开赛:清华冠军团队弦动光年携启元Q1完成产学研闭环
在近期开赛的"CMG机器人挑战赛——点球大战"上,核心成员来自清华大学RoboCup冠军团队的弦动光年携人形机器人启元Q1亮相赛事,完成射门、扑救等多项足球竞技动作展示,将赛事级运动控制算法成功部署至商用机器人平台。
产学研协同路径:此次合作中,依托启元Q1开放的软硬件架构,弦动光年快速完成接口适配、参数标定与系统调试,将RoboCup冠军团队多年积累的算法部署至商用平台。启元机器人自主研发的HDK、SDK开放研发平台,为算法团队提供标准化量产机器人本体、开放运动接口及配套仿真工具,使开发者无需重复投入底层本体研发,可将更多资源聚焦于运动算法创新,加快科研成果向产品转化。
产业落地加速:就在上月,启元新创签约入驻张江机器人谷,计划打造全球最大消费级机器人企业的研发创新、生态共建共享及产业化总部基地。此次合作展示了"高校算法研发—开放机器人平台验证—国家级赛事测试—产业化应用"的完整产学研协同路径,为具身智能技术商业化落地提供了具有参考价值的实践样本。
值得关注的原因:
这条消息的独特价值在于它展示了一条完整的"算法→平台→赛事→产业"转化路径,而非单一技术突破。三个看点:(1)赛事作为技术加速器——RoboCup冠军团队的算法没有停留在论文里,而是通过启元Q1的开放平台快速部署到真实赛事中验证,这种"以赛促研"模式比纯实验室迭代更具工程价值;(2)开放平台的杠杆效应——启元的HDK/SDK降低了算法团队的本体研发门槛,让"写算法的"和"造机器人的"可以分工协作,这种产业分工是规模化落地的前提;(3)"张江机器人谷"的集聚信号——启元新创签约入驻张江,说明具身智能的产业集群效应正在从深圳、北京向上海延伸, 区域竞争格局正在成型。
五、自变量机器人"0755号"入驻深圳颐养院:人形机器人首次进入重度失能照护场景
近日,一台代号"0755"的人形机器人在深圳老人颐养院正式"上岗",承担日常巡查、物品递送、语音陪伴等基础照护工作。这家颐养院主要接收深圳户籍重度失能老人,照护场景复杂、服务标准严格。机器人"护理员"的落地意味着,具身智能正摆脱早期单纯的"秀肌肉"式技术展示,步入以"增进民生福祉"为核心的价值验证阶段。
世界统一模型WALL-B:自变量机器人成立于2023年12月,是国内最早采用完全端到端路径实现通用具身智能大模型的公司之一。今年4月,该公司发布世界统一模型WALL-B,作为全球首个"世界统一模型"架构的具身大模型,将视觉、语言、触觉、动作、物理预测等能力整合进同一个神经网络,能够理解重力、惯性、摩擦力等物理规律,面对未曾见过的场景能自主推理和决策,并具备自我学习能力,越用越"聪明"。
家庭场景拓展:该公司近期连续完成4轮融资,投后估值超过200亿元。上月亮相APEC"数智赋能高级别对话","机器人进家庭"项目作为唯一具身智能服务民生案例被收录进《亚太地区数智赋能案例集》。联合"58到家"在深圳推出机器人上门家政服务,机器人与保洁员协同完成清洁、收纳等家务,已从深圳拓展至北京。
值得关注的原因:
养老院场景是具身智能从"技术Demo"走向"社会价值"的终极考场。三个维度的信号:(1)场景难度决定技术含金量——重度失能老人照护远比便利店搬箱子复杂,非结构化环境、突发状况、安全敏感性都对机器人的感知鲁棒性和自主决策能力提出极高要求,能在这种场景"上岗"比任何跑分都有说服力;(2)WALL-B的端到端统一架构——将视觉、语言、触觉、动作、物理预测整合进单一神经网络,一旦跑通,将省去传统机器人"感知→规划→执行"多模块串联的延迟和误差累积;(3)商业模式的闭环验证——联合58到家推出上门家政、从深圳拓展至北京,说明自变量正在用"场景+数据+融资"三轮驱动,200亿估值的支撑不仅来自技术叙事, 更来自真实场景的持续数据回流。
总结
数字世界中AI Coding的竞争正从"谁的模型更强"转向"谁的架构更开放、谁的Harness更具可组合性",物理世界中具身智能正从"炫技演示"迈向"真实场景持续运行"的价值验证阶段。
AI Coding方向:两条消息互为表里:Meta以Apache 2.0开源300亿参数的Muse Glimmer,配合Muse Code智能体和即将开源的Muse Spark 1.2旗舰模型,直接改变了开源与闭源阵营的力量对比——一个能执行多步工具调用、运行在单张消费级显卡上的Agent模型,消除了按Token计费和数据外传的顾虑,使"本地Agent"从理念变为工程现实。而Codex与Claude Code负责人的公开交锋则揭示了一个更深层的趋势:如果同一个模型可以在不同Harness之间切换且表现相当,那么AI编程的竞争壁垒将不再是模型本身,而是Harness对工具链、上下文管理和多步推理的编排深度——这场"硅谷整活"式的口水仗背后,是整个AI编程赛道商业逻辑的结构性变迁。
具身智能方向:三条消息勾勒出一条从"感知突破"到"赛事验证"再到"民生落地"的递进路径。智元WITA-Omni以85.21分登顶DailyOmni榜单,将物理动作和表情提升为与语音并列的一级输出,标志着机器人正从"会说话的工具"进化为"有在场感的硅基伙伴"。CMG机器人挑战赛点球大战开赛,清华RoboCup冠军团队弦动光年携启元Q1完成"算法→平台→赛事→产业"的完整闭环,开放平台的杠杆效应让"写算法的"和"造机器人的"可以分工协作。自变量机器人"0755号"正式入驻深圳颐养院,成为国内首批进入重度失能照护场景的人形机器人——养老院场景对感知鲁棒性和自主决策能力的要求远超榜单跑分,能在这种环境"上岗"本身就是最具说服力的价值验证。
五条动态的共同信号是:AI Coding和具身智能都在经历从"能力展示"到"价值兑现"的关键切换——前者争夺的是开源生态的主导权和Harness的可组合性,后者冲刺的是真实场景中的持续运行能力和数据飞轮的自我强化。
作者:咕泡科技——十年专注AI与IT中高端人才培育
各条目信息原始出处:HuggingFace 官方博文、GitHub (claude-proxy / daily-omni)、深圳商报、证券时报、晶报、光明网、深圳特区报,各公司官方公告及社交平台等。图片来源于网络,侵删谢谢!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐





所有评论(0)