告别单卡竞争,摩尔线程让国产算力第一次跑通了训推用全闭环
7月17日,一年一度的世界人工智能大会(WAIC 2026)在上海拉开帷幕。展览总面积首次超过 10 万平方米,1100 余家企业携 3000 余项前沿展品亮相。
与往年算力芯片散落在各家应用展台角落不同,今年 WAIC 首次在张江科学会堂专门辟出一万平米的芯算融合馆,百余家企业同台竞技。走进 H2 馆,华为、摩尔线程、沐曦、燧原、东方算芯、昆仑芯、天数智芯、清微智能等国产 AI 芯片厂商几乎全员到齐——这是算力赛道第一次以独立展馆的形式出现在 WAIC,颇为壮观。

超节点集群、新一代芯片创新架构等集中亮相,业界玩家纷纷亮出围绕算力底座、全栈软件栈、整机集群搭建的一体化交付体系。显然,当前国产算力的竞争,已经从单卡比拼全面升级为系统级能力的较量。
7月18日,摩尔线程创始人、董事长兼首席执行官张建中在“词元时代 万物智能”主题论坛上,系统阐释了摩尔线程围绕国产算力构建的完整战略版图:三大 AI 工厂——模型训练工厂、词元生产工厂、智能体生产工厂。在展馆内,这三大 AI 工厂也以系统级方案的形式落地为直观的技术和应用案例展示,直接回应了行业当前最核心的命题:国产算力如何从能用走向好用。京东集团技术委员会主席、京东云总裁曹鹏表示:“AI Infra基础设施层面相对前几年有一个非常大的转变,全国产化体系正在越来越多的被建立起来。包括国产GPU、国产推理引擎、国产模型的一整套全国产化体系,正在越来越多被行业认可和使用,摩尔线程就是一个非常典型的案例,京东也跟摩尔线程有非常深度的合作。”


摩尔线程为什么要做三大 AI 工厂?
一个重要的原因是:词元(Token)正在成为 AI 时代的硬通货。
今天正处于智能体 AI 蓬勃发展的时代,人人都可以用 AI,因为智能体可以代替人发号施令和行动。而词元,正是驱动这一切运转的核心燃料。当智能体批量阅读文档、调用工具、编写代码时,Token 消耗量指数级增长。
与此同时,模型本身也在急剧膨胀。Kimi K3 参数量达 2.8 万亿,位列全球开源第一、综合第三;上下文窗口从 256K 向 1M 乃至更高迈进。
模型变大、Token 消耗暴涨——这对算力基础设施提出了全新要求。对此,张建中进一步表示:“在这场从感知、生成、代理到物理 AI 的演进中,每一步的发展都离不开一个关键的技术加速器——Universal GPU,摩尔线程把它叫做全功能GPU。”

在全功能 GPU 的支撑下,摩尔线程提出建设三大 AI 工厂:模型训练工厂解决大模型训得好的问题,词元生产工厂解决 Token 供给瓶颈,智能体生产工厂则解决AI 应用落地最后一公里的问题。三者环环相扣,构成了从算力到应用的全链路闭环。

三大 AI 工厂的构建逻辑
-
模型训练工厂:全功能、高性能、高扩展、高精度、高稳定
模型训练工厂是三大 AI 工厂的源头。张建中在演讲中指出,大模型训练工厂是一个非常复杂、难度系数很高、要求非常高的工厂——“所有的模型能不能达到前沿模型的水平,完全取决于模型工厂的基础设施能力”。

全功能 GPU 是前提。你不知道下一个要训练的模型是什么——大语言、多模态、物理模型、科学研究、世界模型、文生图/视频,都需要全功能 GPU 支撑。张建中特别提到,摩尔线程 S5000 是国内唯一具备 Ray-Tracing(光线追踪)能力的智算芯片——既能做训练推理,又能做图形渲染和物理仿真,这是物理 AI 训练的关键能力。
软件栈方面,摩尔线程提供从底层 MUSA 开始的完整训练套件。在 MUSA SDK基础上,兼容 PyTorch、Triton、TileLang 三大算子生态,支持 Megatron-LM、DeepSpeed、FSDP等训练框架。此外还有MT-HTA仿真系统(SimuMax/SimuInfer),让用户在训练前就能评估耗时和效果,降低数亿级试错成本。强化学习框架 MT-VeRL 和 MT-Slime 已完整适配,用户可从 Github直接下载使用。摩尔线程方面表示,其训练套件在收敛 Loss 值和模型训练质量上,均可与全球最先进的训练平台相媲美。
并且,摩尔线程夸娥智算集群在关键维度均已实现突破:集群规模持续扩大时可保持高达 95% 的线性扩展效率;训练精度与国际主流计算卡持平,损失曲线高度一致;支持断点续训,有效训练时长占比超 90%。
在实战层面,摩尔线程也展示了多项标杆级成果:
-
MoE-236B 模型:与合作伙伴一起,在万卡级集群上从零起步完成训练。现场展示的该模型与 GPT-5.6 及国内某头部模型的盲测对比——236B 模型逻辑反而更加清晰,“如果不看是哪一个模型,我相信大家去盲测之后,236B 的模型反而是最好的”。这证明国产大规模集群上的模型训练“其实已经做的很好了”。
-
北大 EvoPhys-World 5D 世界模型:北京大学 EvoPhys 项目组在摩尔线程“灯塔计划”支持下,在摩尔线程S5000上完成全栈原生训练,连续37天登顶WorldScore“世界生成”维度榜首。EvoPhys.ai 创始人谭桦杰在论坛上指出,这标志着国产算力在支撑高水平 AI 研究方面取得重要进展。后续双方还将联合发布白皮书及 EvoPhys-World 技术报告。
-
智源 RoboBrain2.5 具身大脑模型:在 S5000 千卡级集群训练,效果媲美国际同类模型。
-
Wan 开源 ViT 模型:用于 Diffusion 和文生视频训练,S5000 千卡级集群训练效果与国际主流产品基本一致。
这些成果不仅验证了摩尔线程全栈技术路线的可行性,更向行业传递出一个明确信号:国产AI算力基础设施已具备支撑前沿大模型训练的硬实力。
曹鹏表示:“在我们的模型工厂当中,结合摩尔线程 MTT S5000,在模型的训练、适配、调优上取得了非常好的进展。最新发布的一系列 JoyAI 大模型,相当一部分训练的算力是依托于摩尔线程所提供的国产化算力。后续我们还会在这方面投入更多的资源,把模型训练做得更好。”
与此同时,极佳视界与摩尔线程基于 MTT S5000 联合共研完成驾驶世界模型、驾驶重建模型、具身世界模型、世界动作模型等物理AI模型训练,已经完整走通国产芯片训练国产模型的全部链路。
-
词元生产工厂:全适配、高性能、低延迟、高性价比
如果说模型工厂解决的是 AI 聪不聪明的问题,词元工厂解决的则是 AI 普不普及的问题。
张建中在演讲中解释了词元工厂的核心点:如何降低每个 Token 的成本。词元工厂如何更快适配,如何让新模型快速在工厂里部署服务,成本能不能降到最低,这是最典型的用户痛点。

因此,摩尔线程的解法是用一套高性能推理套件,将适配速度和Token成本两个维度同时压到极致。
首先是全栈适配。摩尔线程高性能推理套件深度适配 SGLang、vLLM 等主流推理框架,覆盖大语言模型、视觉、语音、DiT 及视频生成等多模态推理场景。目前,摩尔线程已实现对 DeepSeek、MiniMax、GLM、Kimi、Qwen 等主流大模型的 “发布即适配” ——新模型发布的当天,就能在摩尔线程的算力平台上完成部署,无需等待数周甚至数月的适配周期。
MiniMax 副总裁薛子钊表示:“在整体训练和推理当中,我们看到今年是国产芯片很重要的拐点,越来越多真实的线上的场景承担起推理和训练的任务。整体渗透率的进展,不管是实际承担线上任务还是之后的训练上,我们都觉得今年都是一个非常重要的拐点。”

其次是性价比层面。摩尔线程在本届 WAIC 上重磅推出了 PD(Prefill-Decode)分离异构推理方案。原理并不复杂:将高算力需求的Prefill计算池部署在 MTT S5000 上,将高带宽的 Decode 生成池部署在国际主流 GPU 上,异构分离、分池部署。这一方案带来的效果是显著的——用异构组合的方式,让不同芯片各司其职、各展所长,在保护客户存量设备投资的同时,大幅提升整体推理性价比。
趋境科技创始人、首席执行官艾智远表示:“我们就测了各种各样的 GPU,选择了一款当前阶段的最优选择,也就是摩尔线程的 MTT S5000。我们通过摩尔线程的GPU,再加上国际主流 GPU 做异构分离,现在正在支撑很大量的 Token 的产能。”基于这一方案,趋境科技正在构建日均万亿级的 Token 产能。

值得一提的是,全功能 GPU 在词元工厂中的差异化能力还体现在 3D/4DGS 加速上。据介绍,摩尔线程自研的 3D LiteGS在SIGGRAPH Asia 2025 获得奖项,自研的 3D 语义理解技术 UniSem 也已开源。
这些能力让词元工厂的服务边界从纯文本推理延伸到了更具想象空间的 3D 空间生成领域。
-
智能体生产工厂:高效连接数字世界与物理世界
张建中在演讲中表示,AI 最终落地到每个消费者、跟每一个个体互动时,会遇到两种智能体。
数字智能体方面,摩尔线程自研的全栈小麦智能体掌握 60 余项技能,支持 38 款APP的跨应用控制,通过前端多模型、丰富知识库的灵活配置,“能够做到更快、更准、更懂你”。
物理智能体方面,摩尔线程推出了全栈具身智能仿真平台 MT Lambda。该平台集成了开源物理仿真引擎 MuJoCo-MUSA和Newton-MUSA(均为摩尔线程加速版),以及自研物理引擎 AlphaCore,三者共同支撑物理仿真计算。在图形渲染方面,平台集成了 3DGS、自研 AI 生成式渲染(AGR)和光线追踪技术——S5000 是国内唯一具备 Ray-Tracing 能力的智算芯片,可在高度拟真的数字孪生环境中训练机器人。
京东同样把具身智能作为双方下一阶段合作的重要方向。曹鹏表示:“具身工厂是京东下一步非常重要的发展方向,在这里面摩尔线程本身的计算优势,例如渲染优势,能够帮助我们在数据生成、具身仿真领域做很多工作,帮助我们在数据的应用上取得非常大的突破。”

为承载小麦智能体的智慧进化,摩尔线程打造了两款 AI 原生终端——MTT AIBOOK(AI算力本)和 MTT AICUBE(家庭 AI 中枢),构建起“云-边-端”协同的全场景智算矩阵。


AI 工厂离不开超节点
三大工厂的底层支撑,离不开算力基础设施的升级。在本届 WAIC 上,摩尔线程展出了 MTT C256 超节点,用创新架构首创了一层 Scale-up 网络将 256 张GPU 有效聚合为一台数据中心级计算机。

随着模型参数持续膨胀等,万卡级智算集群已成为大模型角逐的标配。而万卡乃至十万卡级集群不能靠简单堆叠服务器,需要全新的架构支撑。
摩尔线程 MTT C256 超节点首创一层 Scale-up 网络,实现标准单宽机柜 128 卡全互联,并柜扩展可达 256 卡极速互联,攻克传统多层网络的带宽损耗与高延迟痛点,在 2U 空间内释放极限的单位面积算力。MTT C256 采用计算与交换一体化的高密设计,将 256 张 GPU 像一张 GPU 一样协同工作,具备三大核心优势:
-
极致互联。业界普遍的一层 Scale-up 网络仅能支持 64 卡互联,MTT C256 首次在一层 Scale-up 网络中实现 256 卡全互联,突破这一限制。卡间通信延迟被压缩至亚微秒级别(人眨一次眼约 10 万微秒),带宽利用率显著提升,为大模型分布式并行策略的优化提供了更广阔的空间。在一次大模型计算中需要发生海量通信,通过这种技术,可以将 256 张 GPU 像一张卡一样高效协同。
-
高密度部署。单机柜 GPU 密度领先行业,仅通过两个标准机柜即可实现 256 卡的一层 Scale-up 极速互联,在大幅提高智算中心 GPU 部署密度的同时,有效节省机房空间。
-
生态与工程兼容。采用 2U 节点设计,完美兼容现有智算软硬件生态,支持集群从万卡向十万卡级平滑扩展。在工程化层面,MTT C256 通过高效液冷散热、三盲插设计、完善的 RAS(可靠性、可用性、可服务性)机制以及配套的集群管理系统,保障了超节点在大规模部署下的长期稳定运行与便捷维护。
张建中在谈及词元生产工厂时则表示,规模化部署和系统级优化,是持续降低单位Token 成本的重要路径。


MUSA 生态:让开发者"迁移门槛等于零"
三大工厂和超级节点价值的释放,一大关键是开发者。而 MUSA 生态正是摩尔线程连接开发者的关键桥梁。为了让开发者更好的从国外的生态系统迁移到 MUSA,摩尔线程给出了解法。例如:摩尔线程推出了 MusaCoder,这个模型可以直接写代码,直接写 MUSA Kernel(算子),并且代码水平还不差。二是MUSACODE AI 编程 Agent,可以自动完成代码移植。
此外,摩尔线程还专门设立了摩尔学院,通过“五维战略”和“六项计划”,与国内的高校、科研院所、企事业单位展开密切合作,投入了大量的人力、财力和物力,为中国 AI 产业培养最优秀的本土人才。

摩尔线程率先进入系统级竞争阶段
从模型训练工厂的万卡级集群实战,到词元生产工厂的 PD 分离异构推理突破,再到智能体生产工厂连接数字世界与物理世界的完整闭环,摩尔线程已经成为当下国内 GPU 厂商中率先完成训-推-用全链路系统级方案交付的企业。以全功能 GPU为底座、MUSA 生态为连接器、三大 AI 工厂为业务主线,摩尔线程从芯片、集群到软件栈形成了清晰的差异化路径,在国产算力从"单点突破"走向"体系化作战"的产业拐点上率先交卷。
在 WAIC 2026 的展馆里,一个趋势已经清晰可见:国产算力的竞争维度正在发生根本性切换——从比拼单卡性能,升级为比拼系统级的集群工程能力、软硬协同的推理效率、以及生态对开发者的实际吸附力。以摩尔线程为代表的国产算力厂商,正凭借自主可控的全功能 GPU 架构、Day 0 适配的生态响应速度、以及极具竞争力的每 Token 落地成本,在几乎由单一国际厂商长期主导的 AI 算力产业格局中打开新的缺口。
算力底座逐渐夯实、生态适配从月级压缩到天级,AI 产业的下一站已经愈发清晰——Agent 浪潮仍在加速,物理 AI 的大门正在打开,Token 消耗量的指数级增长远未见顶。面对万亿参数模型、万卡级集群、以及从云端到端侧的全场景算力需求,摩尔线程用三大 AI 工厂给出了一套系统级的回应方案。在 WAIC 2026 这个节点上,国产算力已经交出了一份有分量的阶段性答卷。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)