本周 AI 技术栈在三个层面同时发生质变:推理层出现每秒526万 token 的新物种,模型层迎来1.6万亿参数的国产开源旗舰,应用层则从纯软件对话向"能操作物理设备的智能体"延伸。这三个变化不是孤立新闻,而是一条环环相扣的因果链——智能体兴起让推理需求暴增,算力军备竞赛随之推高了推理硬件价格,倒逼企业转向开源模型与异构芯片,最终把低成本推理能力注入机器人这个物理世界载体。

本文能帮你解决三个实际问题:一是当前推理硬件该怎么选,二是开源大模型的成本账该怎么算,三是具身智能这条新赛道何时值得下场。下面先给出硬性技术指标速览,再重点拆解两条绕不开的技术路线——存算一体的推理加速架构与开源 MoE 大模型的落地成本,随后补一张生态上下游关系图谱、一条因果链路、一轮四维研判和一组未来信号。每个主题都会给出可复现的伪代码,方便你直接落地验证。

技术速览(推理加速 / 开源大模型 / 具身智能)

本周最值得关注的技术指标可以概括为一句话:推理吞吐在指数级跃升,推理成本在指数级下降。单机吞吐端,Cerebras 推出的 Ultrafast 把 Llama 3.1 70 B 跑到了每秒526万 token[①],Google 的 Gemini 3.7 Flash 在 Grinch 基准上也达到每秒330 token[①],NVIDIA 的 Nemotron 3.5 Lightning 则是4倍输出速度[④]。自研芯片端,OpenAI 与博通合作的 Jalapeño 芯片以700瓦功耗跑出每秒925 token 以上(11 B 稠密),等效性能比竞品快约13倍,总拥有成本做到约1/10[②],而 Groq 3 LPX 已进入全面量产、搭载于 Vera Rubin 平台[⑥]。价格端,智谱 GLM 5.3 Flash 把推理单价压到每百万 token 0.045美元[②],DeepSeek-V4-Pro 在 OpenRouter 上的流量占比从周初2%冲到周三43%[③]。一句话速览:推理更快、更省,开源模型的性价比正在击穿闭源定价体系。

一、主题深研

1.1 推理加速:从 HBM 到 SRAM 的架构转向

过去两年,大模型推理的瓶颈高度集中在内存带宽——HBM(高带宽内存)又贵又慢,成了单位 token 成本下不来的主因。本周出现的多条技术路线,本质上都是在绕开这个瓶颈。理解它们的关键,是先看清"数据驻留"与"数据搬运"这对矛盾:传统 GPU 推理中,模型权重太大放不进片上缓存,每做一次前向计算都要把权重从 HBM 反复搬运到计算单元,搬运时间往往大于计算时间,于是吞吐被内存带宽锁死。谁能把权重尽量留在离计算单元更近的地方,谁就能在这场竞赛里领先,这是理解本周所有推理硬件的钥匙。

第一条是 Cerebras 的 SRAM 晶圆级路线。它把整个模型权重塞进片上 SRAM,从根本上取消了 HBM 这个搬运瓶颈。Ultrafast 服务就是这条路线的最新产物:在 Llama 3.1 70 B 上做到每秒526万 token,进入百万 token 每秒量级,是当前公开推理吞吐的头部水平[①]。SRAM 的物理特性决定了它的优势不在绝对浮点算力,而在"权重无需在片外与片内之间反复搬家",推理延迟因此被压到极致。它的代价是单片晶圆面积大、良率成本高、造价昂贵,适合对延迟极度敏感、调用量大且集中的超大规模推理场景,而不是通用训练任务。当你把这张牌放到"每瓦性能"的评价体系里,它的价值才会完整显现——它本质上是用硬件成本换取极致延迟。

要理解 SRAM 为什么能带来如此大的延迟优势,可以对比一下内存层级:HBM 虽然带宽远高于普通内存,但距离计算单元仍隔着一段片外访问路径,而 SRAM 直接集成在逻辑芯片旁边,访问延迟低1到2个数量级。模型权重越大、单次前向需要搬运的数据越多,这个延迟差被放大的倍数就越高。这也是为什么 SRAM 路线在小模型高频调用这一场景下优势最明显,而一旦模型大到片内容纳不下,它的性价比就会快速回落。

第二条是 OpenAI 的 Jalapeño 自研芯片。它不走 SRAM 极端路线,而是用700瓦的功耗预算换性能:每秒925 token 以上(11 B 稠密)、16路自研样机、等效性能比竞品快约13倍、总拥有成本约1/10[②]。关键信号在于它把"每瓦性能"当成了第一目标,这直接对标英伟达在新一代旗舰上强调的指标。700瓦的功耗选择意味着,当电力成为数据中心新的硬约束之后,硬件设计的收敛方向已经从"堆绝对算力"转向"单位功耗能服务多少 token"。这条路线对业内的启示是:芯片竞争的下半场,比拼的不是谁的单卡峰值高,而是谁能在固定功耗预算里挤出更多可用推理能力。

英伟达的回应是两条腿走路。在硬件端,B 系列里的 NVLink Fusion 采用"一体化可结合式原生设计",官方给出的每瓦性能比 DGX-B200 高1到3倍,并点名 OpenAI、Meta、Celestial 采用[④]。在软件端,英伟达持续释放推理工具链:NVIDIA Dynamo 开源推理框架、CUDA Python 落地、Jetson Orin Nano 二 做到"一分钟生成桌面全栈"[④]。这三件事拼在一起,就是英伟达在"专用芯片围攻"下的防御姿态:既守住旗舰性能,又用 CUDA 生态和开源工具绑住开发者,本质是在性能护城河之外再加一道生态护城河。

值得特别提一条本地化路线:Perplexity 与英伟达合作的 Portable Computer,把智能体完全放到 DGX Spark 等本地硬件上运行,实现"零 token 成本",并指出多数代理框架是为本机不存在的模型构建的[⑥]。这条路线如果跑通,将直接挑战"按 token 计费"的主流商业模式,把推理成本从云端账单里剥离出去。对开发者来说,它意味着未来可能有一条"买断硬件、免费推理"的第三条路。

性能对比(本周可查的硬数字)

方案

吞吐或性能

功耗影像

关键设计

Cerebras Ultrafast

每秒526万 token

片上 SRAM,免 HBM

Gemini 3.7 Flash

每秒330 token

每请求4.95美元

谷歌闭源

OpenAI Jalapeño

每秒925 token 以上

700瓦

博通合作,16路样机

Nemotron 3.5 Lightning

4倍输出速度

英伟达推理优化

NVLink Fusion

每瓦性能比 DGX 高1到3倍

一体化原生设计

实现细节:本周几条路线最有工程借鉴价值的是"每瓦性能"这个评价维度的切换。过去比较推理硬件只看吞吐(token 每秒)和总吞吐成本(美元每百万 token),现在总拥有成本正被拆解成"功耗乘以单价乘以寿命"里的功耗项。Jalapeño 用700瓦换取13倍等效性能,本质是把"单位功耗可服务的 token 数"最大化;NVLink Fusion 用"每瓦性能高1到3倍"作为卖点,也是同一个逻辑[②][④]。对做推理服务的工程团队来说,这意味着选型公式要从"峰值 TOPS"改成"每瓦 token 数乘以单批次首 token 延迟",前者决定硬件账,后者决定用户体验账。这一转变看似是概念变化,实际会重写一批采购与压测脚本的评判口径。

在这轮提速竞赛背后,还藏着一条供应链的牛鞭效应。英伟达告知客户 AI 相关服务器涨价超15%之后,GPU 价格上涨、服务器出货量下滑、内存制造商加速转向高带宽内存,整个 AI 供应链出现了需求信号被逐级放大的现象[⑥]。这个效应的本质是,下游对推理效率的恐慌性需求经过层层加码传导到上游,最终让内存这个物理瓶颈变得更加昂贵。对开发者而言,这意味着硬件成本的真实风险不在单卡售价,而在整条供应链的价格波动,选型时要把供应商的备货与议价能力一并纳入评估。

把本周几条推理路线并置,会发现一个共同的技术权衡:SRAM 路线用高昂的硬件成本换极致延迟,自研芯片路线用固定功耗预算换能效,本地化路线用一次性硬件投入换零边际成本,而英伟达则是用生态锁定守住全栈。四条路没有绝对优劣,只取决于你的工作负载落在哪个象限——是延迟敏感还是成本敏感、云端部署还是本地部署、跑单一模型还是多模型切换。也正因如此,本周出现的软件层优化格外值得关注。OpenAI 把 GPT 5.6 Sol 部署在 Cerebras 上、而非自己的常规基础设施,换来吞吐比标准接口快约11倍、端到端提速5.6倍的收益[①];英伟达的 NeMo Switchyard 则把多模型推理路由的成本降到约1/3[⑥]。这两个案例传递的信号很明确:推理降本不只发生在芯片层,也同样发生在软件调度层,而软件层的优化往往更快、更便宜、更容易落地。

把这几条路线的数据并读,还能读出第二个维度——延迟与吞吐的取舍。Cerebras 把单次延迟压到极致,适合实时交互场景;Jalapeño 用 16 路样机摊薄单位吞吐成本,更适合离线批处理。选型时如果只盯单一的 token 每秒指标,很容易忽略这一层:同样的吞吐,延迟敏感的客服场景与成本敏感的批量生成场景,需要的是完全不同的硬件配置。

伪代码示例(概念性,说明异构推理路由思路)

# 以下根据公开摘要信息对"异构推理路由"的理解示意
# 具体实现请查阅 NVIDIA、Cerebras、OpenAI 官方技术文档
def route_inference(prompt, latency_budget_ms, cost_cap):
    # 在延迟预算与每 token 成本约束下选择推理后端
    candidate = None
    for backend in backends:  # sram 类 / 自研芯片类 / 旗舰 gpu 类
        if predict_latency(backend, prompt) <= latency_budget_ms \
           and predict_cost(backend, prompt) <= cost_cap:
            candidate = backend
            break
    return candidate.serve(prompt)

⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。

部署建议:如果自建推理服务,短期务实选择是"英伟达旗舰加 NVLink Fusion"守住性能基线,同时把大批量、成本敏感的任务分流到开源推理框架或云上 SRAM 服务;如果追求极致单位算力成本,可以先小规模试采博通代工路线的芯片,但要把 CUDA 生态兼容的迁移成本计入总账。判断标准始终只有一个:单位 token 的总拥有成本,而不是单卡峰值指标。先跑通小批量压测,再决定是否规模采购,是控制风险的正确顺序。 压测时要把变量控制在最小集:固定模型版本、固定输入分布、固定并发数,只换后端,对比首 token 延迟、末 token 延迟、每瓦吞吐与每百万 token 成本四个指标,而不是只看一个峰值数字。因为推理场景的真实成本高度依赖负载的时间分布,夜间空闲时段的功耗与白天峰值时段的延迟,对总账的影响可能比单卡标称性能更大。

1.2 开源 MoE:1.6万亿参数的成本账

本周国产开源模型在参数规模上完成了对闭源的"同尺寸反超"。两个标志性对象值得拆,它们的共同点是都押注了 MoE(混合专家)架构,而这一架构正是开源阵营能把成本打下来的核心技术底牌。它的降本逻辑其实很朴素:稠密模型每次前向都要跑全部参数,而 MoE 只激活其中一小部分专家,把单位 token 的计算量压下去,进而把单位成本压下去。参数规模做得越大,这个节省的比例越可观,这正是开源模型敢于把总参数推到万亿级的底气所在。但要理解本周的转折,得先补一段"匿名模型"的来龙去脉。

本周初,一个匿名模型 Ox Alpha 在 OpenRouter 上免费发布,支持100万 token 的超长上下文与多模态输入,随即引发全网猜测[②]。它上线前四天就处理了26万亿 token、录得32.7万独立用户与832.8万次完成会话,直接打破 OpenRouter 的发布纪录[⑥]。几天后谜底揭晓——智谱确认 Ox Alpha 正是 GLM 5.3 Flash,并开源权重[②]。这个"匿名突袭"的过程本身就是本周最有冲击力的营销与产品事件:它证明了一款开源模型只要性价比足够锋利,就能在一周内完成从零到封闭平台流量之巅的逆袭。

第一个标志性对象是 DeepSeek-V4-Pro,总参数1.6万亿、每 token 激活490亿,定价只有 Groq 上 Gemini 3.7 Flash 的约1/26。它在 OpenRouter 上的流量占比从周初的2%一路冲到周三的43%[③]——这不是营销数据,而是真实调用流量的迁移,说明开发者对"性价比"的投票远比口头评论诚实。配套的 DeepSeek Harness 采用 MIT 许可开源,内置模型注册表,允许把定制配置一键复用,直接把"部署大模型"的门槛降到一行命令[①]。对中小团队来说,这个工具链的意义在于:过去要花几周搭起来的评测与部署管线,现在可以在一两天内复现,极大降低了切换成本。

第二个是智谱的 GLM 5.3 Flash。3200亿参数的 MoE 架构,仅180亿活跃参数,推理单价每百万 token 0.045美元[②]。它的技术亮点不在参数堆料,而在"防毒优化对齐"的微调方式,同时把推理速度做到每秒14.77 token[①]。在 CyberGym 强化学习安全基准上拿到84.5%的成绩,说明它在"安全可靠"与"性能释放"之间做了显式折中[①];同期,GLM 5.3 在 Artificial Analysis 智能基准指数上追平开源领先模型 Kimi 3[①]。对于有中文合规诉求、又不想在安全测评上反复返工的开发者,这两个成绩是可以量化的参考锚点。

具体到 CyberGym 这类强化学习安全基准,它考察的不是静态问答安全,而是模型在交互环境里发现漏洞、执行利用的真实能力,更接近实战攻防,因此分数对安全团队更有参考价值。而 Artificial Analysis 智能基准指数的意义在于横向可比:它把多家模型拉到同一套评测下排名,追平开源领先模型意味着国产模型在综合智能这一维度也已经进入第一梯队,不再只是便宜够用的代名词。

开源冲击之下,闭源阵营的应对也值得读。OpenAI 公布了降价数据:开源的 Luna 使用量跃升13.8倍、Terra 上升5.6倍,而保持原价的 Sol 仅增长1.1倍,且降价获取的份额大多来自其他实验室[⑥]。这组数据本身就是一份"价格弹性"的实证报告——它证明在当下,降价带来的需求增长远大于毛利损失,也解释了为什么闭源厂商被迫跟进降价。

把时间轴拉长,开源阵营的成本下行曲线更加清晰。有分析指出,开源模型的数学推理成本在过去10个月下降了约200倍,而推理成本在最近6周内又下降了近10倍[③]。这个斜率意味着,任何停留在几周前的成本假设都会很快过时,选型时的成本测算必须用周而不是季度来更新。另一个佐证来自资本侧,DeepSeek 正寻求约74亿美元融资、估值有望达740亿美元[⑥],说明开源模型的成本优势开始转化为可观的资本溢价,估值与成本效率正在正向循环。

份额侧的对比同样鲜明:经 OpenRouter 路由给中国模型的 token 份额每周已超过30%,而 Claude 的企业支出份额仅约10%[③]。一边是开源的份额曲线一路上扬,一边是闭源的份额持续被蚕食,这组对比把定价权争夺从口号变成了可以每周跟踪的硬数据。

开源带来的另一个收益是权重的可控性。闭源 API 意味着模型的每次更新、每处安全策略都由厂商单方面决定,而开源权重允许团队在本地做全量审计、定制对齐,甚至在强监管场景下做离线部署、让数据不出域。对金融、政务、医疗这类行业,这一点往往比纯粹的价格差更值钱,也是它们愿意自建推理集群的深层原因。对工程团队而言,还有一个隐性收益不容忽视:开源权重意味着可以自建推理、离线部署、让数据不出域,这在金融、医疗、政务等强合规场景里的价值,往往超过单纯的价格差。再从工程实现看,MoE 的另一个难点是负载均衡与专家并行:当总参数达到万亿级,激活的专家分布在不同计算设备上,跨设备的通信会成为新的瓶颈。这也解释了为什么总参数与活跃参数的比值不能简单等同于推理加速比,真正的加速还取决于专家切分策略、通信拓扑与批处理大小。

性能与定价对比

模型

参数规模

活跃参数

定价或性价比

关键能力

DeepSeek-V4-Pro

1.6万亿

490亿

约 Gemini 3.7 Flash 的1/26

OpenRouter 流量43%

GLM 5.3 Flash

3200亿

180亿

0.045美元每百万 token

CyberGym 84.5%

OpenAI Luna(开源)

2亿

比 GPT 5.6 Flash 便宜13.8倍

小模型路线

实现细节:MoE 架构是这两家同时押注的方向——总参数比活跃参数高一个数量级,意味着前向计算只激活一小部分专家,推理成本被大幅摊薄。GLM 5.3 Flash 用3200亿总参、180亿活跃,把"稀疏激活"的性价比做到当下国产模型的标杆级;DeepSeek-V4-Pro 则用490亿活跃参数承接更大规模的通用任务。稀疏激活的性能上限由负载均衡决定,如果专家路由不均衡,少数专家成为热点,性价比优势会被磨损,这也是两家在工程上真正拉开差距的地方。理解这一点,就能看懂为什么"参数规模"已经不是衡量模型性价比的核心指标。

这也解释了一个反直觉现象:本周 DeepSeek-V4-Pro 总参数 1.6 万亿、GLM 5.3 Flash 总参数 3200 亿,两者的绝对参数差距超过 5 倍,但推理单价却只差不到 2 倍。原因正在于活跃参数的规模,而非总参数——总参数决定存储与训练成本,活跃参数才决定每一 token 的推理成本。看懂这个区分,选型时就不会被营销话术里的参数规模带偏。

伪代码示例(概念性,说明 MoE 稀疏激活与对齐推理)

# 以下根据公开摘要信息对"MoE 稀疏激活与对齐推理"的理解示意
# 具体实现请查阅 DeepSeek、智谱官方技术文档
def forward_moe(x, experts, router, aligned=True):
    # 只激活 top-k 专家,降低每次前向的计算量与成本
    top_k = router.topk(x, k=2)
    out = sum(experts[i](x) for i in top_k)
    # 对齐约束(如防毒优化)在解码阶段叠加安全过滤
    return safe_decode(out) if aligned else out

⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。

部署建议:如果业务对价格敏感、又需要中文语料与安全合规,GLM 5.3 Flash 是当前成本最优的选择之一;如果追求极致吞吐与多语言通用性,DeepSeek-V4-Pro 加上 DeepSeek Harness 在 OpenRouter 侧的生态成熟度更高。两条路线都说明同一件事:开源模型的边际成本已经低到闭源难以用"性能溢价"来覆盖,闭源阵营能守的只剩分发渠道与生态锁定。对开发者而言,现在正是把一部分工作负载迁移到开源模型、建立"双供应商"弹性的窗口期。

二、生态关系图谱

技术路线的竞争最终会落成一张生态关系网。本周这张网的关键节点可以梳理成三类依赖关系,对选型者来说,看清"谁依赖谁"比看清"谁更强"更值钱。

算力与芯片的绑定:OpenAI 与博通合作自研 Jalapeño 推理芯片[②],这是头部模型厂第一次把"自研推理芯片"推到台面级——它打破了"模型厂必须依赖英伟达"的单向依赖,改成双向博弈,也让"换供应商"从理论变成可执行选项。这条边一旦坐实,模型厂与芯片厂的力量对比将发生结构性改变。

模型厂之间的并购整合:英伟达拟以约130亿美元收购 Hugging Face[⑤],同时以60亿美元授权 Poolside 的模型开发技术、并把后者100多名工程师引入 Nemotron 团队[②]。这两步分别对应"补社区分发渠道"与"补企业级代码模型"两块短板,英伟达在试图把"软硬件加模型加社区"拼成一个闭环。对依赖 Hugging Face 生态的开发者而言,这桩收购落定后,社区的中立性是值得持续观察的变量。

智能体与算力外包:Anthropic 与 Nscale 签下450亿美元云服务协议,为 Claude 系列锁定训练和推理算力[⑥];软银以约60亿美元收购人形机器人公司 1X Technologies 多数股权[⑦]。前者是"模型厂向上游锁算力",后者是"资本向下游锁硬件载体",两条边共同指向同一个方向:智能体落地正在成为资本与算力的下一处战场。

资本循环的隐忧:本周另一条容易被忽略的边,是英伟达的资本循环。它明年约1/4业务来自其自身资助的 AI 实验室,已向购买其芯片的实验室投入近500亿美元、承诺投入超5000亿美元,并与 Apollo、BlackRock 等六家投资公司设立融资平台[⑥]。与此同时,为英伟达债务违约提供保障的 CDS 价格在过去两个月翻倍[⑦]。这条边说明,算力已经深度金融化,生态关系的稳定性与资本杠杆的稳健度绑定在了一起。

选型启示:对开发者而言,这张图谱的核心含义是——英伟达在"软件、硬件、社区、模型"四个环节同时布防,短期内它仍是事实标准;但 OpenAI 自研芯片、国产开源 MoE 的崛起,正在给"换供应商"这个选项注入真实可行性。选型时应把"生态锁定成本"作为隐性成本单独列一项,而不是只看单点的性能与价格。

三、因果链路追踪

本周的新闻可以串成一条清晰的因果链,帮助理解"为什么这些事会同时发生"。

事件一通向事件二:智能体推理需求暴增通向硬件涨价。智能体把推理从单轮交互扩展为多步工作流,平均每请求提示词 token 增长约4倍,让"低延迟高吞吐"成为决定智能体可用性的关键约束[④]。英伟达数据中心季度营收随即冲到612亿美元、同比增长44%,全年指引上调到1070亿美元[④];随后英伟达告知部分大客户,AI 服务器将因内存芯片成本飙升而涨价超15%、明年初生效[⑥]。需求端与供应端的挤压同时出现,价格信号开始向下游传导。

事件二通向事件三:硬件变贵通向开源模型加速渗透。涨价让"闭源付费 API"的性价比进一步承压,于是 DeepSeek-V4-Pro、GLM 5.3 Flash 这类低价开源模型在 OpenRouter 上抢走43%的流量[③],OpenRouter 平台整体也拿到约30%的小模型流量份额[③]。这不是巧合,而是价格信号驱动的迁移,迁移速度之快超出许多人的预期。

事件三通向事件四:低成本推理通向智能体落地物理世界。当每百万 token 成本降到0.045美元量级[②],高频次的智能体调用变得经济可行,于是小鹏的 IRON 机器人进入产线实训、软银押注 1X/NEO 人形机器人、Anthropic 推出给智能体打分的 Model Hardware Standard[⑧][⑦][②]。廉价推理是物理智能体商业化最关键的一块拼图。

这条链的终点指向一个判断:今年的竞争焦点,正从"模型能力"转向"把模型装进成本可接受的硬件和场景里"。技术演进的风险点也随之而来——如果推理硬件持续涨价,链式反应可能在"中小开发者入场"这一环被阶段性压慢。

四、四维全景研判

技术维度:推理加速进入"架构分叉期"——SRAM、自研芯片、NVLink Fusion、本地化推理四条路线并跑,尚无赢家,但"每瓦性能"已成为统一评价标尺[②][④]。具体到产品,Groq 3 LPX 已量产、Nemotron 3.5 Lightning 给出4倍输出速度[⑥][④],自研芯片与开源推理框架在中段市场形成围攻之势。开源 MoE 则用稀疏激活把成本曲线整体下移,两条技术主线并行推进。

产业维度:模型层寡头化与开源化并行,头部厂用并购(英伟达收购 Hugging Face、授权 Poolside)补生态短板[⑤][②],开源阵营用 MoE 性价比反攻,双方围绕"定价权"展开拉锯,格局处于重新洗牌的中段;另一侧,Anthropic 已开启 IPO 进程,闭源厂商试图用分发合作与资本化对冲开源冲击[⑥]。

资本维度:Anthropic 与 Nscale 的450亿美元云协议、软银60亿美元收购 1X,显示资本正从"投模型"转向"投算力与硬件载体"[⑥][⑦]。算力从采购品升级为战略资产,金融化程度加深,同时杠杆风险也在累积——为英伟达债务违约提供保障的 CDS 价格过去两个月翻倍,正是市场对这一杠杆结构的重新定价[⑦]。

政策维度:全球算力主权竞争加剧,推理芯片自研与国产开源模型的政策权重同步上升,直接影响企业选型的长期风险偏好,也让"供应链本地化"成为采购决策里权重越来越高的变量,采购团队需要把政策风险显式纳入供应商准入清单。

五、未来情景推演

强信号:推理吞吐月环比仍在翻倍级增长;OpenRouter 开源流量占比持续走高,说明开发者用脚投票的方向已经明确。这两条都指向"推理成本继续下移"的确定性趋势,是短期最该押注的方向。 明确的时间表也在快速排满:特斯拉 Cybercab 定于9月3日在奥斯汀发布、Salesforce 的 Claudeforce 9月展开公开测试、NVIDIA 收购 Hugging Face 四季度推进、英伟达 AI 服务器涨价明年初生效[⑥]。这些确定了日期的节点,是短期里最值得提前布局的观察窗口。

弱信号:小鹏 IRON 进厂实训、1X NEO 计划500到2000台量产,物理智能体正在从演示走向小规模产线验证[⑧][⑦]。这代表具身智能从"讲概念"进入"跑良率"的早期阶段,值得跟踪但不宜重仓。配套的信号还有设备控制标准化的推进——Anthropic 的 Model Hardware Standard 正在把实验室设备接入变成标准化接口,若开源版本落地,将打开智能体加物理设备的更大市场[②]。

预警项:AI 服务器涨价超15%若传导到算力租赁价,可能阶段性压慢中小开发者入场节奏[⑥];英伟达循环融资的杠杆若在下行周期瓦解,可能引发连锁损失;开源模型的稀疏激活若负载均衡失控,性价比优势也会被磨损。这三条都需要持续盯防。其中资本杠杆风险最值得警惕,因为它一旦爆发,会同时传导到算力供给与开源生态两个方向,产生连锁反应。

跟踪指标:建议每周盯三个数——一是 OpenRouter 的开源与闭源流量占比,二是各旗舰推理芯片的"每瓦 token 数",三是每百万 token 推理均价。这三个数分别映射"开发者偏好、硬件效率、成本曲线",是判断下一阶段走向的最高频信号。

结尾

本周最值得带走的一句话:推理正在变成一项"每瓦性能加每百万 token 成本"双指标驱动的商品,而开源 MoE 是这场商品化里最锋利的变量。

如果你要跟进,建议的顺序是:先把 DeepSeek Harness 或 Dynamo 跑通一个最小推理任务,感受一下成本曲线的真实斜率;再跟踪 OpenRouter 的流量迁移数据,验证"开源替代闭源"的方向;最后把目光放到机器人实训这类物理场景,那里藏着下一波确定性红利。

推荐三个可上手的开源工具:DeepSeek Harness(github.com/deepseek-ai/harness,MIT 许可,模型注册表一键复用)、NVIDIA Dynamo(github.com/ai-dynamo/dynamo,开源推理框架)、NVIDIA CUDA Python(github.com/NVIDIA/cuda-python,面向 Python 开发者的 CUDA 支持)。

一个开放性问题留给你:当"每瓦 token 数"成为主要竞争维度,你当前技术栈里最大的推理成本项,是功耗、带宽还是参数搬运?欢迎对照本周的数据,在评论区自己算一笔账。

展望下一阶段,当推理成本继续下探、当智能体的手脚终于伸进物理世界,开发者真正要准备的,可能不是学一个新框架,而是学会在算力、模型、设备三个变量之间动态配置资源。硬件自研、开源权重与设备标准三条脉络,正在把过去只属于实验室的能力,一点点交到普通工程团队手中。 如果你想把本周的观察转化为行动,这里有一份可执行的最小清单:第一步,用 DeepSeek Harness 或 Dynamo 在周末跑通一个推理任务,记录实际的首 token 延迟与每百万 token 成本;第二步,在 OpenRouter 上开一个账号,盯着开源与闭源的流量占比数据;第三步,把采购清单里的峰值算力改成每瓦 token 数,重新评估你正在对比的几款推理硬件。三步走完,你对本周这条技术主线的理解,就不再是新闻,而是可以复用的选型判断。


【资讯来源】本文综合整理自 The Batch @ DeepLearning.AI、The Rundown AI、AGI Weekly @ VentureBeat、NVIDIA Blog、Ars Technica、TLDR AI、The Rundown Robotics、AI News 等公开信息源。 ① The Batch @ DeepLearning.AI, 2026年08月28日 12:01 北京时间 / 08月27日 21:01 美西时间 ,② The Rundown AI, 2026年08月28日 18:09 北京时间 / 08月28日 03:09 美西时间 ,③ AGI Weekly @ VentureBeat, 2026年08月29日 03:57 北京时间 / 08月28日 12:57 美西时间 ,④ NVIDIA Blog, 2026年08月26日 14:06 北京时间 / 08月25日 23:06 美西时间 ,⑤ Ars Technica, 2026年08月25日 00:41 北京时间 / 08月24日 09:41 美西时间 ,⑥ TLDR AI, 2026年08月25日 21:26 北京时间 / 06:26 美西时间 ,⑦ The Rundown Robotics, 2026年08月27日 22:30 北京时间 / 08月27日 07:30 美西时间 ,⑧ AI News, 2026年08月27日 03:00 北京时间 / 08月26日 12:00 美西时间。

【免责声明】本内容为独立研究成果,仅供交流参考,不构成任何投资建议,市场有风险,投资需谨慎。信息来源于公开渠道,所有分析与推断均基于公开信息,本账号不对其准确性、完整性负责。AI行业技术与政策变化快,据此决策风险自担。

© 2026 林伽一 · AI科技研报

#人工智能 #大模型 #推理优化 #MoE #NVIDIA

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐