半价逼近旗舰、开源追平闭源:当模型能力走向"够用",AI竞争的下一道墙在哪里?

引言:45天,旗舰能力就被下放了一半价格

2026年7月25日,Anthropic正式上线Claude Opus 5。这个时间点距离其旗舰模型Fable 5发布(6月9日),仅仅过去了45天。Opus 5的定价是每百万Token输入5美元、输出25美元——与上一代Opus 4.8完全持平,却只有Fable 5(10美元/50美元)的一半。而在CursorBench 3.2基准测试上,Opus 5最高档位距离Fable 5的峰值仅差0.5%;在Frontier-Bench软件工程评测中,它甚至反超了包括Fable 5在内的所有受测模型。

用一个比喻来说:你花半价买了一张机票,座位只差半排的距离,但目的地一模一样。

这并非孤立事件。就在Opus 5上线前一周,月之暗面发布了Kimi K3——2.8万亿参数、100万Token上下文、全球最大的开源MoE模型,在Arena AI前端编程榜单上以1679分登顶,超越GPT-5.6 Sol的1618分。K3的输出Token定价仅为每百万15美元,比Opus 5还低40%。K3的完整权重计划于7月27日前公开发布。与此同时,Meta也在7月26日向消费者开放了Muse Spark 1.1,支持100万Token上下文与多智能体协同,定价仅为每百万Token输入1.25美元、输出4.25美元——约为OpenAI和Anthropic旗舰模型的四分之一。

三周之内,三家头部公司分别从"半价逼近旗舰""开源追平闭源""四分之一价格切入市场"三个方向,向同一个信号开火:模型能力正在快速收敛,而价格正在崩塌。

一、能力收敛:从"代际差距"到"0.5%的缝隙"

回顾2026年上半年的模型发布节奏,速度本身就是一个故事。OpenAI从GPT-5到GPT-5.6,336天内完成6次编号更新,平均每56天一次。Anthropic从Opus 4.6到Opus 5,170天内发布了6个重要型号,最近几次间隔分别是70天、42天、12天、21天、24天。月之暗面从K2开始基本进入一个季度一次主版本的节奏,每次更新都不止是跑分提升,而是能力维度的扩展——从工具调用到视觉理解,从子智能体集群到长时间自主执行。

当发布间隔从"年"压缩到"月",一个必然的后果是:代际差距正在消失。 Fable 5在6月还是最高档模型,7月就有了能力接近、价格减半的Opus 5。Kimi K3承认综合能力仍落后于Fable 5和GPT-5.6 Sol,但在部分编码、智能体和GPU内核优化任务上已经能正面交手。Meta的Muse Spark 1.1在内部编码评测上与领先替代方案"具有竞争力"。

更值得注意的趋势是"模型路由器"的兴起。Cursor在7月22日推出了Cursor Router,根据提示词的任务类型和复杂度自动分类,将简单任务路由给更便宜的Grok 4.5,复杂任务才调用前沿模型。Runway几乎同时发布了Media Router,针对每个请求自动选择最佳的视频、图像或音频模型。这类中间层的出现,本质上是在告诉市场:模型之间的差异已经小到可以用一个路由器来抹平。 当用户不再关心底层调用了哪个模型,模型本身就从"产品"变成了"基础设施"。

二、价格崩塌:当Token比电费还便宜

如果把模型定价画成一条曲线,2026年的下降斜率令人咋舌。2025年底,旗舰模型的输出Token价格还在每百万50美元的水平。到了2026年7月,Kimi K3把这个数字压到了15美元,Meta Muse Spark 1.1压到了4.25美元。半年时间,价格下降了近一个数量级。

这背后是多重因素的叠加。首先是MoE(混合专家)架构的成熟——Kimi K3虽然总参数2.8万亿,但单次推理仅激活896个专家中的16个,大幅降低了计算成本。其次是推理基础设施的优化——Anthropic自研芯片从规划走向量产,向SK海力士提出半导体供应需求,配合500亿美元数据中心投资;纯C推理引擎colibri让消费级机器仅用约25GB内存就能跑起744亿参数的GLM-5.2 MoE模型。第三是模型参与改进模型的闭环——Kimi K3的早期版本承担了团队大部分GPU内核优化工作,OpenAI的Codex和GPT-5.5也参与改进了服务自身的基础设施。模型成了自己下一代的程序员和测试员,研发效率被拉到了一个新基线。

但价格崩塌带来的一个深层问题是:当模型能力"够用"且价格低廉,靠卖Token的商业模式还能撑多久? Anthropic把Opus 5放在"企业日常主力模型"的位置,Fable 5留给长周期智能体和复杂推理——这本质上是在承认,大部分企业工作负载不需要旗舰,"接近旗舰"就足够了。Cursor Router的逻辑也一样:大部分编码任务Grok 4.5就能搞定,不需要每次都调最贵的模型。

当"够用"成为新常态,竞争的焦点必然发生转移。

三、能力层之后,表现层正在成为新瓶颈

一个值得注意的细节是:Anthropic在训练Opus 5时,特意回避了网络安全领域的前沿训练。这意味着Opus 5在发现漏洞方面表现尚可,但在漏洞利用能力上与Mythos 5存在明显差距。Anthropic称其为"最对齐的Opus模型",最不易被诱导滥用。这是一个明确的信号:能力不再只追求"更强",而是开始追求"更可控"和"更安全"。

同样,Meta在发布Muse Spark 1.1时强调其在化学生物、网络安全和失控风险等前沿领域均"维持在安全范围内",并提升了对提示词注入和越狱攻击的抵抗力。Kimi K3在连续48小时的自主Agent运行中独立完成了芯片构建、优化与验证——这种长时间自主性本身就是对可控性的极高要求。

当文本理解、代码生成、工具调用这些"认知层"能力逐渐拉平,一个此前被掩盖的瓶颈开始浮出水面:表现层。 也就是说,AI能"想到"和"做到"的差距在缩小,但它能"表达"出来的——声音的质感、表情的细微变化、情绪的层次过渡——依然粗糙。

这在数字人领域尤为明显。当前的数字人产品大多采用级联式架构:先由语言模型生成文本,再由TTS模型合成语音,最后由面部动画模型驱动嘴型和表情。三个环节各自独立优化,串联起来却会产生"累积误差"——声音对了但嘴型差了半帧,表情对了但情绪跟不上语调。用户感知到的不是某个环节的失误,而是一种整体的"不协调感"。就像看一部配音电影,哪怕每个字都对上了,你依然能感觉到"不对劲"。

行业内已经有少数团队开始沿着联合生成的方向进行探索——不是先做视频再配音,而是让声音、口型、表情在同一套模型中同步生成,从根源上消除级联误差。某些国产数字人表演工具已经在这个方向上取得了阶段性进展,能够实现声、形、戏三者的同步输出。但这仍是一个处于早期的赛道,技术成熟度和生态丰富度都远不及文本和编码领域。

四、从"谁更聪明"到"谁更像人"

如果把2026年7月的这波模型发布放在更大的时间尺度上看,一个拐点正在显现。

2023年到2025年,AI行业的竞争核心是"谁更聪明"——参数更大、上下文更长、跑分更高。GPT-4到GPT-5的跃迁,Claude 3到Claude 4的飞跃,每一次发布都伴随着能力边界的明显外推。但到了2026年下半年,这个逻辑正在触顶。Opus 5和Fable 5在编程任务上"旗鼓相当,甚至略有超越"——这意味着下一代旗舰与当前旗舰的差距已经从"代际"缩小到了"百分比小数点后一位"。Kimi K3作为开源模型登顶Arena AI编程榜,说明闭源与开源的能力鸿沟也在快速收窄。

当"聪明"不再稀缺,"像人"就成了新的稀缺品。

这里的"像人"不是指图灵测试意义上的对话能力——当前的模型早已过关。它指的是一种更深层的"在场感":当AI对你说一句话时,它的声音是否带有与你语境匹配的情绪起伏?它的面部表情是否能传递超越文字本身的微妙信息?它是否能在长时间交互中维持一致的人格质感,而不是每隔几轮就"穿帮"?

这些问题的技术答案,恰恰不在语言模型的能力曲线上,而在声音合成、面部动画、情感计算等多模态联合生成的交叉地带。Opus 5能写出最优雅的代码,Muse Spark 1.1能协调多个子智能体完成复杂项目,Kimi K3能独立运行48小时构建一颗芯片——但它们都不具备"用一个人的声音和表情把一段话有感染力地说出来"的能力。这不是它们的问题,而是整个行业分工结构留下的空白。

结语:下一道墙不在参数表上

7月27日,Kimi K3的完整权重将公开发布。届时,任何开发者都可以在本地跑起一个接近闭源旗舰能力的模型。这或许会再次引发关于"开源是否动摇商业模型价值"的讨论,但更值得思考的是:当模型能力本身不再是护城河,什么才是?

Anthropic用Opus 5的回答是"安全与对齐"。Meta用Muse Spark 1.1的回答是"多智能体协同与多模态感知"。Kimi K3的回答是"开源生态与长周期自主执行"。这些答案都指向同一个方向:能力层之上,还有一层"表现层"和"交互层"尚未被充分开发。

智能手机行业走过完全相同的路径。2015年前后,手机芯片的跑分竞赛触顶,消费者不再为"多10%的性能"买单,行业竞争转向屏幕素质、影像系统、触觉反馈、系统流畅度——那些你能"感受到"而非"测量到"的维度。AI行业正在抵达类似的拐点。当Token价格趋近于零、模型能力走向收敛,真正能区分产品体验的,将是那些让AI从"工具"变成"角色"的能力——声音的温度、表情的层次、情绪的同步。

这不是某一家公司能独立完成的工程,而是需要模型架构、训练范式、多模态对齐等多个维度的系统性突破。但方向已经清晰:下一道墙不在参数表上,而在人与AI之间那最后一寸"在场感"的缝隙里。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐