引言

“AI一天,人间一年。” ——启明创投主管合伙人周志峰常说的这句话,在2026年的大模型行业得到了最残酷的印证。

7月,短短几周之内,月之暗面发布2.8万亿参数的Kimi K3,阿里千言官宣2.4万亿参数的Qwen3.8上线预览版,DeepSeek V4正式版开始灰度推送——三款万亿参数大模型密集落地,将这场持续了三年多的参数竞赛推向了新的高潮。

但走进WAIC 2026的展馆,几乎听不到“我们的模型有多少参数”这种话了。取而代之的是可自主执行任务的AI智能体、在产线上拧螺丝的机械臂、贴着“已量产”标签的落地方案。行业已经给出了比参数更务实的信号。

本文将从模型竞赛、算力重构、端侧爆发、企业落地、开源冲击五个维度,复盘2026年上半场的大模型行业变局。

一、模型竞赛:从“千亿”到“万亿”,2万亿成为新门槛

1.1 三款万亿模型密集落地

7月17日,月之暗面发布Kimi K3——2.8万亿参数、100万Token上下文窗口,是全球参数最大的开源模型。发布不久后,马斯克在社交平台评论称“令人印象深刻(Impressive)”,并随即宣布xAI正在训练2万亿参数的新模型。

紧随其后,阿里千言官宣2.4万亿参数的Qwen3.8上线预览版;DeepSeek V4正式版开始灰度推送。短短时间,行业参数从千亿级别迈入2万亿级别

新智派新质生产力会客厅联合创始发起人袁帅评价:国产大模型“短短两年时间就将与国际顶尖水平的差距缩小到3个月以内,彻底打破了海外大模型在技术参数和性能上的长期垄断地位”。

1.2 参数竞赛没有终点

但参数数字本身不是终点。一位长期深耕AI行业的创业者指出,万亿参数模型“一方面说明中国大模型公司从技术上逐渐缩小与海外大模型公司的差距,2万亿参数甚至已经赶超了半年甚至更长时间的差距。但另一方面,也意味着在接下来的时间里,大模型公司将会集中赶超,会带来短期算力的短缺”。

水木资本董事长唐劲草判断,模型层大洗牌即将到来:“当前中国数十家大模型企业并存的格局不可持续。当模型能力趋于收敛、开源生态成熟、巨头免费策略持续,预计到2027年,能够独立存活且发展顺利的通用大模型企业将不超过10家。”

二、算力重构:从“训练为王”到“推理为王”

2.1 推理取代训练成为主战场

如果说前两年的关键词是“训练”,那么2026年的关键词无疑是 “推理” 。

蓝芯算力生态负责人许庆伟分析称,2026年国内算力市场正经历结构性重塑——推理算力已取代训练算力成为主流增量,有效算力利用率与算力性价比替代理论峰值算力,成为行业核心评价标准。

数据佐证了这一判断:阿里云在“2026年算力倍增计划”中,推理芯片的采购预算占AI总预算的60%;Meta预计将在2026年底建立60万张GPU等效算力的推理集群。

2.2 Kimi K3的“幸福的烦恼”

Kimi K3上线的第一天就遭遇了“幸福的烦恼”——用户请求量大幅超出预估,逼近现有集群承载极限。月之暗面不得不暂停C端新用户订阅,将已有算力全部投入服务已订阅用户。有接近人士表示:“(调用规模)涨得太猛,算力吃紧。”

这一事件折射出一个新的产业现实:算力已经不再只是后台资源,而开始直接影响产品销售、用户体验乃至商业化进程。华泰证券研报分析称,Kimi K3建议采用64张以上加速卡组成的超节点部署,表明高带宽互联、推理集群、上下文缓存及Agent基础软件的重要性进一步提升。

2.3 国产算力的利用率之战

更大的挑战在于“卡能不能稳定、高效地跑起来”。相关人士对记者表示,国产芯片品牌、架构和软件栈各不相同,模型部署往往需要重复完成编译、算子优化和推理适配,大量工程资源消耗在跨平台的迁移和维护上。

智谱在算力领域的布局提供了一个样本。目前智谱ARR(年度经常性收入)已增至10亿美元(API和Coding Plan收入,不含任何C端社交产品收入),较今年初增长约15倍。上半年,智谱完成了对AI Infra公司中科加禾的整合,进一步补齐编译器、运行时、推理引擎及异构算力软件底座能力。

三、端侧爆发:大模型正在“走出云端”

3.1 2026年是端侧AI规模化落地的元年

7月19日,北京智源人工智能研究院联合端侧智能北京市重点实验室发布的《端侧智能2026——规模化落地元年》报告指出:囿于成本、时延、隐私三大约束,大模型正经历第二次结构性跃迁——从以云端为唯一算力中枢的单点智能,走向端云分工、协同共生的分布式智能系统。

行业普遍将2026年定义为端侧AI元年,AI PC、智能服务机器人、边缘智能终端等产品加速落地商用场景。

3.2 “不可能三角”正在被打破

大模型走向端侧,面对的是一个“不可能三角”:功耗只有几瓦,成本卡在几十美金,客户却要求它们跑得动几十亿甚至上百亿参数的模型。

驱动这一转变的是三个现实问题:

  • 成本:Agent时代推理频次大幅上升,全走云端在成本上越来越荒谬。有深圳公司的端云混合平台数据显示,80%左右的任务可以在本地完成

  • 延迟:端侧推理毫秒级响应,云端推理则受制于网络环境。

  • 隐私:数据留在本地设备里,安全可控,离线可用。

3.3 面壁智能的端侧实践

面壁智能是率先布局端侧大模型的厂商之一。截至2026年6月30日,面壁MiniCPM开源模型系列累计下载量突破3800万次,覆盖文本、视觉、语音全模态。基于“密度定律”技术路线,MiniCPM已落地手机、汽车、具身智能、航天等多元终端,并已搭载于吉利银河M9、长安马自达EZ-60等车型的智能座舱。

面壁智能CEO李大海在WAIC期间表示:“大模型竞争已进入行业应用落地的下半场,‘行业深刻认知+端侧AI’才是真正的护城河。”

四、企业落地:从“能聊”到“能干”的艰难跨越

4.1 三层鸿沟

企业在引入AI技术时,往往面临“能干活但没法上岗”的困境。网易智企副总经理段毓铮在WAIC演讲中,将这一挑战归纳为 “三层鸿沟” :

  • 知识鸿沟:通用大模型虽具备泛化能力,但并不天然理解企业的产品体系、客户结构及行业术语。

  • 行动鸿沟:AI可以给出建议,但若无法与企业既有系统打通,便无法进入真实业务链路。

  • 组织鸿沟:员工个人的AI使用经验若仅停留在私人手中,无法转化为组织层面的可复用能力。

4.2 存量系统成为最大卡点

腾讯云副总裁吴运声提出,伴随Agent Loop能力升级,技术瓶颈已经转移——最大阻碍是智能体与企业老旧业务系统打通。大量业务流程、历史数据沉淀在缺乏API、MCP接口的遗留系统中,想要让智能体接入真实业务,必须完成接口改造。

市场持续争论智能体是否会侵蚀ERP、SaaS生存空间,但吴运声给出了明确判断:二者是共存关系,不存在替代逻辑。

4.3 商业化的真实案例

尽管挑战重重,真实的商业化案例正在涌现:

  • 首钢集团将大模型统一应用平台融入钢铁业务场景,热轧产线计划单审核时长由1小时缩短至秒级,安全隐患识别AI智能体将排查效率提升60%。

  • 宁波银行依托Agentar平台搭建“智能化决策流水线”,复杂问答准确率从68%上升到91%。

  • 能源公司林洋智维建设“电力交易流水线”,人力成本下降60%,分析与策略生成速度提升20倍以上。

  • 找钢网依托腾讯ADP搭建数字员工体系,交易员配备四块屏幕——两块由真人操作,两块交由AI数字员工并行处理报价、寻货、单据录入,人效提升十倍以上。

五、开源冲击:当开源追上闭源

5.1 市场份额的逆转

2026年,开源模型与闭源模型的力量对比发生了根本性逆转。OpenRouter数据显示,开源模型处理的Token占比从2026年1月的34%飙升至6月的65%,全球API调用月消耗量前五名已全部被开源模型包揽。

美国企业使用中国模型构建AI应用的比例从一年前的4.5%升至46%。中国日均消耗大模型Token两年半时间内增长了三千倍,达450万亿Token——人类历史上从未有任何一项技术以每年上千倍的速度成长。

5.2 硅谷的“内战”

中国开源模型的崛起,直接引发了硅谷的“内战”。当地时间7月24日,包括Meta、英伟达、微软在内的25家美国科技公司联名签署公开信,呼吁开放权重AI模型。英伟达CEO黄仁勋首次在社交平台X上发文称:“世界既需要最前沿的闭源模型,也需要最前沿的开源模型。”

而另一边,中国开源模型的崛起被以OpenAI和Anthropic为代表的闭源厂商视为巨大威胁。有报道称,OpenAI自家的大模型在测试中失控,自主突破安全沙箱,入侵了全球最大AI开源平台Hugging Face的服务器。

德媒的观察更为犀利:美国卡芯片,反而逼出了中国AI企业更富有创造力和效率

5.3 成本优势是真正的王牌

中国的模型定价并不是基于激进的价格补贴。中国模型厂在API业务上也能实现20%~40%的毛利,凸显了模型推理阶段背后成本结构的真实优势。

当一个来自中国的开源模型能以极低的成本完成同样的工作,“全球大模型产业的付费底座正在发生不可逆转的倾斜”。

写在最后

2026年过半,大模型行业正在经历一场深刻的洗牌。

参数不再是护城河——三款万亿参数模型密集发布后,WAIC展馆里几乎没有参数对比的展板。推理成为新战场——算力不再只是后台资源,而是直接影响商业化的前线。端侧成为新方向——大模型正在从云端走向手机、汽车、机器人。开源正在改写规则——全球API调用前五名已全部被开源模型包揽。

水木资本董事长唐劲草判断,AI产业已经进入 “从投模型转向投应用、从投概念转向投收入、从广撒网转向精准下注” 的新阶段。

牌桌正在收敛。谁留在桌上,谁将被淘汰——答案正在这个夏天加速推演

在这里,我给大家准备了AI大模型的资料,保证100%免费

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐