🤖 AI 大模型日报 2026年8月21日(星期五)**

本日报汇总了 2026 年 8 月中下旬全球 AI 大模型领域的最新动态,涵盖 OpenAI、Anthropic、Google、Meta、xAI、DeepSeek、阿里 Qwen、智谱 GLM、月之暗面 Kimi 等主流厂商。


📌 今日热门话题摘要

  1. 阿里巴巴发布 2027 财年 Q1 财报:阿里云外部商业化收入同比增长 45%,创 22 个季度新高;AI 相关产品收入连续 12 个季度三位数增长;Q2 资本开支达 676.78 亿元(同比 +75%),3800 亿元三年投资计划已累计投入 1900 亿元。CEO 吴泳铭表示"算力资本开支的投资回报确定性非常高"。
  2. 2026 世界机器人大会(WRC 2026)在京开幕(8月19-21日):300 多家企业、2000 多件展品,主题"人机共生·产需共融"。宇树科技王兴兴展示机器人"收拾会议室"场景,行业焦点从"表演"转向"真机实干",具身智能成为竞争主赛道。
  3. DeepSeek 启动峰谷定价(8月17日生效):闲时价格仅为高峰时段一半,鼓励错峰调用。
  4. 世界银行发布《2026年世界发展报告:人工智能:发展新机遇》:指出 AI 可帮助发展中经济体在十年内取得原本需上百年才能实现的进步,同时带来新的风险。
  5. 科大讯飞披露半年报:上半年营收 116.23 亿元(同比 +6.52%),归母净利润同比增长 14.68%;星火智能批阅机签约销售同比增长 14 倍。
  6. 前沿模型混战持续:8 月上半月 Gemini 3.7 Flash、DeepSeek-V4-Pro-0813、Grok 4.6、Qwen3.8-Max 开放权重密集发布,中国四家实验室(阿里、智谱、月之暗面、DeepSeek)六周内相继发布前沿级模型,创历史首次。

🏢 各重要模型动态

OpenAI — GPT 系列

项目 详情
GPT-5.6 家族 7月9日正式 GA,包含旗舰 Sol、平衡型 Terra、经济型 Luna 三个能力档位(独立版本演进);上下文窗口 1.05M token,最大输出 128K token
性能亮点 Sol 在 Agents’ Last Exam(55 个专业领域的长期工作流评测)拿下 53.6 分,超 Claude Fable 5 达 13.1 分;在 Artificial Analysis Coding Agent Index 上以 80 分创 SOTA,比 Fable 5 高 2.8 分,且输出 token 不到一半、耗时不到一半、成本约三分之一
ultra 模式 最高能力档位,默认协调 4 个并行 agent 协同工作,以更高 token 消耗换取更强结果与更快完成;API 提供 multi-agent beta
新增能力 Programmatic Tool Calling(程序化工具调用),可过滤大量中间数据、减少模型往返;计算机使用与设计判断能力显著增强
8月6日 Sol 在 ChatGPT 中推出聊天向重调优版本,内部评测事实错误减少 68%,新增 effort 滑块;Luna 成为免费层默认模型
7月30日 Luna 降价 80%(降至 $0.20/M 输入 token),Terra 降价 20%,新增 Sol Fast 模式(2.5 倍速)
8月13日 预览 Ultrafast 模式:GPT-5.6 Sol 最高可达 14 倍速
8月18日 ChatGPT Ads 扩展至欧洲;发布 ChatGPT for Teens
安全 迄今最 robust 的分层防护体系:模型级拒绝训练、实时生成监控与暂停审查、账户级行为分析、差异化访问控制

Anthropic — Claude 系列

项目 详情
Claude Fable 5 / Mythos 5 6月9日 API GA;在软件工程、知识工作、多模态视觉、科学研究等绝大多数测试达 SOTA;1M 上下文;价格 $14/$71 每百万 token(约为 GPT-5.6 Sol 的 2 倍);Fable 5 曾于 6月12-30日因安全问题暂停部署,7月1日全球重新上线
Claude Opus 5 7月24日发布;定价 $7/$36,约为 Fable 5 的一半,与 Opus 4.8 持平;Agentic 搜索、计算机使用、多学科推理全面领先;可调 effort 机制;现为 Claude Max 默认模型、Claude Pro 最强模型
Claude Sonnet 5 6月发布;1M 上下文,最大输出从 64K 提升至 128K;持久化记忆、自主规划与工具调用能力跨越式提升,性能接近 Opus 4.8;幻觉率、谄媚行为降低,抗提示注入增强
独立评测 Artificial Analysis Intelligence Index v4.1.1(8月10日读数):Opus 5 = 63,Fable 5 = 62,GPT-5.6 Sol = 61,Anthropic 占据前二
编码对决 独立评测显示:Sol 主导终端 agent 任务,Fable 5 在真实代码库场景仍占优

Google — Gemini 系列

项目 详情
Gemini 3.7 Flash 8月13日发布(距 3.6 Flash 仅三周),定位"最智能的工作马模型";1M 输入 / 64K 输出上下文,原生多模态(文本、图像、视频、音频、PDF)
性能提升(vs 3.6 Flash,厂商自报) DeepSWE v1.1 65.3%(+16.3)、FrontierCode 1.1 Main 43.6%(+9.2)、AutomationBench 30.4%(+13.4)、GDP.pdf 34.0%(+12.0)、WebDev Arena Elo 1588(+50)
价格策略 介绍价 $0.75 / $3.75 每百万 token 至 2026年12月31日;2027年1月1日起恢复牌价 $1.50 / $7.50(翻倍)
生态落地 Spark(Google AI Pro/Ultra 的 24/7 个人代理,覆盖 160+ 国家)即日起运行于 3.7 Flash;同步上线 Antigravity、Gemini Enterprise Agent Platform
其他更新 Gemini Omni Flash(7月,高性价比视频生成,支持对话式编辑);Nano Banana 2 / 2 Lite 图像模型(7月);Gemini 3.1 Pro(2月,推理模型)

Meta — Llama / Muse Spark

项目 详情
Muse Spark 1.1 7月发布的多模态 Agent 模型;1M 上下文;支持文本/图像/视频/文档输入;主动上下文压缩;原生结构化工具调用、并行工具执行、MCP 兼容、多智能体编排;幻觉率更低、抗越狱更强
开源策略转向 4月8日发布的 Muse Spark 1.0(Alexandr Wang 领导下首个模型)为闭源,引发"失去开源身份"的争议;Axios 披露 Meta 将转向混合策略——大模型部分保留闭源,后续以开源许可发布部分版本
下一代模型 NYT 报道 Meta 内部研发代号 “Watermelon” 的模型,将比 Muse Spark 更强大,计划未来数月内发布开源版本
Llama 生态 截至 2026 年初 Llama 模型累计下载达 12 亿次(日均约 100 万)

DeepSeek — V4 系列

项目 详情
DeepSeek-V4-Pro-0813 8月12日通过定价表版本钉选正式 GA(API ID 仍为 deepseek-v4-pro);1M 上下文 / 384K 最大输出;思考模式默认开启(effort=high,medium/xhigh 均映射到 high)
价格 $0.435(缓存未命中)/ $0.003625(缓存命中,约便宜 120 倍)/ $0.87(输出)每百万 token;并发 500
架构(预览期公开规格) 1.6T 总参数 / 49B 激活参数的 MoE,混合长上下文注意力
⚠️ 官方警告 官方明确表示即将实施重大 API 涨价,日期与新价格待公布
峰谷定价 8月17日 0 时生效:高峰时段(北京时间 9:00-12:00、14:00-18:00)之外,闲时价格为高峰的一半
Flash-0731 7月31日毕业的轻量档:$0.14 / $0.0028 / $0.28,并发 2500,同 1M/384K 窗口
生态事件 DeepSeek 600 万奖池大赛落幕,网页版用户夺得冠军

xAI — Grok 系列

项目 详情
Grok 4.6 8月12日发布,4.5 的直接升级;500K 上下文;文本+图像输入;reasoning_effort 支持 low/medium/high/xhigh
性能提升(vs 4.5 High,厂商自报) DeepSWE v1.1 65.9%(+11.9)、APEX-Agents 57.5%(+10.4)、Terminal-Bench v3.0 26.0%(+10.3);知识工作 Elo:GDPVal-AA v2 1753(+227)、AA-Briefcase 1577(+264)
价格 标准(<200K prompt):$2 / $0.50 缓存 / $6;≥200K 全请求按 $4 / $1 / $12 计费(“200K 悬崖”);Priority Processing 为 2 倍速通道
Agent 循环优化 prompt_cache_key / x-grok-conv-id 粘性缓存键、上下文压缩;定位"长时间少干预"的 agent 工作
背景 由 Cursor 团队主导训练(基于 Composer 2.5 升级),约 1.5T MoE 参数;AA-Briefcase 达 Fable 5 同级,token 消耗仅约 Opus 5 的四分之一

阿里巴巴 — Qwen 系列

项目 详情
Qwen3.8-Max 开放权重 8月12日发布:2.4T 总参数 / ~95B 激活(512 experts,10 路由 + 1 共享),Qwen 家族首个突破万亿参数的模型,也是 Max 级别首次开放权重;混合架构(Gated DeltaNet + MoE + Gated Attention)
开源版规格 纯文本、强制思考模式、原生上下文 262,144(可扩展至 ~1.01M);自定义 Qwen3.8-Max License(非 Apache/MIT):>100M MAU 或 >$20M 月收入需展示模型名;MaaS 业务 TTM 收入超 $50M 需另行授权
API 版 qwen3.8-max $2 / $6 每百万 token;1M 上下文默认;支持文本+图像+视频;内建工具
性能(厂商自报 vs Qwen3.7-Max) Terminal Bench 2.1 86.6(vs 74.5)、SWE-bench Pro 67.7(vs 60.6)、PaperBench 93.0(vs 64.8)、GPQA Diamond 92.6
Qwen 3.8-27B 8月发布并开源的稠密多模态 Agent 模型(27B),阿里云已上架
财报信号 8月20日阿里财报显示 AI 已成为云增长的确定性引擎,连续发布前沿语言、编程、视频、语音、图像、音乐模型及"千问办公"AI 生产力平台

智谱 — GLM 系列

项目 详情
GLM-5.3 8月发布并开源,智谱迄今能力最强的开源 Agent 模型;参数量 754B(A40B),上下文窗口 1M,最大输出 128K;支持真正可用的超长上下文,长程任务(Long Horizon Task)保持领先;8月18日上架阿里云百炼
商业化调整 8月初国内版 Coding Plan 新套餐上线,价格较此前档位翻倍级上涨,购买方式从抢购转为开放

月之暗面 — Kimi 系列

项目 详情
Kimi K3 7月17日发布,2.8T 参数,号称全球最大规模开源模型;原生视觉能力,1M 上下文窗口,面向长程 agent 工作流;厂商引用测试显示其在编程任务和复杂应用上优于 Claude Opus 4.8 与 GPT-5.5;已在 Moonshot、Together、Fireworks、Baseten、Modal 等多家平台上线

其他值得关注

  • MiniMax:8月开源音乐模型 Music 3.0(本周更新)
  • 微软:MAI-Code-1.1-Flash 视觉编码模型(更便宜档位)
  • Liquid AI:LFM2.5-VL-3B 边缘视觉语言模型
  • 字节跳动:Seed 系列持续推进(豆包 Doubao-Seed-1.6 系列)
  • 阶跃星辰 / 可灵 / 通义:均有模型更新,视频、图像、音乐生成赛道竞争白热化

📈 行业趋势分析

1. Agent 化成为绝对主线

  • Agent 模型已占据主流模型的大半壁江山,"推理模型"作为独立类别已无存在必要,行业预计 2027 年将删除该分类。
  • 各家旗舰(GPT-5.6 Sol、Fable 5、Gemini 3.7 Flash、Grok 4.6、Qwen3.8-Max)均以长程自主任务、工具调用、多步规划为核心卖点;多智能体协作(OpenAI ultra 模式 4 agent 并行、MCP 兼容编排)成为新前沿。

2. 价格战与"效率优先"时代

  • 竞争焦点从"谁更强"转向"每美元/每 token 的智能密度":GPT-5.6 Luna 降价 80%、Gemini 3.7 Flash 半价促销至年底、DeepSeek 峰谷定价、Grok 缓存键优化——定价策略日益精细化。
  • OpenAI 明确以"约四分之一成本击败 Fable 5"作为营销叙事;Grok 4.6 强调"AA-Briefcase 达 Fable 5 同级但 token 消耗仅四分之一"。
  • DeepSeek 官方预告重大涨价,低价红利期可能进入尾声,市场需提前做好成本预案。

3. 国产大模型军团式崛起

  • 阿里(Qwen3.8-Max 万亿级开源)、智谱(GLM-5.3)、月之暗面(Kimi K3 全球最大开源)、DeepSeek(V4-Pro GA)六周内相继发布前沿级模型,历史首次。
  • LMSYS Arena Agent 榜上 DeepSeek V4 Pro 携 Qwen 3.8 Max 入场,“杭州与北京的差距缩小”。
  • 阿里云 AI 收入三位数增长 + 3800 亿算力资本开支,显示中国厂商正以"模型+云+算力"全栈模式参与全球竞争。

4. 开源与闭源策略分化加剧

  • Meta 从"全开源"转向混合策略(Muse Spark 闭源、Watermelon 计划部分开源),引发开源社区争议。
  • 阿里 Qwen 坚持开源但采用自定义许可证(MAU/收入门槛条款),"开放权重"与"自由开源"的边界被重新定义。
  • OpenAI 的 gpt-oss 与 DeepSeek、GLM 的开源路线形成多极格局;企业选型需仔细评估许可证合规风险。

5. 安全与监管成为发布节奏的变量

  • Claude Fable 5 曾因安全评估暂停部署三周后重新上线;GPT-5.6 经历政府审查期后分阶段解禁;Anthropic Mythos 5 仅对特定用户开放。
  • 模型安全策略(拒绝训练、实时监控、差异化访问控制)已成为旗舰发布的标配内容。

6. 长上下文与多模态成为默认配置

  • 1M token 上下文已从旗舰专属下放至 Flash/Sonnet 等"工作马"档位;图像/视频/音频多模态输入成为普遍能力。
  • 行业同时开始正视长上下文幻觉问题(如 LongNovel 等新基准的发布)。

7. AI 基础设施投资回报显性化

  • 阿里云外部收入 +45% 创 22 个季度新高,AI 收入连续 12 个季度三位数增长,"三年回本"的算力投资逻辑得到财报验证。
  • 全球 AI 云格局加速重构,算力资本开支从"军备竞赛"转向"回报周期明确化"。

📚 参考来源

  • OpenAI 官方博客:GPT-5.6 发布、Ultrafast 预览、价格调整公告
  • Anthropic 官方新闻:Claude Opus 5 / Fable 5 / Sonnet 5
  • Google 官方博客:Introducing Gemini 3.7 Flash(8月13日)
  • LLM Stats / llm-stats.com:Gemini 3.7 Flash、DeepSeek-V4-Pro-0813、Grok 4.6、Qwen3.8-Max 深度评测
  • DeepSeek API 官方文档:更新日志与定价表
  • 知乎专栏《国内外知名大模型及应用》(2026/08/20 更新)
  • 新浪 AI 热点小时报(2026年8月21日)
  • 阿里财报电话会报道(新浪财经、网易科技)
  • 世界银行《2026年世界发展报告》
  • Axios、NYT、CNBC、Engadget 等外媒报道

本报告由 Hermes Agent 自动收集整理,数据截至 2026年8月21日。厂商自报基准分数未经独立验证,仅供参考。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐