AI 大模型日报 — 2026年8月21日(星期五)
·
🤖 AI 大模型日报 2026年8月21日(星期五)**
本日报汇总了 2026 年 8 月中下旬全球 AI 大模型领域的最新动态,涵盖 OpenAI、Anthropic、Google、Meta、xAI、DeepSeek、阿里 Qwen、智谱 GLM、月之暗面 Kimi 等主流厂商。
📌 今日热门话题摘要
- 阿里巴巴发布 2027 财年 Q1 财报:阿里云外部商业化收入同比增长 45%,创 22 个季度新高;AI 相关产品收入连续 12 个季度三位数增长;Q2 资本开支达 676.78 亿元(同比 +75%),3800 亿元三年投资计划已累计投入 1900 亿元。CEO 吴泳铭表示"算力资本开支的投资回报确定性非常高"。
- 2026 世界机器人大会(WRC 2026)在京开幕(8月19-21日):300 多家企业、2000 多件展品,主题"人机共生·产需共融"。宇树科技王兴兴展示机器人"收拾会议室"场景,行业焦点从"表演"转向"真机实干",具身智能成为竞争主赛道。
- DeepSeek 启动峰谷定价(8月17日生效):闲时价格仅为高峰时段一半,鼓励错峰调用。
- 世界银行发布《2026年世界发展报告:人工智能:发展新机遇》:指出 AI 可帮助发展中经济体在十年内取得原本需上百年才能实现的进步,同时带来新的风险。
- 科大讯飞披露半年报:上半年营收 116.23 亿元(同比 +6.52%),归母净利润同比增长 14.68%;星火智能批阅机签约销售同比增长 14 倍。
- 前沿模型混战持续:8 月上半月 Gemini 3.7 Flash、DeepSeek-V4-Pro-0813、Grok 4.6、Qwen3.8-Max 开放权重密集发布,中国四家实验室(阿里、智谱、月之暗面、DeepSeek)六周内相继发布前沿级模型,创历史首次。
🏢 各重要模型动态
OpenAI — GPT 系列
| 项目 | 详情 |
|---|---|
| GPT-5.6 家族 | 7月9日正式 GA,包含旗舰 Sol、平衡型 Terra、经济型 Luna 三个能力档位(独立版本演进);上下文窗口 1.05M token,最大输出 128K token |
| 性能亮点 | Sol 在 Agents’ Last Exam(55 个专业领域的长期工作流评测)拿下 53.6 分,超 Claude Fable 5 达 13.1 分;在 Artificial Analysis Coding Agent Index 上以 80 分创 SOTA,比 Fable 5 高 2.8 分,且输出 token 不到一半、耗时不到一半、成本约三分之一 |
| ultra 模式 | 最高能力档位,默认协调 4 个并行 agent 协同工作,以更高 token 消耗换取更强结果与更快完成;API 提供 multi-agent beta |
| 新增能力 | Programmatic Tool Calling(程序化工具调用),可过滤大量中间数据、减少模型往返;计算机使用与设计判断能力显著增强 |
| 8月6日 | Sol 在 ChatGPT 中推出聊天向重调优版本,内部评测事实错误减少 68%,新增 effort 滑块;Luna 成为免费层默认模型 |
| 7月30日 | Luna 降价 80%(降至 $0.20/M 输入 token),Terra 降价 20%,新增 Sol Fast 模式(2.5 倍速) |
| 8月13日 | 预览 Ultrafast 模式:GPT-5.6 Sol 最高可达 14 倍速 |
| 8月18日 | ChatGPT Ads 扩展至欧洲;发布 ChatGPT for Teens |
| 安全 | 迄今最 robust 的分层防护体系:模型级拒绝训练、实时生成监控与暂停审查、账户级行为分析、差异化访问控制 |
Anthropic — Claude 系列
| 项目 | 详情 |
|---|---|
| Claude Fable 5 / Mythos 5 | 6月9日 API GA;在软件工程、知识工作、多模态视觉、科学研究等绝大多数测试达 SOTA;1M 上下文;价格 $14/$71 每百万 token(约为 GPT-5.6 Sol 的 2 倍);Fable 5 曾于 6月12-30日因安全问题暂停部署,7月1日全球重新上线 |
| Claude Opus 5 | 7月24日发布;定价 $7/$36,约为 Fable 5 的一半,与 Opus 4.8 持平;Agentic 搜索、计算机使用、多学科推理全面领先;可调 effort 机制;现为 Claude Max 默认模型、Claude Pro 最强模型 |
| Claude Sonnet 5 | 6月发布;1M 上下文,最大输出从 64K 提升至 128K;持久化记忆、自主规划与工具调用能力跨越式提升,性能接近 Opus 4.8;幻觉率、谄媚行为降低,抗提示注入增强 |
| 独立评测 | Artificial Analysis Intelligence Index v4.1.1(8月10日读数):Opus 5 = 63,Fable 5 = 62,GPT-5.6 Sol = 61,Anthropic 占据前二 |
| 编码对决 | 独立评测显示:Sol 主导终端 agent 任务,Fable 5 在真实代码库场景仍占优 |
Google — Gemini 系列
| 项目 | 详情 |
|---|---|
| Gemini 3.7 Flash | 8月13日发布(距 3.6 Flash 仅三周),定位"最智能的工作马模型";1M 输入 / 64K 输出上下文,原生多模态(文本、图像、视频、音频、PDF) |
| 性能提升(vs 3.6 Flash,厂商自报) | DeepSWE v1.1 65.3%(+16.3)、FrontierCode 1.1 Main 43.6%(+9.2)、AutomationBench 30.4%(+13.4)、GDP.pdf 34.0%(+12.0)、WebDev Arena Elo 1588(+50) |
| 价格策略 | 介绍价 $0.75 / $3.75 每百万 token 至 2026年12月31日;2027年1月1日起恢复牌价 $1.50 / $7.50(翻倍) |
| 生态落地 | Spark(Google AI Pro/Ultra 的 24/7 个人代理,覆盖 160+ 国家)即日起运行于 3.7 Flash;同步上线 Antigravity、Gemini Enterprise Agent Platform |
| 其他更新 | Gemini Omni Flash(7月,高性价比视频生成,支持对话式编辑);Nano Banana 2 / 2 Lite 图像模型(7月);Gemini 3.1 Pro(2月,推理模型) |
Meta — Llama / Muse Spark
| 项目 | 详情 |
|---|---|
| Muse Spark 1.1 | 7月发布的多模态 Agent 模型;1M 上下文;支持文本/图像/视频/文档输入;主动上下文压缩;原生结构化工具调用、并行工具执行、MCP 兼容、多智能体编排;幻觉率更低、抗越狱更强 |
| 开源策略转向 | 4月8日发布的 Muse Spark 1.0(Alexandr Wang 领导下首个模型)为闭源,引发"失去开源身份"的争议;Axios 披露 Meta 将转向混合策略——大模型部分保留闭源,后续以开源许可发布部分版本 |
| 下一代模型 | NYT 报道 Meta 内部研发代号 “Watermelon” 的模型,将比 Muse Spark 更强大,计划未来数月内发布开源版本 |
| Llama 生态 | 截至 2026 年初 Llama 模型累计下载达 12 亿次(日均约 100 万) |
DeepSeek — V4 系列
| 项目 | 详情 |
|---|---|
| DeepSeek-V4-Pro-0813 | 8月12日通过定价表版本钉选正式 GA(API ID 仍为 deepseek-v4-pro);1M 上下文 / 384K 最大输出;思考模式默认开启(effort=high,medium/xhigh 均映射到 high) |
| 价格 | $0.435(缓存未命中)/ $0.003625(缓存命中,约便宜 120 倍)/ $0.87(输出)每百万 token;并发 500 |
| 架构(预览期公开规格) | 1.6T 总参数 / 49B 激活参数的 MoE,混合长上下文注意力 |
| ⚠️ 官方警告 | 官方明确表示即将实施重大 API 涨价,日期与新价格待公布 |
| 峰谷定价 | 8月17日 0 时生效:高峰时段(北京时间 9:00-12:00、14:00-18:00)之外,闲时价格为高峰的一半 |
| Flash-0731 | 7月31日毕业的轻量档:$0.14 / $0.0028 / $0.28,并发 2500,同 1M/384K 窗口 |
| 生态事件 | DeepSeek 600 万奖池大赛落幕,网页版用户夺得冠军 |
xAI — Grok 系列
| 项目 | 详情 |
|---|---|
| Grok 4.6 | 8月12日发布,4.5 的直接升级;500K 上下文;文本+图像输入;reasoning_effort 支持 low/medium/high/xhigh |
| 性能提升(vs 4.5 High,厂商自报) | DeepSWE v1.1 65.9%(+11.9)、APEX-Agents 57.5%(+10.4)、Terminal-Bench v3.0 26.0%(+10.3);知识工作 Elo:GDPVal-AA v2 1753(+227)、AA-Briefcase 1577(+264) |
| 价格 | 标准(<200K prompt):$2 / $0.50 缓存 / $6;≥200K 全请求按 $4 / $1 / $12 计费(“200K 悬崖”);Priority Processing 为 2 倍速通道 |
| Agent 循环优化 | prompt_cache_key / x-grok-conv-id 粘性缓存键、上下文压缩;定位"长时间少干预"的 agent 工作 |
| 背景 | 由 Cursor 团队主导训练(基于 Composer 2.5 升级),约 1.5T MoE 参数;AA-Briefcase 达 Fable 5 同级,token 消耗仅约 Opus 5 的四分之一 |
阿里巴巴 — Qwen 系列
| 项目 | 详情 |
|---|---|
| Qwen3.8-Max 开放权重 | 8月12日发布:2.4T 总参数 / ~95B 激活(512 experts,10 路由 + 1 共享),Qwen 家族首个突破万亿参数的模型,也是 Max 级别首次开放权重;混合架构(Gated DeltaNet + MoE + Gated Attention) |
| 开源版规格 | 纯文本、强制思考模式、原生上下文 262,144(可扩展至 ~1.01M);自定义 Qwen3.8-Max License(非 Apache/MIT):>100M MAU 或 >$20M 月收入需展示模型名;MaaS 业务 TTM 收入超 $50M 需另行授权 |
| API 版 qwen3.8-max | $2 / $6 每百万 token;1M 上下文默认;支持文本+图像+视频;内建工具 |
| 性能(厂商自报 vs Qwen3.7-Max) | Terminal Bench 2.1 86.6(vs 74.5)、SWE-bench Pro 67.7(vs 60.6)、PaperBench 93.0(vs 64.8)、GPQA Diamond 92.6 |
| Qwen 3.8-27B | 8月发布并开源的稠密多模态 Agent 模型(27B),阿里云已上架 |
| 财报信号 | 8月20日阿里财报显示 AI 已成为云增长的确定性引擎,连续发布前沿语言、编程、视频、语音、图像、音乐模型及"千问办公"AI 生产力平台 |
智谱 — GLM 系列
| 项目 | 详情 |
|---|---|
| GLM-5.3 | 8月发布并开源,智谱迄今能力最强的开源 Agent 模型;参数量 754B(A40B),上下文窗口 1M,最大输出 128K;支持真正可用的超长上下文,长程任务(Long Horizon Task)保持领先;8月18日上架阿里云百炼 |
| 商业化调整 | 8月初国内版 Coding Plan 新套餐上线,价格较此前档位翻倍级上涨,购买方式从抢购转为开放 |
月之暗面 — Kimi 系列
| 项目 | 详情 |
|---|---|
| Kimi K3 | 7月17日发布,2.8T 参数,号称全球最大规模开源模型;原生视觉能力,1M 上下文窗口,面向长程 agent 工作流;厂商引用测试显示其在编程任务和复杂应用上优于 Claude Opus 4.8 与 GPT-5.5;已在 Moonshot、Together、Fireworks、Baseten、Modal 等多家平台上线 |
其他值得关注
- MiniMax:8月开源音乐模型 Music 3.0(本周更新)
- 微软:MAI-Code-1.1-Flash 视觉编码模型(更便宜档位)
- Liquid AI:LFM2.5-VL-3B 边缘视觉语言模型
- 字节跳动:Seed 系列持续推进(豆包 Doubao-Seed-1.6 系列)
- 阶跃星辰 / 可灵 / 通义:均有模型更新,视频、图像、音乐生成赛道竞争白热化
📈 行业趋势分析
1. Agent 化成为绝对主线
- Agent 模型已占据主流模型的大半壁江山,"推理模型"作为独立类别已无存在必要,行业预计 2027 年将删除该分类。
- 各家旗舰(GPT-5.6 Sol、Fable 5、Gemini 3.7 Flash、Grok 4.6、Qwen3.8-Max)均以长程自主任务、工具调用、多步规划为核心卖点;多智能体协作(OpenAI ultra 模式 4 agent 并行、MCP 兼容编排)成为新前沿。
2. 价格战与"效率优先"时代
- 竞争焦点从"谁更强"转向"每美元/每 token 的智能密度":GPT-5.6 Luna 降价 80%、Gemini 3.7 Flash 半价促销至年底、DeepSeek 峰谷定价、Grok 缓存键优化——定价策略日益精细化。
- OpenAI 明确以"约四分之一成本击败 Fable 5"作为营销叙事;Grok 4.6 强调"AA-Briefcase 达 Fable 5 同级但 token 消耗仅四分之一"。
- DeepSeek 官方预告重大涨价,低价红利期可能进入尾声,市场需提前做好成本预案。
3. 国产大模型军团式崛起
- 阿里(Qwen3.8-Max 万亿级开源)、智谱(GLM-5.3)、月之暗面(Kimi K3 全球最大开源)、DeepSeek(V4-Pro GA)六周内相继发布前沿级模型,历史首次。
- LMSYS Arena Agent 榜上 DeepSeek V4 Pro 携 Qwen 3.8 Max 入场,“杭州与北京的差距缩小”。
- 阿里云 AI 收入三位数增长 + 3800 亿算力资本开支,显示中国厂商正以"模型+云+算力"全栈模式参与全球竞争。
4. 开源与闭源策略分化加剧
- Meta 从"全开源"转向混合策略(Muse Spark 闭源、Watermelon 计划部分开源),引发开源社区争议。
- 阿里 Qwen 坚持开源但采用自定义许可证(MAU/收入门槛条款),"开放权重"与"自由开源"的边界被重新定义。
- OpenAI 的 gpt-oss 与 DeepSeek、GLM 的开源路线形成多极格局;企业选型需仔细评估许可证合规风险。
5. 安全与监管成为发布节奏的变量
- Claude Fable 5 曾因安全评估暂停部署三周后重新上线;GPT-5.6 经历政府审查期后分阶段解禁;Anthropic Mythos 5 仅对特定用户开放。
- 模型安全策略(拒绝训练、实时监控、差异化访问控制)已成为旗舰发布的标配内容。
6. 长上下文与多模态成为默认配置
- 1M token 上下文已从旗舰专属下放至 Flash/Sonnet 等"工作马"档位;图像/视频/音频多模态输入成为普遍能力。
- 行业同时开始正视长上下文幻觉问题(如 LongNovel 等新基准的发布)。
7. AI 基础设施投资回报显性化
- 阿里云外部收入 +45% 创 22 个季度新高,AI 收入连续 12 个季度三位数增长,"三年回本"的算力投资逻辑得到财报验证。
- 全球 AI 云格局加速重构,算力资本开支从"军备竞赛"转向"回报周期明确化"。
📚 参考来源
- OpenAI 官方博客:GPT-5.6 发布、Ultrafast 预览、价格调整公告
- Anthropic 官方新闻:Claude Opus 5 / Fable 5 / Sonnet 5
- Google 官方博客:Introducing Gemini 3.7 Flash(8月13日)
- LLM Stats / llm-stats.com:Gemini 3.7 Flash、DeepSeek-V4-Pro-0813、Grok 4.6、Qwen3.8-Max 深度评测
- DeepSeek API 官方文档:更新日志与定价表
- 知乎专栏《国内外知名大模型及应用》(2026/08/20 更新)
- 新浪 AI 热点小时报(2026年8月21日)
- 阿里财报电话会报道(新浪财经、网易科技)
- 世界银行《2026年世界发展报告》
- Axios、NYT、CNBC、Engadget 等外媒报道
本报告由 Hermes Agent 自动收集整理,数据截至 2026年8月21日。厂商自报基准分数未经独立验证,仅供参考。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)