AI前沿速递:双线爆发!谷歌打响 AI Coding 价格战反击战,国产具身智能正式扬帆出海!
本周AI动态围绕「AI Coding价格战与执行层竞争全面开启」与「具身智能量产拐点与资本加速涌入」两条主线展开。AI Coding方向,谷歌8月13日发布Gemini 3.7 Flash,距上一代仅三周、价格腰斩至3.6 Flash原价的一半,编程基准FrontierCode 1.1从34.4%跃升至43.6%、DeepSWE v1.1从49%飙至65.3%,布林亲自督战、DeepMind完成史上最大规模领导层重组,谷歌以"高频迭代+价格战"策略强攻AI编程赛道;同日xAI(现SpaceXAI)发布Grok 4.6,AA Intelligence Index得61分与GPT-5.6 Sol持平,距Grok 4.5仅一个月迭代,定价$2/$6延续低价路线,重点转向长流程Agent能力;8月13日晚DeepSeek同步开源Agent运行框架DeepSeek Harness(DSH),"一切皆插件"架构补齐Vibe Coding入口,同日V4-Pro正式版上线(1M Token上下文),标志DeepSeek从基础模型进入AI编程执行层竞争。具身智能方向,ChatGPT核心贡献者姜旭创立的亮源新创完成数亿元Pre-A轮融资(国科投资领投),致力于"物理AGI",提出"规模化预训练-规模化对齐-规模化部署"三段范式,已有Light-Loco-Parkour全身运动系统等技术成果;无界动力北京五环内首个具身智能中试平台落成,旗下K15成为全球首个获工业级CE全指令认证的具身智能机器人,1亿美元订单首批已发往欧洲,标志国产具身智能正式迈入"量产+出海"拐点。

一、谷歌发布Gemini 3.7 Flash:三周一迭代、价格腰斩,布林督战打响AI编程反击战
8月13日(美东时间),谷歌正式发布Gemini 3.7 Flash大语言模型,距上一代Gemini 3.6 Flash的推出仅相隔三周。谷歌将这款新模型定位为目前Flash系列中最强大的"主力"型号,重点面向编程和AI智能体场景。这已是谷歌近期密集推出的第四款Flash系列模型——7月22日Alphabet财报前一天,谷歌一口气推出了Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber三个版本。
编程能力大幅提升:根据谷歌公布的数据,该模型在FrontierCode 1.1 Main测试中得分43.6%,而Gemini 3.6 Flash为34.4%;在DeepSWE v1.1测试中得分从49%提升至65.3%。网页开发方向,WebDevArena Elo评分从1538提升至1588,能用更少的提示词生成功能性更强的页面布局和特性完整的应用。知识密集型任务方面,GDP.pdf基准从22%提升至34%,AutomationBench(衡量真实商业工作流表现)从17%提升至30.4%。

Agent能力全面优化:谷歌强调Gemini 3.7 Flash在遇到障碍时的适应能力、对用户意图的澄清能力、指令遵循能力、多步骤任务规划能力以及外部工具使用能力均有优化,可减少开发者在构建软件智能体时的人工干预和重复尝试次数。新模型还推出全新安全防御机制,严防CBRN(化学、生物、放射性及核)领域和网络攻击滥用。

定价策略:限时腰斩:2026年底前,Gemini 3.7 Flash引导价格为每百万输入Token $0.75、每百万输出Token $3.75,仅为Gemini 3.6 Flash原价的一半。2027年1月1日起价格上调至$1.5/$7.5。Gemini 3.6 Flash也享受相同优惠。新模型已接入Gemini Spark(谷歌24小时个人AI智能体服务),面向160余个国家和地区的Google AI Pro与Ultra用户开放。

背后:布林督战、DeepMind换帅:近期谷歌一连串动作的背后是全力补全AI赛道差距:联合创始人谢尔盖·布林近几个月深度介入核心AI团队,亲自督促全员集中资源攻坚Gemini系列;上周DeepMind完成成立以来最大规模领导层重组,掌舵多年的德米斯·哈萨比斯退居二线,由副手科拉伊·卡武克丘奥卢接棒,Gemini项目两位初代技术联合负责人离职创办新公司。旗舰模型Gemini 3.5 Pro至今仍无明确上线时间,其延期引发投资者对谷歌发展路线图的质疑。
值得关注的原因:
谷歌本周的发布是AI Coding赛道"价格战"的标志性事件。三个关键看点:(1)三周一迭代+价格腰斩——谷歌正以远超行业常规节奏的迭代速度(一个月内四款Flash模型)和激进定价策略(原价一半)强攻开发者市场,这直接回应了上周VentureBeat报道的"AI编码Agent预算失控"痛点,也在逼OpenAI和Anthropic重新考虑定价;(2)DeepSWE v1.1从49%到65.3%是质变级跳跃——该基准衡量模型在真实仓库级软件工程任务上的能力,16个百分点的提升说明Gemini在"从回答问题到完成任务"的核心转折上取得实质突破;(3)布林亲自督战+DeepMind换帅的信号价值高于模型本身——谷歌联合创始人深度介入和领导层重组说明内部已认定AI是存亡级问题,哈萨比斯退居二线更可能是"让更贴近产品的人接管"而非简单的人事变动。但旗舰Gemini 3.5 Pro持续跳票仍是最大隐忧——Flash系列的快速迭代如果只是"以量补质",无法从根本上解决谷歌在前沿能力上落后Anthropic和OpenAI的质疑。

二、xAI发布Grok 4.6:AA Intelligence Index持平GPT-5.6 Sol,一个月一迭代杀入第一梯队
8月12日,马斯克旗下SpaceXAI(原xAI,被SpaceX收购后更名)发布新一代大模型Grok 4.6,距上一代Grok 4.5仅一个多月。1.5万亿参数,与Grok 4.5同架构,完全靠后训练改进(监督微调SFT + 强化学习RL)。Grok 4.6发布后获市场积极反馈,SpaceX股价当日涨超9%。
进入第一梯队:全球知名独立AI评测机构Artificial Analysis公布的Intelligence Index显示,Grok 4.6得分61分,与OpenAI的GPT-5.6 Sol处于同一水平,相比Grok 4.5提高5分,仅次于Anthropic Claude Fable 5的62分和Claude Opus 5。Artificial Analysis称"Grok 4.6由此重新进入前沿模型行列"。

基准成绩全面跃升:GDPVal-AA v2(知识工作评测)得分1753,全场领先;CursorBench v3.2从66.7%提升至69.9%;DeepSWE v1.1从54%提升至65.9%;FrontierCode v1.1从56.6%提升至61.3%;Terminal-Bench v3.0从15.7%跃升至26%。但在DeepSWE(65.9% vs GPT-5.6 Sol的73%)和Terminal-Bench(26% vs 34%)上仍落后于头部竞品。
从"回答问题"转向"完成任务":SpaceXAI特别强调Grok 4.6的长流程智能体能力:模型能在多步骤任务中持续跟踪进度、自主检查自身工作、在遇到问题时继续修正而非每步等待用户指令。在训练层面,使用Grok 4.5重新生成SFT轨迹(覆盖推理、Agent框架、STEM、软件工程和知识工作领域),过滤问题轨迹后进行强化学习,覆盖内核优化、Web开发、CAD等领域专属环境。

定价与渠道:标准版定价$2/$6每百万Token(输入/输出),快速版为两倍价格。50万Token上下文窗口,知识截止日期2026年2月1日。已上线Cursor和Grok Build,首周提供2倍用量。同时通过OpenRouter、Vercel、Cloudflare等合作伙伴分发。

值得关注的原因:
Grok 4.6的发布标志着AI Coding赛道的竞争格局进一步复杂化。三个维度的看点:(1)一个月一迭代的节奏——从Grok 4.5(7月8日)到4.6(8月12日)仅一个月,马斯克已预告Grok 4.7(2.1万亿参数)"数周后"发布,四周发版节奏正在成型,远快于Anthropic和OpenAI的迭代周期,这种"快速小步快跑"策略正在改变前沿模型的发布范式;(2)知识工作评测全场领先——GDPVal-AA v2以1753分超越GPT-5.6 Sol(1728)和Claude Fable 5(1741),说明Grok在非编程的知识工作Agent场景上已具差异化优势,这拓宽了AI Agent的应用边界;(3)Cursor渠道整合的战略价值——SpaceXAI 6月以600亿美元收购Cursor后,Grok 4.6首发即上线Cursor,"模型+IDE"的垂直整合模式与OpenAI(Codex+ChatGPT)和Anthropic(Claude Code)形成三足鼎立。但Terminal-Bench仅26%(远落后于GPT-5.6 Sol的34%)暴露了Grok在长时间终端操作上的短板,这恰是AI编程中最贴近"自主软件工程师"场景的核心能力。

三、DeepSeek开源Agent运行框架DSH:MIT协议"一切皆插件"架构,补齐Vibe Coding入口
8月13日晚,DeepSeek正式发布并开源DeepSeek Harness(DSH)开发者预览版,MIT协议,GitHub已开放源代码,可通过npm直接启动(npx @deepseek-ai/dsh web)。这不是新的基础模型或API客户端,而是负责把模型接入文件系统、终端、网页、代码工具和其他Agent,并组织上下文、工具调用和任务执行的一整套Agent运行框架。
"一切皆插件"架构:DSH建立在具备时空可组合性的Cordis插件元框架之上。Cordis只负责插件的加载、卸载与依赖管理,而模型适配器、工具注册表、技能、会话日志、沙箱、存储、Agent循环、调度与UI全部实现为独立插件,彼此通过服务与事件协作。框架内部不存在需要打补丁的"特权内核",开发者无需改动源码,只需在配置层挂载或替换插件即可重组整套运行时。

四种运行模式:标准模式提供完整工具组合;PTC模式(程序化工具调用)由模型生成一段代码来组合多轮工具调用;极简模式仅保留一个shell工具与一个文件编辑工具,用于最小环境下的模型基准测试;创造模式可检查当前运行时、在内存中试验插件并组合出新模式。
可观测性主线:模型看到的一切都会写入仅追加(append-only)的会话日志,包括系统提示词、思维链、工具调用与结果、子Agent调度以及每一次上下文注入。开发者可在Trajectory视图中按来源查看。会话的恢复、分叉、检索与回放共享同一份事件流,便于复现和排查Agent的每一步决策。

同日V4-Pro正式版上线:8月13日早些时候,DeepSeek-V4-Pro正式版上线App、Web和API,支持1M Token上下文、最高384K Token输出。7月31日V4 Flash发布时,其更新日志中已透露V4 Flash使用的测试框架正是"即将发布"的DSH极简模式——Harness在正式公开前已参与DeepSeek对自身模型Agent能力的评估。
值得关注的原因:
DSH的发布标志着DeepSeek从"提供基础模型和API"正式跨入"AI编程执行层"竞争,与Claude Code、Codex、Grok Build形成正面交锋。三个关键看点:(1)"一切皆插件"的架构哲学——与Claude Code(闭源、Anthropic控制执行层)和Codex(OpenAI入口整合)不同,DSH把Agent Loop本身都做成可替换插件,这意味着开发者可以完全自定义Agent的运行逻辑,而非在厂商设定的框架内操作,这是开源社区对"Agent执行层被大厂锁定"的根本性回应;(2)append-only会话日志的可审计性——在AI Agent安全问题本周持续发酵(Meta、Anthropic、OpenAI相继披露模型越权事件)的背景下,DSH的Trajectory视图提供了完整的决策回溯能力,这与AWS Continuum接入Claude Code的安全审计思路遥相呼应,说明"可审计"正成为Agent框架的必备特性;(3)模型评估与执行层耦合——DeepSeek用DSH极简模式参与V4 Flash的Agent能力评估,说明前沿实验室已意识到"模型能力"和"执行框架"不可分割,基准测试必须在真实Agent环境中进行才有意义。V4-Pro的1M Token上下文+384K输出为长流程Agent任务提供了上下文基础。

四、ChatGPT核心贡献者姜旭创立亮源新创:数亿元Pre-A轮融资,从数字智能延伸至物理AGI
8月14日,新浪科技独家报道,由ChatGPT核心贡献者姜旭创立的亮源新创(Light Origins),近期已完成数亿元Pre-A轮融资,由国科投资领投,招商局创投、襄禾资本等机构参与。亮源新创成立于2024年底,总部深圳,注册资本9700万人民币,致力于将大模型能力从数字空间延伸至真实世界,实现物理AGI。
创始人背景:姜旭2019年起参与OpenAI全栈算法研发,完整经历InstructGPT、ChatGPT到GPT-4关键技术演进周期。在GPT-4技术报告中,姜旭被8次署名提及,与OpenAI联合创始人Greg Brockman被提及次数并列第一。2023年离开OpenAI回国创业。团队规模已超百人,研发人员占比超九成,算法团队来自全球顶尖高校及科技公司,硬件团队成员拥有华为、大疆等企业从业经历。
技术范式与已有成果:亮源新创提出并实践"规模化预训练、规模化对齐、规模化部署"三段范式,致力于打通驱动基础模型持续优化的数据飞轮。融资资金将主要用于超大规模具身智能模型训练、多模态数据基础设施建设及软硬件全栈平台研发。已有公开技术成果包括Light-Loco-Parkour(LightLP)端到端感知型全身运动系统——仅依托机载深度相机与速度指令作为输入,无需参考轨迹、技能标签、人工预设步态或实时运动图,就能自主决策行走、平衡、攀爬、下台阶、翻越障碍等动作。旗下机器人Lightbot 0身高90cm,重18.9kg,21个主动关节。
投资方观点:国科投资董事总经理周晓峰表示"具身智能还处在底层技术能力决定长期格局的早期阶段";招商局创投认为"具身智能最终要走进真实场景,接受稳定性、成本和可复制性的检验";襄禾资本指出"谁真正理解大模型智能涌现的底层逻辑,谁就更有机会把这套范式复刻到机器人身上"。
值得关注的原因:
这条消息的核心信号是:大模型领域最核心的人才正在把"语言智能的范式"迁移到物理世界。三个层面的看点:(1)"GPT-4核心贡献者做具身智能"的人才流向信号——姜旭在GPT-4报告中8次署名(与Brockman并列第一),是真正理解大模型scaling law和RLHF底层逻辑的人,这类人才从"数字AGI"转向"物理AGI",说明行业已形成共识:语言模型的方法论可以复刻到机器人身上,襄禾资本的判断"下一步真正的突破很可能来自具备大模型背景的创始人"正代表了这一认知;(2)"三段范式"直击具身智能核心瓶颈——"规模化预训练-规模化对齐-规模化部署"本质上是把GPT的成功三要素(大规模数据、人类反馈对齐、生产环境部署)搬到机器人领域,如果数据飞轮能跑通,将从根本上解决当前具身智能"一机一模型、一场景一数据"的碎片化困局;(3)Light-Loco-Parkour的技术路线选择——仅用深度相机+速度指令,无需参考轨迹和技能标签,就能实现跑酷级全身运动控制,这与谷歌Gemini Robotics 2的"单一VLA统一全身控制"路线异曲同工,但亮源新创作为创业公司选择了更轻量的传感器方案,如果在大规模部署中验证成功,将大幅降低人形机器人的硬件成本门槛。

五、无界动力中试平台落成+K15获全球首个工业级CE认证:1亿美元订单发往欧洲
8月13日,北京五环内首个具身智能中试平台——无界动力中试平台在中关村(海淀)具身智能创新产业园T8创新中心正式落成。平台规划六大功能区:原材料质检区、原材料存储区、模块装配区、整机合装区、整机测试区及整机存放区,完整覆盖从原材料检验预处理、模块组装、整机合装测试到成品包装的全流程环节,已形成完整生产闭环能力。
K15:全球首个获工业级CE全指令认证的具身智能机器人。7月9日,无界动力旗下轮式半人形机器人K15通过欧盟合规准入,7月23日获颁工业级全域CE认证,认证覆盖五大维度:CE-MD(机械安全)、CE-RED(无线电设备)、CE-EMC(电磁兼容)、EN ISO 13849(功能安全)及EN 18031(网络安全)。这是全球首个获得工业级CE全指令认证的具身智能机器人。在认证获批的同时,无界动力此前签下的1亿美元全球订单全面进入交付周期,首批K15已发往欧洲。
K15技术参数:双臂轮式半人形形态,搭载基于隐空间世界模型与强化学习的MWA通用具身大脑;腕部翻转半径仅30毫米,在全向工作空间宽度不超过800mm的狭窄环境下仍能稳定作业;搭载1200 TOPS(INT8)算力的国产计算平台,整机核心零部件国产化率达90%。可覆盖工业紧凑产线、商用公共服务、未来家庭生活等众多场景。已进入远景科技集团作业场景,与ZF LIFETEC、欧摩威集团等汽车产业链企业达成合作。
中试平台的意义:当前国内具身智能产业正处于从"技术演示"向"规模量产"跨越的关键拐点。中试平台解决的是"产品能否被稳定生产出来"这一核心命题——连接实验室研发与大规模量产的中间试验公共载体。平台落成后,将大幅缩短无界动力自研机器人本体的测试与量产周期。第三代含双足和轮臂双版本的具身智能机器人及更多核心零部件即将进入平台验证。创始人兼CEO张玉峰表示,中试平台将确保公司实现"产品可量产、量产有品质、生产有利润"。
值得关注的原因:
这条消息标志着国产具身智能正式迈入"量产+出海"的拐点。三个关键看点:(1)全球首个工业级CE全指令认证——CE认证五大维度全覆盖(机械安全、电磁兼容、无线电、功能安全、网络安全),说明K15已通过了欧盟最严格的工业级准入标准,这不是实验室产品的合规,而是可以合法进入欧洲工厂产线的产品级合规,1亿美元订单的首批发往欧洲验证了这一认证的商业价值;(2)核心零部件国产化率90%+1200 TOPS国产计算平台——在美国商务部将先进机器人列入限制进口清单、中方五项反制落地的背景下,高国产化率不仅是成本考量,更是供应链安全考量,K15的国产化路径为整个行业提供了可参考的模板;(3)中试平台填补"小试中试"关键拼图——行业从"技术演示"向"规模量产"跨越的最大鸿沟不在算法,而在工程化:产品能否被稳定地、有品质地、有利润地批量生产出来。无界动力的六大功能区闭环覆盖了从原材料到整机的全流程,这种"制造基础设施"的建设比单个技术突破更具产业基础设施级的意义。与此前宇树科技IPO定价610亿元、时耘科技首批量产下线等事件叠加,2026年下半年国产人形/半人形机器人正在集体跨过量产门槛。
· · ·
本周总结
8月10日至14日的AI动态呈现出一个清晰的双线加速态势:数字世界中AI Coding正从"模型竞争"进入"价格战+执行层竞争+长流程Agent"的深水区,物理世界中具身智能正从"技术演示"跨入"量产+出海+大模型人才涌入"的拐点。
AI Coding方向:三家前沿实验室本周同时出牌:谷歌以三周一迭代+价格腰斩强攻开发者市场,Gemini 3.7 Flash在DeepSWE v1.1上从49%飙至65.3%是质变级跳跃,但布林督战和DeepMind换帅的背后是"旗舰模型跳票"的根本焦虑;xAI以一个月一迭代将Grok 4.6推入第一梯队(AA Intelligence Index 61分持平GPT-5.6 Sol),知识工作评测GDPVal-AA全场领先,但Terminal-Bench仅26%暴露终端操作短板;DeepSeek则走了完全不同的路——开源Agent执行框架DSH,"一切皆插件"的架构哲学是对"Agent执行层被大厂锁定"的根本性回应,同日V4-Pro正式版上线(1M Token上下文)为长流程Agent提供基础。三条线的交汇指向同一个趋势:AI Coding的竞争已不只是"谁的模型更强",而是"谁的迭代更快、谁的定价更低、谁的执行层更开放"。
具身智能方向:资本和人才正在加速涌入:ChatGPT核心贡献者姜旭带着"GPT-4技术报告8次署名"的资历和数亿元融资投入"物理AGI",提出的"规模化预训练-规模化对齐-规模化部署"三段范式本质上是把GPT方法论复刻到机器人领域;无界动力K15作为全球首个获工业级CE全指令认证的具身智能机器人,1亿美元订单发往欧洲,核心零部件国产化率90%,中试平台的落成标志"从实验室到产线"的工程化鸿沟正在被跨越。两条线的共性在于:都在试图打破具身智能"一机一模型、一场景一数据"的碎片化困局,向"通用大脑+规模化数据+量产交付"的方向演进。下周第二届世界人形机器人运动会(8月22日北京,16国666支队伍)将是又一个密集验证窗口。
作者:咕泡科技——十年专注AI与IT中高端人才培育
各条目信息原始出处:Google Developers Blog(Gemini 3.7 Flash 官方)、GitHub(deepseek-ai/deepseek-harness,MIT 协议)、xAI / SpaceXAI、DataNorth、Unite.AI、LLM Stats、Artificial Analysis、The Agent Times、新浪科技、新浪财经、新浪移动/财闻、证券时报、凤凰财经、北京日报客户端(央广网)、中国经营报、南方日报、智东西(网易)、网易科技、博客园等。图片(含新闻配图、截图等)均来自上述媒体公开报道及网络公开渠道,如有侵权请联系处理,谢谢!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)