01 产品发布

DeepSeek V4 Pro正式版API上线,多项测试性能接近Fable 5

DeepSeek V4 Pro正式版正式发布,已更新至API,调用模型名不变。新版本模型版本号为DeepSeek-V4-Pro-0813,大幅增强了Agent能力,支持Responses API和Codex接入。

从官方群放出的评测对比表来看,DeepSeek V4 Pro正式版在多项测试中接近Fable 5水平,相比预览版能力大幅提升。其中,在终端Agent测试Terminal Bench中得分为87.9分,逼近Fable 5的88.0分;在AI安全智能体评测基准CyberGym和高难度智能体评测基准AutomationBench上,表现甚至反超Fable 5。在AI编程智能体基准测试DeepSWE中,得分从预览版的7.3大幅提升至62.7。

SpaceXAI推出Grok Bot企业级AI代理,对标Anthropic与OpenAI

8月11日,马斯克旗下SpaceXAI正式发布AI代理产品Grok Bot,目前处于早期测试阶段。这是马斯克旗下AI业务追赶Anthropic和OpenAI的最新举措,也是SpaceXAI与Cursor深度合作的阶段性成果。

Grok Bot的核心定位是“永远在线的AI队友”。与市面上多数AI工具不同,Grok Bot拥有独立的云端计算机,可以直接登录用户现有的工具和应用——包括没有API接口的平台,用户可以像发消息给同事一样给Bot分配任务,Bot会记住对话、学习用户的工作习惯,并随时间变得更精准。多个Bot还可以并行运作,互相传递任务、共享上下文,用户无需充当中间人。

Grok Bot并非从零发布,而是先在SpaceXAI内部大规模使用后才对外开放。内部使用场景涵盖销售、财务、运营和工程等多个部门。该产品此前以代号“Sand”在Cursor内部测试,于6月下旬开始内测。

xAI发布Grok 4.6,强化长时运行智能体能力,多项基准追平GPT-5.6 Sol

xAI正式发布Grok 4.6模型,在Grok 4.5基础上重点强化了长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在Artificial Analysis Intelligence Index(九项基准综合分)上追平GPT-5.6 Sol。此次升级进一步巩固了xAI在AI代理领域的竞争力,距SpaceXAI推出Grok Bot仅相隔两天。

阿里开放Qwen3.8-2.4T-A95B模型权重:2.4T MoE、激活95B、原生256K上下文

阿里Qwen团队正式开放Qwen3.8-2.4T-A95B模型权重,这是Qwen-Max级别模型首次开源。该模型总参数达2.4T,每个Token激活95B参数,原生支持262,144 Token上下文,并可扩展至1,010,000 Token。此次开源将极大推动大模型社区在高效MoE架构和长上下文处理方面的研究与应用。

LTX-2.5模型登场:生成10秒720P视频仅需6.8秒,原生集成ComfyUI

LTX今日推出LTX-2.5视频生成模型,原生集成ComfyUI工作流。在2张英伟达GB200配置下,生成10秒720P视频仅需6.8秒。LTX-2.5 Fast版本以每秒0.09美元生成带音频的720p视频,10秒片段成本0.90美元。年度经常性收入低于1000万美元的组织可免费使用,为中小团队提供了低成本高质量的视频生成方案。

微软首发自研推理模型MAI-Thinking-1,已在Microsoft Foundry上线

微软AI首席执行官Mustafa Suleyman在X平台宣布,微软首个自研推理模型MAI-Thinking-1从零开始构建,现已正式在Microsoft Foundry平台上线。该模型专注于推理能力,标志着微软在基础模型自研方向迈出重要一步。具体技术细节和性能指标尚未公布,后续有望进一步公开。

OpenRouter推出实时网页搜索基准测试,系统评测模型、引擎与预算组合配置

OpenRouter发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合对网页搜索效果的影响。数据显示,将搜索预算从1轮增至25轮可使BrowseComp得分近乎翻倍,成本仅增加2.5至7倍;模型选择比搜索引擎更重要,平均分差为15分对比10分。研究还指出,失败率高的任务应降低搜索深度以控制成本,为开发者构建AI智能体搜索能力提供了数据支撑。

Claude Code v2.1.229发布:新增远程会话恢复、插件市场命令源及多项修复

Claude Code v2.1.229版本正式发布,新增远程控制会话恢复、自托管runner的服务器端hook支持,以及插件市场命令源。修复了长响应流式输出丢失、窄终端渲染崩溃、Windows扩展路径崩溃等问题。改进工作流输出以复用缓存提示前缀,并调整commit-push-pr对危险git/git命令不再自动批准,提升开发安全性和使用体验。

02 产品更新

Claude in Chrome侧边栏升级为Claude Cowork会话,实现跨端无缝切换

Claude宣布,Chrome浏览器扩展的侧边栏现已升级为Claude Cowork会话。升级后对话将保存至历史记录,技能和连接器可在浏览器中正常工作,任务可在桌面端、网页端和移动端应用间无缝切换。此次升级进一步强化了Claude在工作场景中的连贯性和可用性。

SGLang与Miles为Qwen3.8-2.4T-A95B提供Day-0支持,助力2.4T MoE模型高效推理

LMSYS旗下SGLang与Miles在发布首日即宣布支持Qwen3.8-2.4T-A95B模型。该模型是Qwen系列最大的开源模型,总参数达2.4T,每Token激活95B参数,采用混合注意力架构。Day-0支持意味着开发者可立即使用SGLang和Miles进行高效推理部署,大幅降低大规模MoE模型的使用门槛。

WhatsApp推出Scam Alert诈骗提醒功能:端到端加密保护下本地识别潜在诈骗消息

WhatsApp宣布推出可选功能Scam Alert,通过端到端加密保护下在设备端运行机器学习模型,识别潜在诈骗消息,且消息内容不会离开设备或自动上报。该功能遵循三大原则:仅设备端处理、无自动上报、用户控制。模型权重公开供独立验证,遥测数据经差分隐私聚合处理。目前已在Beta版有限推出,并邀请安全研究社区参与测试。

03 行业动态

消息称小红书打造全新“AI导购”功能,官方暂无回应

8月12日消息,小红书正在打造全新的“AI导购”功能。该功能依托对话交互模式,在问答场景中直接推送商品卡片、挂载下单跳转链接,项目由潘博远主导推进。

对此消息,新浪科技向小红书官方进行求证,截至发稿暂无回应。

自变量机器人打破Figure AI物流分拣纪录:30%成本实现45%效率反超

8月12日,自变量机器人完成了一场持续1小时的全自主物流分拣公开直播。机器人依托自研的世界统一模型WALL-B,采用双机械臂搭配标准夹爪的硬件方案,在全程无人工干预的情况下,对大小、形状、材质及重量完全随机的真实物流包裹进行连续分拣。

最终成绩定格在1816件/小时,准确率超过98%。这一数据超越了美国Figure AI此前公开展示的1248件/小时平均效率纪录,效率提升超过45%。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐