OpenAI 要从 Cursor 撤模型,腾讯开源 Hy4,索尼、华纳起诉 Anthropic
这期的「周一上线」,模型更新有点密集。
腾讯开源 Hy4 preview,Qwen3.8-Flash-Next 提前放出了 Qwen4 的架构方向,智谱揭晓匿名跑了一周的 Ox Alpha 就是 GLM-5.3-Flash;Wan3.0 把单次视频生成拉到最长 30 秒,微信团队也开源了自己的多模态 Embedding 模型。
另一边,AI 开发工具和基础设施也发生了不少变化。SpaceX 收购 Cursor 后,OpenAI 决定逐步停止向 Cursor 提供模型;DuckLabs 将加入 AWS,英伟达据报拟以 129 亿美元收购 Hugging Face。Cloudflare 则靠几处 Rust 数据结构优化,从 1.1.1.1 的 DNS 缓存里省出了约 100TB 内存。
下面,开始一周回顾。
有点新鲜
「有点新鲜」收录本周 AI / 开发者圈里那些不算大新闻,但挺值得看一眼的新鲜事。
小鸭子机器人
Pollen Robotics 展示了 Microduck 的一套 sim2real 训练流程:在模拟环境里训练,搬到真机上运行,再接着教它新的动作。
Microduck 是 Hugging Face 旗下 Pollen Robotics 推出的 25cm 高开源双足机器人,售价 399 美元,SDK、模拟器和强化学习训练栈都已开源。
一只桌面小鸭子,也正经跑起了机器人训练流程。
ASCII 动态卡片
Praveen Kumar 做了一组 ASCII cards。虽然它由 ASCII 构成,但是通过字符密度、颜色和动态变化,也能得到一个非常有质感的动态卡片:
立体二维码
Manish Kumar 分享了一个挺漂亮的二维码玩法:输入一个网址,二维码会“长”成一棵 3D 树。
Qwen 画水彩
有人做了个很抽象的实验:拿 Qwen Coding Model 做强化学习,让它学会写 JavaScript 画水彩画。
方法是给 Qwen 一个水彩画 Prompt,让它编写 p5.brush JavaScript,再渲染成 PNG,通过参考画对比评分,用强化学习反复优化。
视频 4D 人
蚂蚁技术团队开源了 4DAnyone,可以把一段普通单目人物视频转换成多视角视频。
项目支持 6、24、48 个视角以及不同俯仰角组合,生成结果可以继续用于 4D Gaussian Splatting 重建,实现 360° 或自由视角观看。
Claude 语翻译器
Yuntian Deng 发现 Claude 的表达方式有一股 Claude 味,于是干脆做了个翻译器。它只有一个功能:English ↔ Claudish。
周五发版
「周五发版」是一个程序梗:一旦版本上线,我们就要开始祈祷一切如期运行。这个模块寓意,所有模型、产品版本更新,都能大吉大利。
Hy4 preview:腾讯开源 770B 新模型
腾讯混元发布并开源 Hy4 preview,总参数 770B、激活参数 49B,上下文长度超过 1M,重点面向代码、办公、科研等生产力任务。
Hy4 preview 目前已进入 WorkBuddy、CodeBuddy、元宝和 ima,也可以通过腾讯云 Tokenhub、OpenRouter 接入。
此外,腾讯称 Hy4 preview 参与了自身训练方法、数据策略、评估体系和底层算子的优化,并参与推理系统的算子融合和通信优化,使端到端吞吐相比基线提高 31.8%。
Qwen3.8-Flash-Next:提前看看 Qwen4 的架构
Qwen 开源 Qwen3.8-Flash-Next。它是一款多模态 MoE 模型,同时被 Qwen 定位为 Qwen4 架构的早期预览。
模型主体参数为 125B,每个 Token 激活约 6B 参数,另有 51B 的 N-gram Embedding 参数。原生上下文长度为 262K,并可扩展至 1M。
这次主要调整集中在 Attention、Residual、Embedding 和 Optimization 四个方向。Qwen 选择先把架构变化开放出来,让社区在完整 Qwen4 系列推出前提前测试。
Pipette:专门测“模型跑到设备上以后怎么样”
Liquid AI 联合 Artificial Analysis 开源了 Pipette,一套面向端侧 AI 的模型评测工具。
Pipette 不只看模型本身,而是把 模型 + 量化方式 + Runtime + 设备 作为完整配置一起测试,观察质量、速度、延迟和内存占用。
首批数据覆盖 30 多个模型、1000 多种配置,并提供 macOS、Windows、iOS 和 Android 的测试客户端。
Wan3.0:最长一次生成 30 秒,还能读 PDF 和网页
阿里云上线 Wan3.0 系列视频生成模型。
Wan3.0 采用 All-in-One 设计,一套模型覆盖文生视频、首帧/首尾帧生成、多模态参考生成、视频编辑和续写。单次最长可以生成 30 秒、30fps 的视频,同时原生生成对白、背景音乐和音效。
它还能一次使用最多 20 个多模态参考素材,包括图片、视频、音频、文档和网页。也就是说,一份 PDF、PPT 或网页都可以成为视频生成的参考材料。
WeMM-Embedding:微信开源多模态 Embedding 模型
腾讯微信视觉团队开源 WeMM-Embedding,提供 2B、4B 和 9B 三个版本。
这套模型可以把文本、图片、视频、视觉文档,以及交错排列的多模态内容映射到统一的向量空间,用于检索、推荐和分类等任务。
根据技术报告,WeMM-Embedding 已应用在视频号、公众号、朋友圈和电商搜索推荐等微信业务中。模型权重和代码也同步开放。更多参见新闻贴图
GLM-5.3-Flash:原来 Ox Alpha 是它
智谱发布并开放 GLM-5.3-Flash,此前在 OpenCode 和 OpenRouter 上匿名测试的神秘模型 Ox Alpha 也正式揭晓身份。
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B、激活参数 18B,并采用稀疏注意力和线性注意力混合架构,支持最高 1M Token 的长上下文。
智谱表示,Ox Alpha 匿名测试期间一度成为 OpenRouter 当周最受欢迎的模型,相关流量全部由国产 AI 芯片集群承载。模型权重目前已开放。
开源雷达
周榜速递
周榜主要根据新增 Star 数进行排名,下面的单项目讲解则偏向新晋项目、实用老项目,标星并非单项目讲解的唯一指标。
OpenMAIC:一句话生成一整门课
OpenMAIC 是清华 MAIC 团队开源的多 Agent 互动课堂项目。
它可以从一个 Prompt 开始规划课程,再生成课程页面、幻灯片、测验、互动内容、项目式学习任务、图片、视频和语音。
新版加入了 Agent Workbench,可以通过对话让 Agent 规划、生成和修改整门课程。用户也可以上传文档、音频和视频,或者调用 Web Search,让课程围绕自己的材料构建。
项目内置 20 个课程相关 Skill,并支持替换模型、搜索服务、媒体服务和存储后端。
Archify:让 Coding Agent 给代码库画架构图
Archify 是一个面向 Cursor、Claude Code、Codex CLI 和 OpenCode 的架构图 Skill。
它可以读取代码库或系统描述,让 Agent 先生成结构化 JSON,再由 Archify 按确定性规则渲染成 HTML / SVG 架构图。
除了架构图,它还支持 Workflow、Sequence、Data Flow、Lifecycle 等图形,并提供 Before / Delta / After 对比,用来观察一次代码修改前后的架构变化。
项目还会检查 Schema、布局、连线和标签位置,通过验证后再交付最终文件,减少 Agent 随手画图时容易出现的结构错误。
awesome-gpt-image-2:把 500+ 生图案例做成可复用 Skill
awesome-gpt-image-2 是一套面向 GPT-Image 2 的 Prompt 模板与案例库。
项目收集并逆向整理了 500 多个生图案例和 20 多套工业级模板,再把主体、光线、材质、布局等 Prompt 元素拆成结构化模块,希望让 Prompt 可以像代码一样被组合和复用。
它还提供 GPT-Image2 Style Library Skill,可以安装到 Claude Code、Codex、Cursor 等 Agent 中,让 Agent 从同一套案例库中选择风格、模板和场景标签。
如果平时经常需要给 Agent 写配图 Prompt,这个项目更像一份可调用的视觉风格库。
Crawl4AI:专门给 LLM 和 Agent 准备网页数据
Crawl4AI 是一个面向 LLM、RAG、Agent 和数据流水线的网页爬取和内容提取工具。
它可以把网页转换成结构清晰、适合模型读取的 Markdown,同时支持异步抓取、缓存、Session、代理、Cookie、自定义脚本和 Hook。
对于需要让 Agent 持续读取网站、做研究或建立 RAG 数据源的场景,它提供了一套从网页访问、正文清洗到结构化提取的完整工具链,也支持 CLI 和 Docker 部署。
这周有事
「这周有事」收录本周值得记一下的行业动态、事故、融资、人员流动和基础设施变化。
OpenAI 决定不再供模型给 Cursor
OpenAI 宣布已通知 SpaceX,计划逐步结束向 Cursor 提供 OpenAI 模型的合同,拟定的停止日期为 11 月 12 日。
OpenAI 给出的理由是,在 SpaceX 完成对 Cursor 的收购后,公司无法确信相关技术会持续按照其服务条款使用。现有合同为控制权变更提供了一段取消窗口,因此 OpenAI 选择在允许的最晚时间终止合同,同时也明确表示,未来的新模型不会再提供给 Cursor。
DuckLabs 加入 AWS
Amazon 与 DuckLabs 签署最终收购协议,交易预计在 9 月初完成。DuckLabs 团队将加入 AWS,并继续负责 DuckDB、DuckLake 和 Quack 等项目。
DuckDB 不会因为这次收购改变开源模式。DuckDB、DuckLake、Quack 等项目仍将在独立的 DuckDB Foundation 下维护,继续使用 MIT License,现有治理模式和路线图也会保留。
英伟达拟以 129 亿美元收购 Hugging Face
英伟达已同意以 129 亿美元收购 Hugging Face。
Hugging Face 在 2023 年融资时估值为 45 亿美元,英伟达当时就是投资方之一。如果这笔交易完成,收购价格接近三年前估值的三倍,也会成为英伟达规模最大的收购案之一。
截至目前,英伟达与 Hugging Face 尚未通过官方渠道公布完整交易细节。
Cloudflare 省出 100TB 内存
Cloudflare 本周分享了一次很典型的基础设施优化。
其 1.1.1.1 DNS 服务背后的 Big Pineapple 平台,同时维护超过 2500 亿条 DNS Cache。工程团队调整了几处 Rust 数据结构后,把单条缓存记录的内存占用从 953 Bytes 压到 420 Bytes,下降 56%。
放到整个集群规模上,这些“小改动”最终释放了约 100TB 内存。与此同时,缓存写入吞吐提升 43%,查询延迟下降 19%。没有增加新服务器,性能和内存都从数据结构里抠出来了。
Twitter 真的被人“复活”了
一家名为 Operation Bluebird 的美国初创公司上线了新社交平台 Twitter.now,重新使用 Twitter、Tweet、Retweet 等名称。
这家公司认为,马斯克把 Twitter 更名为 X 后,相当于放弃了部分相关商标权,因此在 2025 年向美国专利商标局申请撤销 X 持有的 Twitter 和 Tweet 商标。
X 随后起诉 Operation Bluebird,希望阻止新平台上线。今年 4 月,负责案件的法官曾在听证会上对 X 是否仍拥有部分商标权提出疑问,但那只是初步意见,还没有形成最终书面裁决。
又拍云被执行近 900 万元
据公开执行信息显示,又拍云相关主体在 7 月和 8 月共被执行 3 次,执行金额合计接近 900 万元。
其中,一笔 239 万元的强制执行未能完成,杭州拱墅区法院随后对相关公司及其法定代表人签发限制高消费令。
索尼、华纳起诉 Anthropic
Sony Music Publishing、Warner Chappell Music 等音乐出版商在美国加州北区联邦法院起诉 Anthropic,同时将 CEO Dario Amodei 和联合创始人 Benjamin Mann 列为个人被告。
起诉书指控 Anthropic 为训练 Claude,大规模通过 BitTorrent、网页抓取等方式获取受版权保护的作品。原告还特别援引此前诉讼材料,称 Mann 在 2021 年从 LibGen 下载至少 500 万本盗版书,2022 年 Anthropic 又从 Pirate Library Mirror 获取至少 200 万本,并指控 Amodei 和 Mann参与或批准了相关行为。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)