AI 前沿与嵌入式科技日报|推理运行时集中升级,机器人策略开始走向标准化
AI 前沿与嵌入式科技日报|推理运行时集中升级,机器人策略开始走向标准化
2026 年 8 月 12 日|GMT+8
严格统计窗口:2026 年 8 月 10 日 20:15—8 月 12 日 20:15
本期仅收录过去滚动 48 小时内可核验具体发布时间的一手发布或实质更新。
超出窗口、只有媒体转载日期、缺少官方确认的消息均未进入主新闻。
今日结论
过去 48 小时没有出现足以定义行业方向的新一代基础大模型发布。OpenAI、Google DeepMind、Anthropic、Meta 等主要厂商的公开新闻列表也没有符合窗口的重大模型公告。
真正密集的变化发生在模型落地层:
- ONNX Runtime 同时更新 Arm64、RISC-V、WebGPU、量化推理与输入安全;
- TensorRT-LLM 开始为 Kimi K3、MiniCPM-V 4.6、Whisper 等模型补齐高性能推理支持;
- Ultralytics 将视觉模型工具链与 OpenAI-compatible LLM 接口放到同一个 Python 包中;
- ModelScope ms-swift 集中修复 Qwen、NPU、Megatron、GRPO 和多模态训练问题;
- OpenMV 把视觉传感器、CAN、OpenAI-compatible API 示例带到嵌入式机器视觉端;
- 机器人研究开始从“再做一个策略模型”,转向世界—动作联合建模、统一策略接口和可执行推理。
今天的主线可以概括为:
模型创新放缓一天,工程栈却在快速补齐部署、兼容、安全和标准化能力。
今日速览
| 栏目 | 动态 | 发布时间(GMT+8) | 状态 | 核心影响 |
|---|---|---|---|---|
| 端侧 AI | ONNX Runtime 1.29.0 | 8 月 12 日 14:15 | 正式版 | Arm64、RISC-V、WebGPU 与安全同步更新 |
| 推理基础设施 | TensorRT-LLM 1.3.0rc24 | 8 月 12 日 15:07 | Pre-release | 新增 Kimi K3、MiniCPM-V 4.6、Whisper 支持 |
| 视觉 AI | Ultralytics 8.4.118 | 8 月 12 日 07:49 | 正式版 | YOLO 工具链加入独立 LLM 接口 |
| 国产开源生态 | ModelScope ms-swift 4.4.3 | 8 月 12 日 11:39 | Patch | 修复 Qwen、NPU、Megatron、GRPO 等兼容问题 |
| AIoT/嵌入式视觉 | OpenMV Development Release | 8 月 11 日 03:14 | 开发版,可能不稳定 | STM32N6 CAN、热成像和云端模型示例 |
| 具身智能 | Surgical WAM | 8 月 12 日 01:59 | arXiv 预印本 | 用无动作视频降低手术机器人数据依赖 |
| 机器人基础设施 | XPolicyLab v2 | 8 月 12 日 01:41 | arXiv 预印本修订 | 提出统一机器人策略评测与部署接口 |
| 自动驾驶 VLA | XCoT-VLA | 8 月 11 日 22:33 | arXiv 预印本 | 用少量可执行 Token 替代长文本推理 |
01|ONNX Runtime 1.29:端侧推理升级不再只是“跑得更快”
发生了什么
Microsoft 于 8 月 12 日 14:15 发布 ONNX Runtime 1.29.0。
本次更新跨越多个硬件与执行后端:
- Arm64 MLAS 增加基于 KleidiAI 的 FP16 GEMM、MatMul 和卷积路径;
- 增加 RISC-V RVV QNBitGemm 后端;
- Linux Arm64 可以根据 L2 Cache 检测启用 CPU FlashAttention;
- WebGPU 增加 PagedAttention、GRU、MRotaryEmbedding、量化 MatMul 等支持;
- CUDA 路径增加量化 KV Cache、PagedAttention、NVFP4 QMoE 等能力;
- Web 端宣布弃用 WebGL 和 JSEP,建议迁移到原生 WebGPU Execution Provider。
运行时还增加了可选的 POSIX Telemetry。它只在构建时启用遥测的 Linux、macOS、Android 和 iOS 版本中生效,可在初始化前通过:
ORT_DISABLE_TELEMETRY=1
关闭非 Windows 遥测。
安全修复更值得关注
1.29 修复了 TensorRT 和 NvTensorRTRTX 引擎重整过程中,外部数据路径验证不完整导致的路径遍历问题。
同时补充了多类防御性检查:
- MoE 专家数量与
k参数校验; - TensorScatter 安全修复;
- Pooling、LSTM、Sampling、QLinearConv、Whisper 解码等算子的秩、形状和参数校验;
- CUDA GridSample、LayerNorm、BeamSearch、DeformConv 等路径的索引与缓冲区加固;
- 子字节张量复制长度和 DML 常量张量大小校验。
为什么重要
过去,模型文件经常被视作一种“静态资源”。实际上,模型解析、外部权重路径、算子参数和张量形状都属于可被攻击的输入面。
尤其在以下场景中,模型不能默认被视为可信:
- 用户上传自定义模型;
- OTA 下发模型或外部权重;
- 边缘网关从第三方模型库同步文件;
- 多租户推理服务;
- 自动化 Agent 下载并部署模型。
对端侧团队的建议
升级前不要只跑一次精度测试,至少补充:
- 非法模型与截断权重测试;
- 外部数据路径穿越测试;
- 新旧版本输出误差对比;
- 冷启动、峰值内存和稳态延迟;
- Arm64、RISC-V、GPU 后端的算子回退统计;
- WebGL 向 WebGPU 迁移评估;
- 遥测构建开关和数据出站审计。
02|TensorRT-LLM rc24:模型支持扩大,但已知问题同样醒目
发生了什么
NVIDIA 于 8 月 12 日 15:07 发布 TensorRT-LLM v1.3.0rc24。
必须强调:这是 Pre-release,不是稳定生产版。
新增支持包括:
- Kimi K3 模型、KDA Kernel、MoE 优化、推测解码和解耦式服务;
- MiniCPM-V 4.6 图像与视频支持;
- Whisper 的 PyTorch 后端支持;
- Qwen Image Layered 与 Qwen Image Edit 流水线;
- Kimi K3 快速开始、评测、性能扫描和部署指南;
- 单设备视觉生成准确性回归套件。
已知问题
发布页同时列出了多项风险:
torch.compile与 CUDA Graph 组合可能在初始化或推理阶段失败;- SM120 上使用 MTP 与多流或分段 CUDA Graph 的 MLA 模型可能发生非法内存访问;
- 多 GPU 低精度 MoE 在特定融合归一化和 AllReduce 组合下可能严重损失精度;
- Qwen3 MoE 使用 FP8 block-scale 量化时可能启动失败;
- 部分图像与视频扩散流水线可能出现输出质量回退。
为什么重要
这次更新说明大模型部署的竞争焦点已经从“能否加载模型”,转向:
- 是否有专用 Attention 或 MoE Kernel;
- 是否支持推测解码;
- 是否能进行 Prefill/Decode 分离;
- 是否支持量化 KV Cache;
- 是否能在多 GPU 上保持数值稳定;
- 新模型发布后多久能进入高性能推理框架。
但支持列表变长,不代表所有组合都已具备生产稳定性。模型、精度、GPU 架构、并行方式和 CUDA Graph 组成的是一个巨大的兼容矩阵。
工程建议
rc24 更适合用于兼容性验证和性能试验。进入生产前,应固定:
模型版本 × 权重精度 × GPU 架构 × TensorRT-LLM 版本 × CUDA 版本 × 并行配置
并为每个组合保存正确性基线、吞吐、首 Token 延迟、峰值显存和长时间稳定性数据。
03|Ultralytics 8.4.118:视觉 AI 工具链开始吸收 LLM 接口
发生了什么
Ultralytics 8.4.118 于 8 月 12 日 07:49 发布。
新版本在 YOLO 之外增加了独立的 LLM 接口:
from ultralytics import LLM
该接口支持:
- OpenAI Responses API;
- Chat Completions API;
- 同步与异步请求;
- 文本与图像输入;
- 本地路径、URL、Data URL、NumPy 数组和 PIL 图像;
- OpenAI-compatible 服务端点;
- 会话状态、复用提示词和请求覆盖。
需要避免的误读
这不意味着 YOLO 模型“变成了大语言模型”,也不表示 Ultralytics 在本地直接提供新的基础 LLM。
更准确的理解是:Ultralytics 在自己的 Python 工具包中增加了通用 LLM 客户端,使开发者能更容易把目标检测、分割、姿态估计结果送入语言模型或视觉语言模型。
视觉训练也有实质更新
本次还修正了旋转框训练中的几何处理:
- Mosaic、CutMix、RandomPerspective 在物体被边界裁切时保留 OBB 朝向;
- 避免裁切后的目标获得错误旋转角;
- CopyPaste 使用批量实例拼接,减少反复复制扩大的数组。
可能形成的新流程
摄像头
↓
YOLO 检测/分割/姿态
↓
结构化目标与截图
↓
LLM/VLM 分析
↓
自然语言说明或任务建议
但在工业和设备控制场景中,最后一步仍应经过确定性规则,不能让 LLM 输出直接控制执行器。
04|ModelScope ms-swift 4.4.3:国产模型生态的难点正在转向组合兼容
发生了什么
ModelScope 于 8 月 12 日 11:39 发布 ms-swift 4.4.3,定位为 Patch release。
更新覆盖范围较广:
- 更新 NPU 文档与示例;
- 修复
batch_sampler set_epoch; - 增加顺序保持型 Packing 策略;
- 修复 Qwen3.5、Qwen3-Omni、Qwen3-TTS 相关问题;
- 增加 Kimi K3 模板;
- 增加 Qwen3.5 MoE 的 Ascend NPU 训练脚本;
- 修复 Ascend 950 上的 MindSpeed GDN 导入;
- 改进 Qwen3.5 在 NPU 上的上下文并行;
- 增加部分 Megatron、GRPO、LoRA、FSDP 和 vLLM 相关修复。
为什么重要
大模型训练框架现在面对的不是单一模型适配问题,而是组合爆炸:
模型架构 × 训练算法 × 并行策略 × 推理引擎 × GPU/NPU × 多模态模板
一个版本对 Qwen 文本模型运行正常,不代表它对 Qwen MoE、Omni、TTS 或 Ascend NPU 的组合也同样稳定。
对团队的影响
升级 ms-swift 时,建议维护项目自己的兼容清单:
| 维度 | 需要锁定的内容 |
|---|---|
| 模型 | 名称、权重提交、Tokenizer |
| 训练 | SFT、GRPO、GKD、LoRA |
| 并行 | TP、CP、DP、FSDP、Megatron |
| 硬件 | CUDA GPU、Ascend NPU |
| 推理 | vLLM、Transformers、ModelScope |
| 数据 | 模板、图像、视频、Packing 策略 |
Patch release 也可能改变模板、Packing 和 Loss 处理,因此仍应执行小规模训练回归,而不是仅确认安装成功。
05|OpenMV:视觉端新增 STM32N6 CAN、热成像和大模型 API 示例

图:OpenMV 官方嵌入式机器视觉演示。图片来源:OpenMV;版本事实来源:OpenMV Development Release。
发生了什么
OpenMV 于 8 月 11 日 03:14 更新 Development Release。
官方明确警告:
这是开发版本,可能不稳定。
主要变化包括:
- 启用 STM32N6 CAN;
- 增加 FLIR Lepton 3.1 和 UW 支持;
- 增加 PAG7936 安全关机处理;
- 增加 IMU Burst Read;
- 为 AE3 增加 SPI SD 卡支持;
- 增加 SX126x 驱动和 OpenMV HAL 兼容;
- 增加 OpenAI-compatible API 示例;
- 改进协议重新初始化和 MQTT SSL 延迟加载。
为什么重要
这次更新把端侧机器视觉的三个方向连接起来:
- 视觉和热成像感知;
- CAN、IMU、SD 卡、LoRa 等嵌入式接口;
- 通过 OpenAI-compatible API 接入云端或局域网模型。
典型应用可能包括:
- 热异常检测;
- 工业设备视觉巡检;
- CAN 总线设备诊断;
- 图像事件的自然语言解释;
- 本地检测与云端多模态分析结合。
风险与边界
开发版不能因为 Demo 能运行就直接替换量产固件。
尤其需要验证:
- STM32N6 CAN 与图像采集并发时的中断延迟;
- 热成像传感器初始化、校准和异常恢复;
- SD 卡掉电与文件系统损坏;
- API 超时、断网、限流和证书校验;
- 图片上传涉及的隐私和数据出境问题;
- 云端模型输出是否可能触发设备动作。
推荐结构仍然是:
本地感知 → AI 分析建议 → 确定性策略校验 → 受限执行
06|Surgical WAM:无动作视频开始被用于学习机器人控制

图:Surgical WAM 论文概览图。来源:arXiv:2608.11204。结果为作者报告,尚未独立复现。
研究做了什么
8 月 12 日 01:59 提交的预印本 Surgical WAM 提出一种手术机器人世界—动作联合模型。
其核心思路是:
- 先使用不带机器人动作标注的手术视频学习视觉动态;
- 再使用固定预算的动作标注数据进行微调;
- 模型同时预测未来内窥镜画面和机器人动作片段;
- 部署时只执行动作片段的短前缀;
- 根据新观察重新规划,形成闭环滚动控制。
作者报告的结果
在四个仿真手术操作任务中,作者报告平均成功率由 63.5% 提升到 77.8%;PegTransfer 任务获得 20 个百分点的绝对提升。
这些结果全部来自论文作者实验,而且是在仿真任务中取得,不能写成真实手术安全性或临床有效性结论。
为什么值得关注
机器人训练长期受限于动作数据成本:
- 普通视频很多;
- 同步采集的图像、关节、力、控制命令很少;
- 遥操作数据昂贵;
- 高风险领域的数据更难收集。
如果无动作视频能够提供可迁移的环境动态先验,机器人团队就可能用大量普通视频学习“世界如何变化”,再用较少动作数据学习“应该怎么做”。
尚未解决的问题
- 仿真到真实设备的迁移;
- 手术器械和组织差异;
- 接触力与触觉缺失;
- 长时误差累积;
- 异常状态和安全停止;
- 医疗验证与监管要求。
因此,这更像一条值得验证的数据路线,而不是已经成熟的临床方案。
07|XPolicyLab:机器人需要的不只是新模型,还需要统一接口

图:XPolicyLab 统一评测与部署框架。来源:arXiv:2608.09892。
研究做了什么
XPolicyLab 的 v2 于 8 月 12 日 01:41 提交。
论文认为,机器人策略评测长期被以下问题割裂:
- 每个模型使用不同的 Observation 格式;
- Action 表示不同;
- 轨迹、Reset、Batch 执行接口不同;
- 模型依赖与仿真环境依赖互相冲突;
- 接入 N 个模型和 M 个环境容易形成
O(N×M)的适配工作。
XPolicyLab 因此提出:
- 统一 Observation、Action 和 Trajectory Schema;
- 最小化策略适配接口;
- 使用客户端/服务端隔离模型与环境依赖;
- 同一适配器可连接仿真和真实机器人环境。
作者报告的规模
论文称其已集成 42 个机器人策略。
在作者的受控研究中,一个代表性策略的接入时间:
- 原始方式:超过 5 小时;
- 遵循统一接口:约 2 小时;
- 使用打包的 Agent Skills:约 30 分钟。
这些时间来自作者研究,不能视为所有团队和策略的普遍接入成本。
为什么重要
机器人领域现在有大量 VLA、Diffusion Policy 和世界模型,但不同论文的评测环境、数据格式和硬件接口并不统一,排行榜很难直接比较,复现成本也很高。
真正的生态拐点可能不是“再多一个高分模型”,而是:
同一策略可以在不同环境中复现,同一环境可以公平比较不同策略。
谨慎之处
XPolicyLab 目前提出的是一套开放标准与生态方案,还不是行业公认标准。后续需要观察:
- 社区外项目是否采用;
- Schema 如何版本化;
- 实时控制和网络延迟如何处理;
- 安全急停、权限和硬件约束如何表达;
- 不同机器人本体间的动作语义如何统一。
08|XCoT-VLA:自动驾驶推理不一定需要输出长篇文字

图:XCoT-VLA 可执行 Chain-of-Thought 框架。来源:arXiv:2608.10976。数据为作者报告。
研究做了什么
小鹏汽车团队在 8 月 11 日 22:33 提交 XCoT-VLA。
研究的出发点是:传统自然语言 Chain-of-Thought 过长,不适合实时驾驶控制。
因为长文本推理存在三个问题:
- 自回归解码耗时;
- 输出内容开放且难以约束;
- 文本理由与最终轨迹之间缺少直接执行关系。
XCoT-VLA 使用 2—6 个可执行 XCoT Token 表示驾驶推理,再由这些 Token 条件化轨迹查询并生成驾驶轨迹。
作者报告的结果
论文摘要报告:
- 一般分布数据中的纵向 ADE 从 1.645 降至 1.323;
- 变道场景的横向 FDE 从 1.616 降至 0.648;
- 推理保持在作者定义的实时规划预算内。
这仍是预印本中的作者实验结果,尚不能据此推导真实道路安全性。
为什么重要
对于实时系统,“能解释”与“能执行”并不是一回事。
自然语言推理适合:
- 人机解释;
- 事故复盘;
- 高层任务规划。
控制侧则更需要:
- 固定长度;
- 有限语义;
- 可验证;
- 能映射到轨迹和约束;
- 有确定的超时策略。
XCoT-VLA 的价值在于把中间推理表示从开放文本压缩为更接近控制接口的有限 Token。
对嵌入式与控制团队的启示
即使采用 VLA,系统也不应让模型直接输出最终执行器命令。更可靠的结构是:
视觉语义 → 有限策略 Token → 轨迹生成 → 安全约束 → 实时控制器
最后一层仍需 MCU、RTOS、车辆控制器和独立安全机制承担。
RTOS、芯片与基础大模型栏目说明
在本次严格 48 小时窗口内,没有发现满足以下全部条件的重大 RTOS 或嵌入式芯片新品:
- 官方一手发布;
- 具有明确的具体发布时间;
- 首次公开或出现实质更新;
- 对开发者具有足够技术信息;
- 发布时间落在统计窗口内。
因此,本期没有用较早的 Zephyr、LLVM、GCC、TF-M、Jetson 或 GPT-5.6 消息补位。
这正是滚动 48 小时规则的意义:宁可让某个栏目空缺,也不把旧闻包装成今日动态。
中文媒体与公众号线索核验
本次扫描了量子位、机器之心、InfoQ、雷峰网等中文科技媒体。
有几条处于媒体发布时间窗口内,但没有进入主新闻:
- 量子位 8 月 12 日报道了“紫东太初 GMC 核心集剪枝”,但其对应论文首次提交早于严格窗口,因此不作为本期新研究;
- 雷峰网报道了美的与千问 App 的 AIoT 接入线索,但检索时未找到可核验的企业技术公告,因此暂不把接入范围和能力写成确定事实;
- 雷峰网的机器人融资报道缺少企业一手公告,不把融资金额、产品进度和人员信息作为技术事实;
- 机器之心和 InfoQ 首页存在新内容,但部分条目缺少稳定正文或清晰的一手回链,未纳入主源。
中文媒体很适合发现选题和理解国内行业语境,但版本号、参数、基准、开源状态和安全结论仍应回到原始来源。
今日工程行动清单
- 检查项目是否直接或间接依赖 ONNX Runtime,评估 1.29 的安全修复。
- 使用 ONNX 外部权重时,增加目录限制、哈希和路径穿越测试。
- Web 推理项目开始评估从 WebGL/JSEP 迁移到 WebGPU。
- TensorRT-LLM rc24 只用于验证,不直接替换生产稳定版。
- 对低精度 MoE 和 CUDA Graph 组合增加准确率与长时间压力测试。
- 使用 Ultralytics 新 LLM 接口时,区分本地视觉推理与外部模型调用。
- ms-swift 升级后重新验证模板、Packing、Loss 和 NPU 并行行为。
- OpenMV Development Release 与产品固件分支保持隔离。
- 机器人策略项目建立统一 Observation、Action、Trajectory Schema。
- VLA 输出进入设备控制前,增加确定性约束、超时、急停和回放日志。
信源与时效说明
- 统计截止:2026 年 8 月 12 日 20:15,GMT+8。
- 有效窗口:2026 年 8 月 10 日 20:15—8 月 12 日 20:15。
- 本期共收录 8 个主题。
- 5 个软件动态来自官方 GitHub Release。
- 3 个研究动态来自 arXiv 原文,均标明为预印本和作者报告。
- Transformers 5.15 因发布时间早于窗口约 1 小时 47 分钟,被严格排除。
- 无精确提交时刻的端侧语音论文未纳入。
- 4 个主题配有直接相关的官方设备图或论文架构图,图片覆盖率 50%;图片链接发布前均复测为
HTTP 200 + image/*。 - 本期没有采用未经官方复核的媒体爆料、融资软文或传闻。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)