Agent 技术摘要 04 —— AI4S、VLM、VLA、VLN、WM、AI Infra
本系列为笔者在实习过程中的所见所闻记录,内容为技术摘要,旨在提供关于Agent领域相关技术名词的通俗和简要介绍,详细内容暂不展开,供同在该领域进修的童鞋们参考。
01 AI4S
全称是 AI for Science,用 AI 去帮科学家做研究,解决物理、化学、生物、气象等领域的地狱级难题。
场景 A:生物学
- 痛点:蛋白质是生命的基石,但预测蛋白质的 3D 折叠结构极其困难,传统方法测一个结构要几个月、花几百万。
- AI4S 奇迹:DeepMind 搞出了 AlphaFold,直接把人类已知的 2 亿多个蛋白质结构全部预测了一遍,准确率极高,它的发明人直接拿了 2024 年的诺贝尔化学奖!
场景 B:气象学
- 痛点:传统天气预报需要解极其复杂的流体力学偏微分方程,超算算几个小时,才能预测未来几天的天气。
- AI4S 奇迹:华为搞了盘古气象大模型,1 秒钟就能预测全球未来 7 天的天气,而且预测台风路径的精度比欧洲传统的物理超算模型还准!
场景 C:材料科学
- 痛点:找新型电池材料就像大海捞针,要在实验室里一次次试错。
- AI4S 奇迹:微软和太平洋西北国家实验室用 AI 筛选了 3200 万个候选材料,只用了几个星期,就发现了一种全新的固态电池材料N2116,并且已经造出了原型电池,如果是人类做,这得干几十年!
02 VLM
Vision-Language Model,视觉语言模型,核心是建立视觉信息与语言之间的关联。在当前生成式多模态大模型中,典型形式是:
pθ(y∣I,x)
p_\theta(y\mid I,x)
pθ(y∣I,x)
其中 I 是图像或视频,x 是文本指令,y 是生成的文本回答。常见架构是:
视觉编码器 → 跨模态连接模块 → 语言模型
视觉编码器把图像转换为特征,连接模块将其映射到语言模型能够处理的表示空间,再由语言模型结合指令生成结果。训练通常涉及图文对齐、文本生成,以及多模态指令微调。
03 VLA
Vision-Language-Action,视觉语言动作模型。VLA 把视觉和语言理解进一步连接到动作生成,在机器人场景中,可以把它理解为一个条件策略:
πθ(at∣o≤t, ℓ, st)
\pi_\theta(a_t\mid o_{\leq t},\,\ell,\,s_t)
πθ(at∣o≤t,ℓ,st)
其中:
o_t:当前及历史视觉观测
l:语言任务指令
s_t:机器人自身状态
a_t:要执行的动作
这里的动作通常有明确的控制语义,例如机械臂末端位移、旋转量、夹爪开合。训练常使用机器人示范数据,给定观察和指令,学习示范者采取的动作,即行为克隆。动作既可以离散化成 token,用类似语言模型的方式预测,也可以通过连续动作输出模块生成。
04 VLN
Vision-and-Language Navigation,视觉语言导航。智能体根据自然语言指令和沿途视觉观测,在环境中完成导航,它通常可以建模为部分可观测马尔可夫决策过程(POMDP),即智能体每一步只能看到局部环境,需要结合历史观测判断自己在哪里、指令执行到哪一步,以及下一步如何移动。这里的策略同样可以写成:
πθ(at∣o≤t, ℓ, st)
\pi_\theta(a_t\mid o_{\leq t},\,\ell,\,s_t)
πθ(at∣o≤t,ℓ,st)
但动作空间主要与导航有关,例如前进、转向、选择下一个可达位置、停止。VLN 的难点包括语言与空间目标的对应、历史记忆、路径规划和停止时机。评价通常关注任务成功率、导航误差,以及兼顾成功和路径效率的 SPL 指标。
05 WM
World Model,世界模型。在具身智能和基于模型的强化学习语境里,WM 的核心是学习环境如何随动作演化:
pθ(zt+1∣zt,at)
p_\theta(z_{t+1}\mid z_t,a_t)
pθ(zt+1∣zt,at)
这里 z_t 是环境状态或从观测中学习到的隐状态,模型预测在当前状态执行某个动作后,环境会转移到什么状态,某些世界模型还会预测奖励、终止信号或未来观测。世界模型可以在内部连续推演多步,形成 imagined rollout,供规划算法比较不同动作序列,或用于训练策略,它不一定生成可观看的视频,预测隐空间状态也可以实现这一目的。
06 AI Infra
AI Infra 是 AI Infrastructure 的缩写,指“人工智能基础设施”。 这个方向主要负责让模型的训练、推理和部署跑得更快、更稳定,消耗更少的计算与存储资源。
| 方向 | 主要解决的问题 | 典型工作 |
|---|---|---|
| 训练系统 | 模型如何高效地在多卡、多机上训练? | 优化并行策略、通信、显存占用和检查点恢复 |
| 推理系统 | 模型如何以较低成本响应大量请求? | 优化请求调度、批处理、KV Cache、量化和多卡推理 |
| 算子与编译器 | 模型内部的计算如何更高效地运行? | 用 CUDA/Triton 写 GPU kernel,做算子融合和编译优化 |
| 计算与集群平台 | GPU 资源如何分配、共享和稳定运行? | 任务排队、资源调度、容器管理、故障处理 |
| 机器学习平台 | 如何把实验、训练和上线流程标准化? | 构建训练流水线、模型版本管理、部署与监控 |
这类工作的成果经常体现为训练吞吐、推理延迟、显存占用、资源利用率、稳定性和单位请求成本。
如果 JD 强调 CUDA、Triton、C++、体系结构,通常更偏底层计算;强调 PyTorch、分布式通信和并行策略,更偏训练系统;强调 vLLM、KV Cache、请求调度,更偏推理系统;强调 Kubernetes、任务调度和平台后端,则更偏平台工程。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)