引言

当前主流具身智能研究存在一个根本性的方向误区:试图给机器装上一个“完美的摄像头”,再配一个“全知的模型”,仿佛只要算力够强、数据够多,机器就能看懂世界。但这条路忽略了一个最根本的事实——人眼的伟大,不在于它能看清一切,而在于它知道该忽略什么。

人眼从来不是一部被动的摄像机。它是由眼睛和大脑共同组成的主动建模系统。摄像机忠实记录每一帧,把信息一视同仁地写入存储;而人眼只在中央凹那一小块区域保持高分辨率,边缘视觉全是模糊的,快速扫视时还会主动抑制视觉信号输入,并在视线落定之前就预加载目标区域的预期信息。换句话说,人眼不是“拍摄”世界,而是在与大脑进行一场持续的“谈判”:用有限的带宽、有限的注意力,结合预装的世界模型,实时建构出一个稳定且有意义的视觉体验。

这正是主动感知的核心命题。具身智能若想真正走进物理世界,就不该执着于“看得更全”,而应该学会“看得更聪明”。

一、眼脑协同的神经机制与计算模型

1.1 中央凹视觉与非均匀采样策略

生物视觉系统采用的中央凹视觉(foveated vision)策略,是效率设计的精髓。视网膜中心区域具有高密度的感光细胞,周边区域分辨率逐渐降低。这种非均匀采样大幅减少了需要处理的数据量,同时保持了对关键区域的精细感知。

这个设计有多极端?黄斑区仅占视网膜面积的 0.01%,却汇聚了约 70% 的感光细胞:中央凹的极限分辨力相当于 600 dpi,而周边视野只有约 15 dpi。如果把手指伸到眼角,我们甚至只能感知到一个模糊轮廓。用每度像素数(PPD)来衡量时,这种差异更加直观——传统上认为人眼分辨率约为 60 PPD,但最新实验发现:黑白图像的平均分辨率可达 94 PPD,红绿相间图案降到 89 PPD,而黄紫相间图案的极限更骤降至 53 PPD。这说明大脑其实并不擅长处理色彩细节,眼睛更像一个普通传感器,真正负责“后期渲染”的是大脑。

在机器人实现中,注视点控制通常通过云台相机、机械臂末端执行器或移动平台的运动来实现。Gaskett 等人开发的闭环注视控制系统使用 10 个自由度(4 个眼部自由度、3 个头部自由度、3 个躯干自由度)协同工作,将目标维持在视野中心。它采用级联 PD 控制器网络,基于视觉坐标与关节角度之间的简化映射关系,而非完整的运动学模型。这种设计让系统对机械磨损和维护活动具有很好的鲁棒性——再一次印证:好的主动感知不追求完美模型,而追求在变化中持续可用。

1.2 眼动模型:扫视、平滑追踪与注视

眼动模式可分为平滑追踪、扫视和注视三种基本类型。平滑追踪用于跟踪移动目标,保持目标在视网膜上的稳定成像;扫视是快速的视线跳跃,把注视点从一个兴趣区域转移到另一个;注视则是相对静止的观察状态,用于详细分析目标特征。在具身智能体中,这些眼动模式需要与身体运动协调,形成层次化的感知策略。

值得注意的是,即使在我们“凝视”某个物体时,眼睛也并没有真正静止。每秒 3~4 次的微小抖动(幅度小于 0.2 度)才是视觉清晰的关键。没有这种微眼动,视网膜感光细胞会因为持续刺激而疲劳,图像会在约 0.1 秒内褪色成灰影——这就是 20 世纪 50 年代被证实的 Troxler 效应。大脑需要不断用微眼动刷新图像,否则我们看到的将是一片空白。

这一点对机器人学的启发是:主动视觉不是“把相机对准目标”就结束了,而是要通过眼动、头动和身体移动持续获取信息。机器人学中的主动视觉系统,通过控制相机位姿、调节光学参数或移动观察平台来实现类似功能。而这个“主动”二字,恰恰是当前大多数 AI 视觉系统最缺乏的。

1.3 信息论视角的主动感知

信息论为主动感知提供了形式化的优化框架。在这个视角下,感知动作的选择被建模为信息增益最大化问题:智能体评估候选观察动作对降低状态估计不确定性的贡献,然后选择最优感知策略。信息增益定义为当前状态不确定性与预期未来不确定性之差,因此最大化信息增益等同于选择最能降低状态估计方差的观察动作。

在主动定位任务中,信息论方法已被证明优于基于几何启发式的策略。通过最大化 Fisher 信息或最小化熵,机器人可以选择最优相机位姿来减少位姿估计的不确定性。这种方法特别适用于多机器人协作场景——团队成员需要协调各自的观察动作,以最大化联合信息增益。它把“看哪里”从一个工程直觉问题,变成了一个可以被形式化求解的优化问题。

1.4 下一最佳视图规划

下一最佳视图(Next Best View, NBV)规划,是主动视觉在三维重建和物体识别中的具体应用。给定当前的部分观察,NBV 算法需要确定下一个最优相机位姿,以最大化重建质量或识别准确率。NBV 规划面临三个关键挑战:候选视角的生成、信息增益的预测,以及运动成本的权衡。

在物体识别任务中,McGreavy 等人提出的方法结合在线视角图和特征可见性分析,在 82.5% 的情况下成功找到了能完成物体识别的视角,并能在 85% 的试验中处理视觉遮挡。在抓取任务中,Breyer 等人开发的闭环 NBV 规划框架,与固定相机基线相比,在保持相似成功率的同时将搜索时间缩短了约 40%。

更有意思的是,强化学习为主动视觉提供了端到端的学习框架。Shang 等人提出的 SUGARL 框架通过内在感知运动奖励,解决感知策略与运动策略的协调问题。学习出的感知策略竟然展现出类似人类注视和追踪的主动视觉技能。这印证了一个道理:与其硬编码“看哪里”的规则,不如让机器在与环境的交互中,自己学会“怎么看”。

下面是主动感知闭环的整体示意:

当前观察

状态估计

不确定性评估

候选观察动作

信息增益预测

执行最优观察动作

二、注意力机制的计算范式

2.1 自下而上与自上而下注意力

注意力机制可分为自下而上(刺激驱动)和自上而下(目标驱动)两种类型。自下而上注意力由感知输入的显著性特征触发,例如颜色对比、运动或纹理变化,它自动、快速,不依赖当前任务目标。自上而下注意力则由当前任务需求和内部目标引导,主动搜索与任务相关的特征。

传统观点将两者视为独立系统,但最新研究提出了统一框架:注意力选择源于单一系统在不同时间尺度上的表达,可以识别出三个时间尺度的优先级——进化形成的生存需求、学习获得的价值偏置,以及即时的任务需求。在具身智能体中,注意力策略应当整合本能反应(如对快速接近物体的警觉)、学习到的关联(如工具与任务目标的联系)和当前意图(如搜索特定物体)。这种整合让智能体能够在动态环境中平衡反应性与目标导向行为。

2.2 空间注意力与通道注意力

空间注意力机制通过生成二维注意力图来强调图像中的关键区域,使机器人能够聚焦于操纵目标、导航路标或交互对象,忽略背景干扰。通道注意力则关注特征通道的重要性,学习为不同通道分配权重,增强与当前任务相关的特征通道。它在处理多模态感知时尤为重要,能够自动选择最可靠的感知通道。

空间注意力与通道注意力的结合形成了混合注意力机制,典型的实现采用顺序或并行的方式应用两种注意力。以 CBAM(Convolutional Block Attention Module)为例,它先通过通道注意力选择关键特征通道,再应用空间注意力定位关键区域。这种混合策略在视觉导航、物体抓取和场景理解任务中均表现出优越性。

2.3 自注意力与 Transformer

自注意力机制通过计算特征之间的相互关系来捕获全局依赖。与卷积神经网络的局部感受野不同,自注意力允许每个位置直接关注所有其他位置,形成全局上下文感知。在具身智能中,Transformer 被用于视觉导航、多智能体协作和视觉语言任务,其优势在于能够建模长距离依赖,例如房间之间的空间关系、时间序列中的动作依赖,或多模态特征之间的对应关系。

然而,自注意力的计算复杂度与序列长度呈二次关系,这对资源受限的具身系统构成挑战。近期的研究通过稀疏注意力、线性注意力或分层注意力来降低计算成本。在一个服务机器人导航项目中,对相邻 patch 施加局部注意力约束——在计算 QKᵀ 时添加一个距离衰减系数——可以显著提升对连续墙面和走廊的识别稳定性。

2.4 跨模态注意力

跨模态注意力机制处理来自不同感知通道的信息融合。具身智能体通常配备多种传感器,跨模态注意力让这些异构数据能够在共同的空间中交互。典型实现采用查询-键-值结构:一个模态的特征作为查询,另一个模态的特征作为键和值,通过计算查询与键之间的相似度确定两个模态特征之间的对应关系,再基于相似度加权融合值特征。

在自动驾驶场景中,跨模态注意力被用于融合相机图像和激光雷达点云。系统利用图像的高分辨率纹理信息增强点云的语义理解,同时利用点云的精确深度信息补偿图像在远距离处的信息损失,在远距离目标检测上显著优于单模态方法。

三、多模态融合与脑体同构

3.1 TVA:从被动特征提取到主动决策核心系统

传统机器人学的“感知-规划-控制”分块式架构,从根本上违背了具身智能的脑体协同本质。AI 智能体视觉(TVA)的出现,是对这一结构性鸿沟的彻底重构。TVA 不仅是视觉感知的升级,更是贯穿感知、认知与动作的“主动决策核心系统”。

TVA 的架构映射了具身认知理论。视觉输入不再被孤立地分类,而是与语言指令、本体感受(关节角度)、力觉反馈共同输入到同一个 Transformer 网络中。视觉信息在 Self-Attention 机制下与其他模态深度交互,其表征不再是静态的语义,而是与当前任务和物理状态高度耦合的“具身状态”。TVA 不仅“看”到了物体,更“懂”得如何与该物体交互。

TVA 作为智能体,具备主动感知能力。它不依赖固定的光照与视角,而是能根据当前任务的不确定性(预测误差),主动驱动相机云台的角度、焦距甚至外部光源变化,以获取关键信息。Transformer 的 Self-Attention 机制在其中扮演着“物理交互焦点转移”的角色——当机械臂接触物体的瞬间,力觉 Token 的突变会瞬间提升相关视觉区域的权重,使网络聚焦于接触点的微观形变。这种基于物理反馈的动态聚焦,正是生物系统生存的核心机制。

3.2 Thinker 模型的分层视觉编码

上海人工智能实验室、香港中文大学和斯坦福大学联合发表的 Thinker 模型,采用三级视觉处理架构:像素级编码使用改进的 ConvNeXt 提取局部几何特征(如物体边缘、纹理);物体级编码通过可学习的 slot attention 机制动态分配视觉 token;场景图编码实时构建以物体为节点、空间关系为边的图结构。这种分层处理让模型在抓取细小物体时能关注局部细节,在导航时又能理解整体空间关系。其抓取成功率提升了 41%,而计算开销仅增加 15%。

Thinker 模型的核心突破在于语言理解和动作预测的共享表示空间。通过跨模态对齐损失,视觉特征和语言嵌入在向量空间中保持几何一致性;同时将动作空间分解为位移、旋转、抓取等子任务,执行动作后通过残差连接调整后续预测。这种设计让模型在理解“把杯子移到桌子左侧”这类指令时,能自动将“左侧”的语言描述转化为具体的移动方向和距离参数,物体摆放位置精度达到 ±2cm。

3.3 混合时序记忆:陶大程的三层记忆结构

陶大程在技术博客中提出的开悟世界模型,引入了混合时序记忆(Hybrid Temporal Memory)机制,这是针对长时具身任务的关键设计。他指出,具身智能的长时任务,关键从来不是“看过多少历史画面”,而是持续维护好一个对控制充分的内部状态。它不需要完整保留每一刻的视觉像素细节,只需要牢牢记住那些会影响后续动作选择、风险判断和任务推进的核心信息。

这些控制相关的信息分布在截然不同的时间尺度上:毫秒到秒级,是接触、滑动、碰撞等瞬间交互的手眼协调控制;秒到分钟级,是子任务进度、物体位置、工具状态的中程维护;分钟到小时级,是全局任务计划、环境变化、用户偏好的长期统筹;小时到天级,是场景规律、失败历史、个体化经验的沉淀。单一扁平的记忆结构很难同时兼顾极致的响应速度、精准的状态跟踪和稳定的长期记忆。

神经科学中的互补学习系统理论指出,人类大脑通过多套功能各异的神经环路协同工作——新皮层沉淀通用语义与物理常识,海马体编码具体情景事件,小脑构建短时前向预测模型。这套多环路协同机制,让大脑既能毫秒级响应环境变化,又能稳定积累长期知识,还能精准控制躯体动作。受此启发,开悟世界模型将时间结构拆解为 SWA(局部窗口注意力)和 DSWA(扩展窗口注意力)等层次,让不同时间尺度的控制信息各归其位、协同运转:

混合时序记忆

SWA 局部窗口注意力

DSWA 扩展窗口注意力

短时前向预测:毫秒~秒级

情景记忆串联:秒~分钟级

长期统筹:分钟~小时级

经验沉淀:小时~天级

四、前沿趋势与挑战

4.1 计算开销与轻量化

Transformer 类注意力模型的计算量是当前最大的瓶颈。自注意力操作的时间复杂度随序列长度呈平方增长,对实时性要求高的机器人应用构成挑战。在资源受限的嵌入式设备上部署注意力模型时,已经探索出多种优化策略:分组注意力,将特征通道分组后分别计算注意力,减少矩阵运算量;空间下采样,先在下采样后的特征图上计算注意力,再上采样应用到原分辨率;注意力共享,对连续帧视频每隔 N 帧计算一次完整注意力,中间帧通过运动估计推导注意力图。

4.2 可解释性与注意力可视化

注意力热图可视化是最直接的诊断工具。通过 Grad-CAM、Attention Rollout 等可视化方法,开发者可以直观理解模型“在看哪里”。调试注意力模型时,常见问题包括:注意力过度集中在无关纹理、对遮挡物体的注意力衰减过快、多物体场景下的注意力分配不均。对应的解决方案包括在损失函数中添加注意力多样性约束,对遮挡边界处的注意力进行特殊处理,以及引入基于物体数量的注意力权重归一化。

4.3 脉冲神经网络与生物可塑性注意力

新兴的脉冲神经网络(SNN)为注意力机制带来了新思路。基于脉冲的注意力模型具有事件驱动的异步处理特性——仅对变化区域更新注意力,更接近生物神经元的累积-发放机制,并通过可塑性连接权重实现自适应注意力调整。在初步实验中,这种模型在功耗敏感的应用场景(如无人机视觉)展现出优势,处理动态场景的能效比传统方法高 3-5 倍。

4.4 注意力机制的自我进化

另一个有趣方向是让注意力机制能够自我进化。双时间尺度的学习框架——快速学习在单个任务中调整注意力参数,慢速学习通过元学习优化注意力架构本身——使系统能逐步发展出适合特定场景的注意力模式。例如在长期部署的清洁机器人中,系统逐渐学会了优先关注地板上的典型污渍类型,而减少对固定家具的关注。这才是真正意义上的“越用越会用”。

五、结语

回到开篇的那句话:真正的视觉不是“记录”,而是“理解”;不是“拍摄”,而是“对话”。

当前具身智能领域不少做 AI 视觉的工作,以为给机器装个摄像头、跑个目标检测算法,就算“看懂”了。但他们没有意识到,人眼的伟大不在于它能看清一切,而在于它知道该忽略什么。注意力机制本质上是动态权重分配系统,它让机器人能够像人类一样“有的放矢”地处理信息。

未来的具身智能,不应该执着于打造一个全知全能的摄像头和世界模型。它应该学习的,是人眼那种主动建模、动态聚焦、按需采样、随时丢弃的活系统。真正的效率,不是来自无限的算力堆砌,而是来自知道该把算力用在什么地方。

人眼分辨率是有下限的,它不会像摄像机那样均匀地记录画面中的每一个像素。当你看向一张照片时,眼睛只捕捉其中最重要的几个点——人脸的表情、文字的轮廓、明暗的交界。至于那些平滑的渐变区域、均匀的色块、重复的纹理,眼睛并没有“看清”它们,而是大脑主动把它们补充了上去。那些细微的锯齿、传感器带来的噪点、边缘的模糊,视觉系统会自动将它们无视。

视网膜上还有一个没有感光细胞的盲点,但我们从来不会感觉视野里破了一个洞,因为大脑会自动用周围信息把它填上;黄昏时分,一张白纸在橙色灯光下物理上反射的是橙色光,但大脑仍然把它“解释”为白色,因为大脑知道这张纸是白的。你不是“看到”了一张完整的照片,你是建构出了一张完整的照片。

所以,真正的效率,不是把所有的信息都处理掉,而是只处理那些最重要的信息,然后把剩下的,交给大脑去补完。

参考文献

  • 具身智能:原理、算法与系统(第9章 主动感知与注意力),CSDN 博客,2026/02/21
  • 具身智能模型评测:从感知到执行,中国图象图形学报
  • 陶大程技术博客首发:从像素复刻到行动控制,具身世界模型的底层逻辑探索,甲子光年,2026/07/02
  • TVA 与具身智能融合的内在必然性,CSDN 博客,2026/07/05
  • 具身智能中的注意力机制:原理与应用,2026/06/29
  • 融合认知科学与机器人学的具身智能计算范式探析,2026/05/04
  • Thinker 模型:具身智能的视觉-语言联合建模突破,2026/07/28
  • 具身智能中的视觉注意力机制原理与实践,CSDN 博客,2026/07/04
  • 具身智能的“火眼金睛”:注意力机制全解析,CSDN 博客,2026/03/11
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐