LocateAnything深度解析:NVIDIA并行框解码如何让视觉定位快10倍

LocateAnything:NVIDIA并行框解码技术,让视觉定位同时快10倍且更精准
一个服务机器人在杂乱的客厅里穿行,它需要在几十毫秒内同时识别出椅子、桌子、杯子、散落的玩具和人的位置,才能规划安全的行走路径;一个GUI自动化Agent需要在一秒内定位屏幕上的几十个可交互元素,才能快速完成操作;一个文档AI系统需要在高分辨率扫描件中同时框出数百个文字区域、表格和图表,才能进行结构化解析——这些场景的共同需求是:快速、精准、同时检测大量物体。
然而,当前主流的视觉大模型(VLM)在做目标检测和定位时,都面临一个共同的瓶颈:它们把边界框的四个坐标(x1, y1, x2, y2)当作普通文本token,一个一个地串行生成。检测一个物体需要4步,检测100个物体需要400步——自回归的时序依赖彻底锁死了推理速度,而且逐token生成还容易破坏框的几何一致性,产生畸形框和坐标偏移。
2026年5月,NVIDIA研究院联合香港理工大学、普林斯顿大学、南京大学和UIUC发布了LocateAnything——一个3B参数的视觉语言定位模型,其核心创新并行框解码(Parallel Box Decoding, PBD)彻底改变了这一格局:把每个边界框当作一个原子单元,在单步内同时预测四个坐标,既释放了并行算力,又天然保证了框的几何一致性。在H100上,LocateAnything达到12.7 boxes/sec的吞吐量,比基于文本解码的Qwen3-VL快约10倍,比量化坐标解码的Rex-Omni快2.5倍,同时在LVIS、ScreenSpot-Pro、M6Doc等多个基准上取得了SOTA性能。
本文将从LocateAnything要解决的核心问题出发,深入拆解并行框解码的技术原理、模型架构、三种推理模式、大规模训练数据、全面的性能基准和消融实验,以及其在机器人、GUI Agent、文档AI等场景的落地价值,帮你完整理解这个可能改变视觉定位范式的技术突破。
一、LocateAnything是什么:3B参数的统一视觉定位模型
1.1 基本信息
|
项目 |
详情 |
|
论文标题 |
Locate Anything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding |
|
arXiv编号 |
2605.27365 |
|
发布时间 |
2026年5月26日 |
|
研发机构 |
NVIDIA研究院 + 香港理工大学 + 普林斯顿大学 + 南京大学 + UIUC |
|
通讯作者 |
Zhiding Yu(NVIDIA) |
|
模型名称 |
LocateAnything-3B |
|
总参数量 |
3B |
|
视觉编码器 |
MoonViT-SO-400M(MIT许可证,原生分辨率最高2.5K) |
|
语言模型 |
Qwen2.5-3B-Instruct(阿里巴巴) |
|
投影器 |
2层MLP |
|
代码许可证 |
Apache 2.0 |
|
权重许可证 |
NVIDIA许可证 |
|
开源仓库 |
GitHub: NVlabs/Eagle |
|
模型下载 |
HuggingFace: nvidia/LocateAnything-3B |
|
在线Demo |
HuggingFace Space: nvidia/LocateAnything |
1.2 核心定位
LocateAnything是一个统一的生成式视觉定位与检测框架,在单一视觉语言模型下支持多种定位任务:
- 开放集与长尾目标检测:检测任意自然语言描述的物体类别,不受训练类别限制;
- 密集多目标检测:在杂乱场景中同时检测大量重叠物体;
- 短语与指代表达定位:根据复杂自然语言描述(如"穿红色衣服站在车门旁的人")定位对应物体;
- GUI元素定位:定位屏幕上的图标、按钮、文本框等可交互元素,服务于Agent系统;
- OCR文字定位:精准框出图像中的文字区域;
- 文档布局定位:解析文档中的标题、段落、表格、图表等布局元素;
- 基于点的定位:输出物体的关键点坐标,实现更细粒度的空间定位。
与Grounding DINO等专用检测器不同,LocateAnything是一个真正的VLM-native检测模型——它基于标准的视觉语言模型架构(视觉编码器+MLP投影器+语言解码器),通过创新的解码方式实现检测,而不是在VLM之外额外添加检测头。这意味着它天然具备VLM的自然语言交互能力,可以理解复杂的查询描述,同时又能输出标准的检测框。
要理解LocateAnything的创新价值,首先需要理解当前VLM做检测时面临的根本问题。
2.1 坐标token化:把几何问题变成文本问题
当前几乎所有具备检测能力的VLM(包括Qwen-VL、InternVL、Molmo、Shikra等),都采用同一种方式输出边界框:把框的四个坐标(x1, y1, x2, y2)量化为离散的token,然后像生成普通文本一样,一个token一个token地串行生成。
例如,要输出一个框,模型需要依次生成:<box> → x1 → y1 → x2 → y2 → </box>,共6个token。检测10个物体需要60步,检测100个物体需要600步。
2.2 速度瓶颈:自回归的时序依赖
自回归解码的本质是:每一步的输出都依赖于前面所有步的输出,无法并行。这意味着:
- 检测N个物体需要至少4N步解码(每个框4个坐标token);
- 物体越多,延迟线性增长,在密集场景(如航拍图像、拥挤人群、文档OCR)中延迟不可接受;
- GPU的并行算力无法充分利用——每一步只能生成一个token,大部分计算单元在等待。
实验数据显示,基于文本解码的Qwen3-VL在H100上只能达到1.1 boxes/sec的吞吐量,而即使是优化过的量化坐标解码方法Rex-Omni也只能达到5.0 boxes/sec。
2.3 精度瓶颈:几何一致性的破坏
逐token解码不仅慢,还会破坏边界框的几何一致性:
- 畸形框:x1和x2独立生成,可能出现x1 > x2(框宽度为负)的情况;
- 坐标偏移:四个坐标各自独立预测,没有利用它们之间的几何约束关系,导致定位精度下降;
- 错误传播:前面的坐标token生成错误,会影响后续token的生成,错误逐级放大;
- 虚假相关性:模型需要拟合大量不可靠的坐标token模式,诱导出虚假相关性,牺牲结构化解码能力。
这些问题在高IoU阈值(IoU>0.8、IoU>0.9)下尤为明显——逐token生成的框很难达到像素级的精准定位。
2.4 矛盾的根源
问题的根源在于:边界框是一个耦合的几何结构,但逐token解码把它拆成了四个独立的1D序列。这种拆分与框的几何本质不匹配——四个坐标不是独立的,它们共同定义了一个矩形区域,存在严格的几何约束(x1 < x2, y1 < y2)。把耦合的几何结构拆成独立的token序列,既损失了几何一致性信息,又引入了不必要的时序依赖。
LocateAnything的核心洞察正是:既然边界框是一个不可分割的几何单元,为什么不把它当作一个原子单元,在一步内同时预测整个框?
三、核心创新:并行框解码(Parallel Box Decoding, PBD)

并行框解码PBD vs 自回归解码:PBD将整个框作为原子单元单步并行预测,速度提升10倍且几何一致性更强
3.1 核心思想:框对齐的原子单元
并行框解码的核心思想非常直观但极具颠覆性:把每个边界框(或点)当作一个固定长度的原子单元,在单次前向传播中同时预测完整的坐标集(x1, y1, x2, y2),而不是把坐标拆成独立的token逐个生成。
具体实现上,LocateAnything定义了一个长度为L=6的"框块"(box block),结构为:<box> x1 y1 x2 y2 </box>。在训练和推理时,模型不是逐个预测这6个token,而是把整个框块作为一个预测单元,在一步内同时输出这6个token的值。
这就像从"一个字一个字地写地址"变成了"一次性打印整张地址标签"——前者需要多步串行操作,后者一步完成,而且地址的各个部分(街道、城市、邮编)作为一个整体被生成,天然保证了结构的完整性。
3.2 技术实现:MTP与框对齐
并行框解码的技术基础是多token预测(Multi-Token Prediction, MTP)——一种在大语言模型中已经被探索的技术,允许模型在单步内预测多个未来token。但普通的MTP是结构无关的(structure-agnostic),它只是简单地预测接下来的N个token,不关心这些token之间的结构关系。
LocateAnything的关键创新是框对齐的MTP(Box-Aligned MTP):将MTP的预测块与边界框的几何结构对齐。具体来说:
- 框块对齐:每个MTP预测块的起始位置严格对齐到框的开始(<box> token),块的长度严格等于一个完整框的token数(L=6)。这样每个预测块恰好对应一个完整的边界框,不会出现一个框被拆到两个预测块中的情况;
- 联合训练:模型同时训练两种解码方式——并行框解码(MTP,用于快速推理)和自回归解码(NTP,Next Token Prediction,用于高精度推理)。两种方式共享同一套模型参数,通过联合训练让模型同时具备并行和串行解码的能力;
- 框内几何一致性:由于四个坐标在同一步内联合预测,模型可以天然地学习它们之间的几何约束关系(如x1 < x2),从根源上减少畸形框和坐标偏移。
3.3 PBD的三大优势
优势一:吞吐量大幅提升
消除了自回归的时序依赖后,每个框只需要一步解码,而不是四到六步。在H100上,LocateAnything达到12.7 boxes/sec的吞吐量,比基于文本解码的Qwen3-VL(1.1 BPS)快约10倍,比量化坐标解码的Rex-Omni(5.0 BPS)快2.5倍。在密集场景中(目标框从20个增加到300个),PBD的吞吐量从12 BPS扩展到约25 BPS,而自回归方法则遭遇严重的延迟瓶颈,PBD实现了2倍到6倍的加速比。
优势二:定位精度显著提升
框对齐的原子单元预测让模型直接学习完整边界框的特征,天然建模四个坐标的空间约束关系。实验证明,PBD对高IoU阈值的精细定位提升最为显著:在LVIS基准上,IoU=0.95时LocateAnything达到31.1 mean F1,而Rex-Omni只有20.7,提升了10.4个百分点。在COCO消融实验中,PBD(Slow Mode)达到52.1 F1,证明框对齐的表述比1D序列化提供了更强的监督信号。
优势三:结构化输出更可靠
由于每个框块作为整体预测,模型不会生成不规则的结构token(如缺少</box>结束符、坐标数量不对等格式错误)。这大幅减少了后处理的复杂度和错误率,输出的检测框格式更加规范、可靠。
3.4 消融验证:PBD确实有效
论文在COCO数据集上进行了详尽的消融实验,验证了PBD各个设计选择的有效性:
- 坐标表示对比:PBD(Slow Mode)达到52.1 F1,高于1D序列化方法,证明框对齐的表述提供了更强的监督信号;
- PBD vs 结构无关MTP:PBD达到16.9 BPS,而结构无关的MTP方法(SDLM-B6)只有5.5 BPS,同时PBD的F1更高。这说明框对齐是关键——简单的多token预测不够,必须与框的几何结构对齐;
- 联合训练的效果:联合双表述训练将Slow Mode的上限从50.1 F1提升到52.1 F1,Hybrid Mode在保持13.2 BPS高速的同时达到51.6 F1;
- 框排序策略:对比了四种空间排序策略,X-Y角点排序(X-Y Corner Order)取得最高的F1分数;
- 吞吐量扩展性:目标框从20增加到300时,NTP方法延迟严重,PBD实现2-6倍加速,吞吐量从12 BPS扩展到约25 BPS。
四、模型架构:MoonViT + Qwen2.5 + MLP的简洁组合

LocateAnything模型架构:MoonViT视觉编码器→MLP投影器→Qwen2.5语言解码器→并行框解码PBD
LocateAnything的架构本身并不复杂——它没有设计全新的视觉编码器或语言模型,而是巧妙地组合了已有的优秀组件,把创新集中在解码方式上。这种"架构简洁、解码创新"的设计思路,使得模型易于复现和部署。
4.1 视觉编码器:MoonViT-SO-400M
来源:MoonViT是月之暗面(Moonshot AI/Kimi)开发的视觉Transformer,采用MIT许可证开源。
参数量:400M
核心特点:
- 原生分辨率支持:MoonViT支持原生分辨率输入,最高可达2.5K,不需要像传统ViT那样强制resize到固定尺寸(如224×224或336×336)。这对于高精度定位至关重要——高分辨率输入保留了更多的细粒度空间细节,小目标和文字区域的定位更精准;
- 高效的视觉特征提取:MoonViT在视觉特征提取效率和质量之间取得了良好平衡,400M的参数量对于3B的总模型来说比例合理,既保证了视觉特征的质量,又不会过度占用计算资源;
- MIT许可证:宽松的开源许可证,允许商业使用,降低了部署的法律风险。
4.2 多模态投影器:2层MLP
LocateAnything使用一个简单的2层MLP(多层感知机)作为多模态投影器,将MoonViT输出的视觉token映射到Qwen2.5语言模型的输入维度空间。
这种设计延续了LLaVA-1.5以来的标准范式——简单的MLP投影器在端到端微调的范式下已经足够有效,复杂的Q-Former或交叉注意力连接器反而可能成为信息瓶颈。MLP投影器的参数量很小,训练和推理的额外开销可以忽略不计。
4.3 语言解码器:Qwen2.5-3B-Instruct
来源:阿里巴巴通义千问团队开发的开源大语言模型。
参数量:3B
核心特点:
- 指令跟随能力强:Instruct版本经过了高质量的指令微调,能够准确理解复杂的自然语言查询,包括"检测所有穿红色衣服的人"、"定位文档中的所有表格"等复杂指令;
- 中英文双语支持:Qwen2.5在中英文上都有优秀的表现,适合需要处理中文查询的场景;
- 3B参数的效率优势:3B参数在能力和推理效率之间取得了良好平衡,可以在单张消费级GPU上运行,也适合端侧和边缘部署;
- 成熟的生态:Qwen2.5有完善的工具链、推理框架和社区支持,部署和微调的门槛低。
4.4 架构总览
|
组件 |
型号 |
参数量 |
来源 |
许可证 |
|
视觉编码器 |
MoonViT-SO |
400M |
月之暗面/Kimi |
MIT |
|
多模态投影器 |
2层MLP |
极小 |
LocateAnything |
Apache 2.0 |
|
语言解码器 |
Qwen2.5-3B-Instruct |
3B |
阿里巴巴 |
Qwen Research License |
|
解码方式 |
并行框解码PBD |
— |
LocateAnything(核心创新) |
Apache 2.0 |
|
总参数量 |
— |
~3B |
— |
— |
值得注意的是,LocateAnything的创新不在架构组件,而在解码方式。这种设计哲学的优势是:①可以直接复用成熟的视觉编码器和语言模型,不需要从零训练;②模型易于复现和部署,社区可以快速跟进;③未来可以轻松升级到更强的视觉编码器(如更大的MoonViT)或语言模型(如Qwen2.5-7B),只需要保持PBD解码方式不变。
LocateAnything的另一个精心设计是提供了三种推理模式,让用户可以根据具体场景在速度和精度之间灵活选择。这三种模式共享同一套模型参数,通过不同的解码策略实现不同的速度-精度权衡。
5.1 Fast Mode(快速模式,MTP)
解码方式:完全使用并行框解码(MTP),每个框在一步内预测完成。
适用场景:延迟和计算资源受限的场景,如端侧机器人、具身Agent、实时监控、自动驾驶感知等需要低延迟响应的应用。
性能特点:吞吐量最高,在H100上达到12.7+ boxes/sec。对于大多数常规检测任务,Fast Mode的精度已经足够,但在格式不规则或空间模糊的极端情况下可能出现错误。
5.2 Slow Mode(慢速模式,NTP)
解码方式:完全使用自回归解码(NTP, Next Token Prediction),逐个token生成坐标,与传统VLM的检测方式相同。
适用场景:对精度要求极高的场景,如高精度数据标注、数据集构建、离线评估、医疗影像分析等需要最高定位精度的应用。
性能特点:精度最高,在COCO消融实验中达到52.1 F1(高于Fast Mode和Hybrid Mode)。但速度较慢,因为每个框需要多步自回归解码。
5.3 Hybrid Mode(混合模式,默认)
解码方式:默认使用Fast Mode(MTP)并行解码,当检测到格式不规则或空间模糊时,自动回退到Slow Mode(NTP)对有问题的框进行重新解码,然后再切回Fast Mode。
适用场景:大多数实际应用场景,既需要高速推理,又需要在困难情况下保证可靠性。这是LocateAnything的默认推理模式。
性能特点:在保持大部分速度优势的同时,保证了输出的鲁棒性。在H100上达到12.7 boxes/sec的吞吐量(Hybrid Mode),同时在所有基准上取得了最优或接近最优的精度。
5.4 纠错NTP重解码机制
Hybrid Mode的核心是纠错NTP重解码(Corrected NTP Re-decoding)机制。当并行解码遇到以下两种问题时,会触发回退:
- 格式不规则(Format Irregularity):在类别边界处出现语法错误,如缺少</box>结束符、坐标数量不对、框块结构不完整等;
- 空间模糊(Spatial Ambiguity):在密集排列的物体之间出现中间坐标不确定的情况,如两个物体靠得太近,模型难以确定边界框的精确位置。
当检测到这些问题时,LocateAnything会:①丢弃有问题的框块;②将生成状态回退到上一个已验证的前缀;③使用NTP自回归方式逐token重新生成有问题的框块;④完成后切换回MTP并行模式继续解码后续框。
这种机制的精妙之处在于:只有真正有问题的少数框才需要慢速的自回归解码,绝大多数常规框都可以享受并行解码的速度优势。这使得Hybrid Mode在保持高速的同时,避免了并行解码在极端情况下的可靠性问题。
5.5 三种模式对比
|
维度 |
Fast Mode (MTP) |
Slow Mode (NTP) |
Hybrid Mode (默认) |
|
解码方式 |
全并行框解码 |
全自回归解码 |
并行+自动回退自回归 |
|
吞吐量(H100) |
最高(16.9 BPS) |
最低 |
高(12.7-13.2 BPS) |
|
精度(COCO F1) |
~51.6 |
最高(52.1) |
~51.6 |
|
可靠性 |
极端情况可能出错 |
最高 |
高(自动纠错) |
|
适用场景 |
实时、端侧、低延迟 |
高精度标注、离线评估 |
大多数实际应用 |
|
vs Qwen3-VL速度 |
~15x |
~1x |
~10x |
六、训练数据:LocateAnything-Data,1.38亿查询与7.85亿框
高质量的大规模训练数据是LocateAnything取得优秀性能的另一个关键因素。NVIDIA团队构建了一个可扩展的数据引擎,精心策划了LocateAnything-Data——一个覆盖多种定位任务的大规模多领域数据集。
6.1 数据规模
|
指标 |
数量 |
|
唯一图像数 |
1200万(12M) |
|
语言查询数 |
1.38亿(138M) |
|
边界框数 |
7.85亿(785M) |
|
标注方式 |
人工标注 + Qwen3-VL/Molmo/SAM 3自动标注 |
|
覆盖领域 |
自然场景、机器人、自动驾驶、GUI交互、文档理解、OCR等 |
|
公开释放 |
HuggingFace Dataset |
6.2 数据构成:六种查询类型
LocateAnything-Data精心设计了六种查询类型,覆盖了视觉定位的主要任务场景:
|
查询类型 |
查询占比 |
框占比 |
作用 |
|
通用目标检测 |
66.9% |
83.1% |
提供基础的边界框监督,实现精准密集的坐标对齐 |
|
GUI元素定位 |
16.5% |
— |
支持具身Agent和图形用户界面导航任务 |
|
指代表达理解 |
7.3% |
— |
将复杂的自然语言意图链接到图像中的特定空间区域 |
|
文字定位(OCR) |
3.6% |
— |
感知并精准定位图像中的文字信息 |
|
布局定位 |
3.5% |
— |
增强文档和场景布局理解的结构推理能力 |
|
基于点的定位 |
2.2% |
— |
细化空间精度,实现细粒度坐标预测 |
这种数据构成的设计体现了几个考量:①通用目标检测占比最大(66.9%查询,83.1%框),为模型提供了最基础的检测能力和坐标对齐监督;②GUI元素定位占比16.5%,反映了NVIDIA对Agent场景的重视——GUI定位是具身Agent和自动化系统的核心能力;③指代表达理解、OCR、布局定位、点定位等类型虽然占比不大,但覆盖了视觉定位的多样化需求,让模型在单一框架下支持多种任务。
6.3 数据引擎:自动标注与质量控制
LocateAnything-Data的标注采用了"人工标注 + 模型自动标注"的混合策略:
- 人工标注:对于高质量的核心数据集,采用人工标注确保标注精度;
- Qwen3-VL自动标注:利用Qwen3-VL的强视觉理解能力,对大量图像进行自动检测和描述生成;
- Molmo自动标注:利用Molmo的像素级定位能力,生成高精度的坐标点和边界框;
- SAM 3自动标注:利用Meta SAM 3的概念提示分割能力,生成精准的分割掩码和边界框。
这种多模型交叉标注的策略可以有效提升标注质量和多样性——不同模型的标注结果可以互相验证和补充,减少单一模型的偏差。同时,NVIDIA团队还设计了可扩展的数据引擎,可以持续增加新的数据和任务类型,让模型能力不断迭代。
LocateAnything-Data已经在HuggingFace上公开发布,这为社区研究视觉定位和检测提供了宝贵的大规模数据资源,也降低了其他团队复现和改进LocateAnything的门槛。
LocateAnything在大量基准测试上进行了全面评估,覆盖目标检测、GUI定位、文档理解、OCR、指代表达理解等多个维度。所有结果均在默认的Hybrid Mode下测得,吞吐量在单张NVIDIA H100 GPU上测量。
7.1 吞吐量:10倍于Qwen3-VL
|
模型 |
解码方式 |
吞吐量(BPS, H100) |
vs LocateAnything |
|
LocateAnything-3B |
并行框解码PBD(Hybrid) |
12.7 |
1x(基准) |
|
Rex-Omni |
量化坐标解码 |
5.0 |
0.39x(慢2.5倍) |
|
Qwen3-VL |
文本坐标解码(自回归) |
1.1 |
0.09x(慢约10倍) |
在密集场景中,PBD的吞吐量优势更加明显:当目标框数量从20增加到300时,自回归方法遭遇严重的延迟瓶颈,而PBD实现了2倍到6倍的加速比,吞吐量从12 BPS扩展到约25 BPS。这意味着LocateAnything在需要同时检测大量物体的场景(如航拍图像、拥挤人群、文档OCR)中优势更加突出。
7.2 目标检测:LVIS和COCO上的SOTA
|
基准 |
指标 |
LocateAnything |
Rex-Omni(同规模) |
提升 |
|
LVIS |
mean F1 |
50.7 |
46.9 |
+3.8% |
|
LVIS (IoU=0.95) |
mean F1 |
31.1 |
20.7 |
+10.4% |
|
COCO |
mean F1 |
— |
— |
+1.8% |
|
Dense200(密集检测) |
mean F1 |
58.7 |
58.3 |
+0.4% |
|
VisDrone(航拍) |
mean F1 |
39.9 |
35.8 |
+4.1% |
关键发现:①在LVIS大词汇量检测基准上,LocateAnything比同规模的Rex-Omni提升3.8% mean F1;②在高IoU阈值(IoU=0.95)下,提升达到惊人的10.4个百分点(31.1 vs 20.7),这直接验证了PBD对精细定位的提升效果——框内几何一致性使得高IoU下的定位更加精准;③在密集检测(Dense200)和航拍(VisDrone)等挑战性场景上,LocateAnything也取得了显著提升,尤其是VisDrone上提升4.1%,说明PBD在小目标和密集场景中优势明显。
7.3 GUI定位:ScreenSpot-Pro上的SOTA
|
模型 |
参数量 |
ScreenSpot-Pro mean F1 |
|
LocateAnything-3B |
3B |
60.3(SOTA) |
|
Qwen3-VL-30B-A3B |
30B(MoE, 激活3B) |
低于60.3 |
|
GUI-Owl-32B |
32B |
低于60.3 |
LocateAnything在ScreenSpot-Pro(GUI元素定位基准)上取得了60.3 mean F1的SOTA成绩,超越了参数量大得多的Qwen3-VL-30B-A3B和专用GUI定位模型GUI-Owl-32B。尤其在基于图标的查询(icon-based queries)上表现突出——这对于GUI Agent至关重要,因为图标是界面中最常见的可交互元素之一。
7.4 文档理解与OCR:新的基准纪录
|
基准 |
任务 |
LocateAnything |
Rex-Omni |
提升 |
|
DocLayNet |
文档布局定位 |
76.8 |
70.7 |
+6.1% |
|
M6Doc |
多领域文档理解 |
70.1 |
55.6 |
+14.5% |
|
TotalText |
OCR文字定位 |
43.3 |
— |
超越所有对比方法 |
文档理解是LocateAnything的另一个强项:①在DocLayNet文档布局定位基准上达到76.8 mean F1,比Rex-Omni提升6.1%;②在M6Doc多领域文档理解基准上达到70.1 mean F1,比Rex-Omni大幅提升14.5%,这是所有基准中最大的提升幅度,说明PBD在文档这种需要大量精确定位的场景中优势尤为明显;③在TotalText OCR文字定位基准上达到43.3 mean F1,超越所有对比方法。
7.5 指代表达理解与点定位
- HumanRef(人类指代表达理解):LocateAnything达到78.7 mean F1,展现了将细微的人类意图与视觉区域精准对齐的能力;
- RefCOCOg(通用指代表达理解):LocateAnything保持了与顶级模型的高度竞争力;
- 基于点的定位:在COCO、LVIS、Dense200、VisDrone、HumanRef、RefCOCOg等多个基准上评估了点定位能力,PBD的原子单元设计同样适用于点坐标的并行预测。
7.6 性能总结
|
能力维度 |
代表基准 |
LocateAnything表现 |
关键优势 |
|
推理速度 |
H100吞吐量 |
12.7 BPS |
比Qwen3-VL快10倍,比Rex-Omni快2.5倍 |
|
通用目标检测 |
LVIS/COCO |
LVIS 50.7 F1 |
高IoU下提升显著(IoU=0.95时+10.4%) |
|
密集/小目标检测 |
Dense200/VisDrone |
58.7/39.9 F1 |
密集场景吞吐量扩展到25 BPS |
|
GUI定位 |
ScreenSpot-Pro |
60.3 F1(SOTA) |
超越30B+模型,图标查询表现突出 |
|
文档布局 |
DocLayNet/M6Doc |
76.8/70.1 F1 |
M6Doc提升14.5%,最大提升幅度 |
|
OCR文字定位 |
TotalText |
43.3 F1 |
超越所有对比方法 |
|
指代表达理解 |
HumanRef/RefCOCOg |
78.7 F1 |
复杂自然语言意图精准对齐 |
八、应用场景:从机器人到文档AI的广泛落地
LocateAnything的高速、精准、统一的视觉定位能力,使其在多个领域具有广泛的应用价值。
|
应用领域 |
核心价值 |
典型用例 |
|
机器人与具身AI |
实时环境感知,低延迟物体定位,支持端侧部署 |
服务机器人环境感知、机械臂抓取定位、人形机器人障碍物检测、"把桌上红色杯子递给我"式自然语言指令 |
|
GUI Agent与自动化 |
精准定位屏幕元素,支持Agent自动操作,ScreenSpot-Pro SOTA |
UI自动化测试、RPA流程自动化、软件操作助手、无障碍辅助、智能填表、网页爬虫 |
|
自动驾驶与车路协同 |
开放词汇检测罕见物体,密集场景高速检测,长尾场景覆盖 |
罕见障碍物检测、交通标志理解、行人意图分析、事故场景检测、路侧感知 |
|
文档AI与OCR |
高精度文档布局解析,M6Doc提升14.5%,OCR定位SOTA |
合同/票据/报表结构化解析、PDF版面分析、表格检测、公式定位、多语言OCR |
|
工业质检与安防 |
开放词汇缺陷检测,无需重新训练,密集小目标检测强 |
表面缺陷检测、装配错误检测、安全帽/防护服检测、入侵检测、遗留物检测、人群聚集检测 |
|
数据标注与数据集构建 |
Slow Mode高精度标注,自动标注减少人工成本,138M查询数据引擎 |
自动目标检测标注、GUI元素标注、文档布局标注、指代表达数据构建、数据质量验证 |
|
零售电商 |
开放词汇商品检测,快速适配新品类,密集货架检测 |
货架商品识别、商品盘点、价格标签检测、陈列合规检查、商品搜索定位 |
|
医疗影像 |
高精度区域定位,Slow Mode最高精度,指代表达理解 |
病灶定位、器官测量、异常区域标注、医学报告生成、影像结构化分析 |
9.1 vs 专用检测器(Grounding DINO、Florence-2)
Grounding DINO和Florence-2是专用开放词汇检测器的代表,它们有专门的检测头、置信度输出和NMS后处理,在COCO/LVIS等标准检测基准上精度很高。LocateAnything与它们的区别在于:
- 架构不同:LocateAnything是纯VLM架构(视觉编码器+MLP+语言解码器),通过PBD解码实现检测,不需要额外的检测头;Grounding DINO和Florence-2有专门的检测架构;
- 交互能力不同:LocateAnything基于Qwen2.5语言模型,天然具备强自然语言交互能力,可以理解复杂的指代表达和多轮对话;专用检测器的文本理解能力相对有限;
- 多任务能力不同:LocateAnything在单一模型下支持检测、GUI定位、OCR、文档布局、指代表达、点定位等多种任务;专用检测器通常专注于检测;
- 部署不同:LocateAnything可以直接使用标准的LLM推理框架(如vLLM、Transformers),部署简单;专用检测器可能需要专门的推理框架。
9.2 vs 通用VLM(Qwen3-VL、InternVL3、Molmo)
Qwen3-VL、InternVL3、Molmo等通用VLM也具备检测和定位能力,但它们都采用自回归的坐标token解码方式。LocateAnything的核心优势是:
- 速度快10倍:PBD并行解码彻底消除了自回归的时序依赖,在H100上达到12.7 BPS,而Qwen3-VL只有1.1 BPS;
- 高IoU精度更高:框内几何一致性使得高IoU阈值下的定位精度显著提升(LVIS IoU=0.95时+10.4%);
- 输出更可靠:原子单元预测减少了格式错误和畸形框,Hybrid Mode的自动纠错机制进一步保证了可靠性;
- 但通用能力可能不如大模型:LocateAnything专注于视觉定位,在通用视觉问答、复杂推理、视频理解等方面可能不如Qwen3-VL、InternVL3等大规模通用VLM。
9.3 LocateAnything的独特定位
LocateAnything在检测视觉大模型领域占据了一个独特的位置:它是第一个将VLM的自然语言交互能力与专用检测器的高速高精度检测能力统一在单一框架中的模型。它既不是纯专用检测器(缺乏自然语言交互和多任务能力),也不是纯通用VLM(检测速度慢、精度受限)——而是通过并行框解码这一创新,在VLM架构内实现了接近专用检测器的速度和精度,同时保留了VLM的交互和多任务优势。
10.1 当前局限性
- 模型规模有限:当前LocateAnything只有3B参数版本,在通用视觉问答、复杂推理等方面可能不如更大规模的VLM。未来可以扩展到7B、14B甚至更大规模,进一步提升能力;
- 权重许可证限制:模型权重采用NVIDIA许可证,而非完全开放的Apache 2.0,商业使用需要仔细评估许可证条款;
- 视频支持有限:当前LocateAnything主要针对静态图像,视频中的时序检测和跟踪能力尚未充分探索;
- 3D检测需要扩展:虽然有LocateAnything3D的后续工作,但2D版本本身不支持3D空间理解,在机器人、自动驾驶等需要3D感知的场景中需要额外扩展;
- 置信度和NMS:作为VLM-native检测模型,LocateAnything的置信度校准和非极大值抑制(NMS)机制可能不如专用检测器成熟,在密集场景中可能出现重复检测。
10.2 未来方向
- 更大规模模型:将PBD扩展到7B、14B、30B+参数,探索大规模下的速度-精度权衡;
- 视频检测与跟踪:将并行框解码扩展到视频时序维度,实现视频中的目标检测和跟踪统一;
- 3D与空间理解:LocateAnything3D已经开始探索3D检测,未来可以进一步融合深度估计、点云理解,实现真正的3D空间感知;
- 检测+分割统一:将PBD的原子单元思想扩展到分割掩码,实现检测+分割的统一并行解码;
- 端侧部署优化:3B参数已经具备端侧部署的潜力,通过量化、蒸馏、推理优化,可以在手机、机器人、汽车等边缘设备上实时运行;
- Agent原生整合:将LocateAnything的高速定位能力与Agent的规划、决策、工具调用能力深度整合,成为Agent系统的视觉感知核心。
LocateAnything代表了视觉定位领域的一个重要范式转变:从"把检测当作文本生成"到"把检测当作几何结构并行预测"。并行框解码的核心思想——将耦合的几何结构作为原子单元整体预测——不仅适用于边界框,还可以推广到点、多边形、分割掩码、3D框等各种几何元素。随着这一思想的不断扩展和深化,我们有理由期待一个更快、更准、更统一的视觉定位新时代的到来。对于机器人、GUI Agent、文档AI、自动驾驶等需要实时精准视觉感知的领域,LocateAnything可能只是一个开始——它打开了一扇门,让我们看到了VLM-native检测的巨大潜力。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)