3B 参数碾压 Gemini Pro:VLX-Seek开源视觉模型凭什么这么强大?
当机器人「看到」了一个杯子,它能分清是哪一个杯子吗?
这看起来是个简单的问题,却是当前多模态大模型(VLM)面临的核心难题之一。英伟达、Google 等巨头的方案依赖云端推理、大参数暴力堆叠,而来自 Om AI Lab 的开源项目 VLX-Seek,用一种截然不同的架构思路,给出了一个更优雅的答案。
01|VLX-Seek 开源视觉模型
PART| 开源视觉模型
VLX-Seek 是 Om AI Lab 开源的面向端侧具身视觉(embodied vision)的细粒度感知视觉语言模型。
简单说:它不只是「看图说话」,而是能精确告诉你图里的目标在哪儿、是哪个、有几个、不存在时也不乱猜。
比如如下例子:
大街上,骑电动车的人,会把骑自行车的人给屏蔽掉;
纸盒上面的水瓶,会屏蔽不在纸盒上面的水瓶;

它专为这样的场景设计:模型不仅要理解图像中有什么,还要识别相关目标在哪里、哪个实例是被指代的,以及在目标不存在时如何正确应答。项目已经开源,可以直接在 GitHub 上面查看。
02|为什么现有 VLM 不够用?
PART| 视觉的问题
我们先来理解问题所在。
主流 VLM(比如 GPT-4o、Gemini、Qwen-VL)非常擅长全局语义理解——描述图片内容、回答视觉问题、理解复杂指令。但精确定位是另一回事。
精确定位要求模型不仅知道「这是什么」,还要判断「它在哪里」「它的边界在哪里」「有几个实例」,以及「哪个目标匹配给定的描述」。
传统方案的通病:让语言模型生成坐标
绝大多数支持定位的 VLM,会让语言模型直接输出边界框坐标,比如 [x1, y1, x2, y2]。这看起来简单,但实际上很脆弱——坐标不是自然语言。LLM 擅长生成单词、短语和句子,而不是精确的数字序列。一个边界框包含四个坐标,多个目标就会变成更长的数字序列。一旦坐标顺序、归一化范围、标点格式或目标数量出错,结果就可能无法解析,或者预测框明显偏离目标。
多目标检测会进一步放大这个问题。10 个目标 = 40+ 个坐标 token,生成路径越长,漏检和格式出错的概率就越高,推理速度也越慢——这对机器人、无人机等对延迟敏感的端侧设备来说是致命的。

停在车位上的汽车
03|把「生成坐标」变成「选区域」
PART| VLX-Seek 的核心创新
这是 VLX-Seek 最关键的设计哲学,用一句话总结:
不让模型凭空生成坐标,而是让模型从候选区域里「选」目标。
VLX-Seek 将基于目标的感知任务从坐标生成重新定义为特征检索与区域引用。模型不再只接收全图视觉 token 和文本 token,还额外接收一组可寻址的区域 token(region token)。每个区域 token 对应图像中的一个候选区域,模型可以像引用文本实体一样引用这些视觉区域。
比如输入中包含 <region0>、<region1>、<region2> 这样的区域索引,当用户问「穿红衣服的人在哪里?」,模型不需要生成坐标,只需要输出对应的区域编号——<region2>。

这种方式更符合 LLM 的能力边界。语言模型天然擅长比较、选择、引用、解释和推理。通过将候选区域编码为可处理的 token,定位任务被纳入语言模型更擅长的工作方式中。
输出格式的变化带来了四重直接收益:
- 更稳定
:输出区域索引,而非容易出错的精确坐标数字
- 更清晰
:先理解描述,再匹配区域,最后输出可解析的引用
- 更快速
:多目标场景下,区域索引比长坐标序列短得多
- 更统一
:检测、指代理解、区域 VQA、计数等任务统一在同一框架下

04|把三步推理流水线
PART| VLX-Seek 推理过程
Step 1:候选区域生成(OPN)
系统首先使用「全能提案网络」(Omni Proposal Network, OPN)检索图像中可能包含前景目标的区域。这一步不负责做最终的类别判断,而是尽可能识别更多有意义的目标区域,为后续语言模型的推理提供显式的视觉候选。
OPN 与 VLM 主干是解耦的,实际应用中可以替换为其他检测器,或者直接使用人工指定的感兴趣区域。
Step 2:区域编码(HFRE)
候选框只是几何范围,还不知道框里是什么。<cite index="13-1">VLX-Seek 使用混合细粒度区域编码器(HFRE)提取候选框的区域级视觉特征,并将这些特征投影到 LLM 的 embedding 空间中。经过这一步,区域不再只是一组坐标,而成为语言模型可以读取、比较和引用的视觉表示。
HFRE 的核心设计是双路并行:
- 语义通路
:保留基础 VLM 的视觉-语言对齐能力和高层图像理解
- 细节通路
:提供更高分辨率的局部细节,感知空间结构、边界、纹理和小目标
另外,SimpleFP 模块补充了多尺度视觉特征,帮助模型同时处理大物体和小目标。

Step 3:LLM 基于区域 token 推理
模型输入不再只包含全局图像 token 和文本 token,还包含编号的区域 token。用户用自然语言描述目标,模型通过区域索引完成定位和回答。
输出示例:
...json
{
The <ground>people</ground><object><region2><region10></object> are dancing.
}
这表明文本中的「people」对应图像中的 <region2> 和 <region10>。输出紧凑、易解析,且越是多目标场景,相比坐标生成方案的优势越明显。

05|支持哪些任务
PART| VLX-Seek 任务支持
VLX-Seek 支持一系列以区域为中心的感知任务:

06|3B 参数跑赢英伟达、谷歌
PART| VLX-Seek 性能数据
以下是 VLX-Seek-3B 在主要基准上的表现,与行业顶级模型的对比:

通用目标检测(COCO mAP)
VLX-Seek-3B 在 COCO 目标检测上达到 45.3 mAP,超过 Qwen2.5-VL-7B 的 17.7 和 Gemini 3.1 Pro 的 41.4。这说明 VLX-Seek 不只是在语言推理上更强,而是真正解决了 VLM 的区域级定位弱点。

开放词汇检测(OVDEval)
VLX-Seek-3B 在 OVDEval 上达到 43.7。OVDEval 的挑战在于要求模型不仅识别开放类别,还要处理更复杂的语言标签和困难负样本——即区分「真正匹配描述的目标」与「看起来相似但实际不匹配的目标」。
指代表达理解(RefCOCO 系列)
VLX-Seek-3B 在 RefCOCO 系列上平均得分 88.7,高于 Gemini 3 Pro 的 84.1 和 Qwen3-VL-8B 的 88.2。这说明 VLX-Seek 不只能定位普通类别目标,还能理解更复杂的自然语言描述。

目标计数(PixMo-Count)
VLX-Seek-3B 在 PixMo-Count 上达到 85.0,超过 Gemini 2.5 Pro 的 73.8。VLX-Seek 的优势在于先检测实例再聚合计数,「先找到再数」比让模型凭整体印象估算数量可靠得多。
VLX-Seek 1.5:更进一步
VLX-Seek 1.5 还引入了目标幻觉指标(Object Hallucination),专门衡量模型是否会对不存在的目标产生误报。在 RefDrone 目标幻觉评测中,VLX-Seek 1.5 的 FP/GT 为 18,而 LocateAnything-3B 为 71.3——同等条件下,VLX-Seek 1.5 的误报率显著更低。
07|增强感知,不损失通用能力
PART| VLX-Seek两阶段训练
VLX-Seek 采用两阶段训练策略,目标是在增强细粒度感知能力的同时,尽量减少对原始 VLM 通用能力的损害。
第一阶段:区域-语言对齐
冻结 VLM 主要参数,专注训练 HFRE、区域-语言连接器和新增的特殊 token,让模型先学会「区域 token 对应什么」。
第二阶段:感知指令微调
引入检测、REC、区域 captioning、区域推理、计数、OCR 等任务,同时混入通用 VLM 指令数据,防止灾难性遗忘;并加入拒绝样本,让模型在目标不存在时能够正确回答「不存在」,而非强行指向某个区域。

易燃易爆物
08|为什么这对物理 AI 很重要?
PART| VLX-Seek重要性
传统 VLM 的工作流:摄像头拍照 → 上传云端 → 等待推理 → 返回结果。
这套批处理模式有明显短板:高延迟、依赖带宽、隐私风险大,而且把物理世界的连续感知切割成了一帧帧静态快照。
VLX-Seek 的设计哲学正是为了对抗这些问题:
较小的模型和更快的推理意味着更低的部署成本。对于端侧具身系统来说,模型越轻,所需算力和内存越低,功耗越可控,对高端 GPU 或云端推理的依赖越小。这不仅降低了硬件和推理成本,还减少了边云传输带来的延迟、带宽占用和隐私风险。
更重要的是,具身系统在行动之前必须有稳定的空间锚点——它需要知道目标在哪里、是哪一个、是否仍然存在,以及它与周围环境的关系。VLX-Seek 正好填补了区域级感知的这个空缺,能够为跟随、避障、检测、抓取、导航和多轮交互提供清晰的目标位置和视觉证据。
监控摄像头、无人机、机器人、机器狗、移动设备和巡检系统,这些端侧设备真正需要的,不是云上跑满分的超大模型,而是一个在有限算力、内存和功耗预算下能长期稳定运行的感知模块。

09|如何上手使用
PART| VLX-Seek实战
获取模型
模型已在 HuggingFace 开放:
...json
{
# 3B 版本(推荐入门)
huggingface-cli download omlab/VLX-Seek-1.5-3B
# 10B 版本(更强性能)
huggingface-cli download omlab/VLX-Seek-1.5-10B
参考项目
...json
{
git clone https://github.com/om-ai-lab/VLX-Seek.git
cd VLX-Seek
具体推理脚本和环境配置详见项目 README,模型与主流推理框架(transformers)兼容。
10|项目对比
PART| VLX-Seek对比同类模型

11|小结
PART| VLX-Seek总结
VLX-Seek 的价值不在于「更大更强」,而在于用架构创新解决了一个被长期忽视的问题:让 VLM 真正能够「看清细节」,而不只是「理解大意」。
区域引用代替坐标生成,HFRE 双路编码,加上端到端的两阶段训练——这套组合拳让一个 3B 的小模型在多项定位基准上超过了 Gemini Pro 和 Qwen-VL 7B 级别的大模型。
对于关注具身智能、机器人视觉、安防感知、无人机巡检等方向的开发者来说,VLX-Seek 是一个值得认真研究的开源项目。
更多transformer,VIT,swin tranformer
参考头条号:人工智能研究所
v号:人工智能研究Suo, 启示AI科技
动画详解transformer 在线视频教程


DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)