2025目标检测+跟踪,涨点高效超精准,投稿顶会好上车!
关注gongzhonghao【CVPR顶会精选】!拿捏更多CVPR发文资讯!
目标检测与跟踪作为计算机视觉的核心任务,旨在从图像/视频中定位特定目标并持续追踪其运动轨迹。随着深度学习技术的突破,检测框架从传统特征提取演进为R-CNN、YOLO等高效模型,跟踪算法则融合卡尔曼滤波与Siamese网络,显著提升精度与实时性。当前研究聚焦于复杂场景适应性、多模态数据融合及轻量化部署。
该技术在自动驾驶感知、智能安防、无人机导航等领域具广泛应用前景,推动机器视觉系统向更高智能化演进。今天小图精选3篇CVPR论文目标检测与跟踪方向的论文,请注意查收!
论文一:LLMDet: Learning Strong Open-Vocabulary Object Detectors under theSupervision of Large Language Models
方法:
首先利用Qwen2-VL-72B为已有检测、定位和图文数据生成高质量整图级描述,经去幻觉过滤后形成GroundingCap-1M;随后以MM-Grounding-DINO为基线,固定视觉骨干,训练轻量投影器将多尺度特征与大语言模型对齐;最后在统一损失(框回归+区域短语+整图描述)下联合微调检测器、投影器与大语言模型,推理时仅保留检测器,零样本迁移在LVIS、ODinW等多基准刷新SOTA。

创新点:
-
构建首份含1120K样本的GroundingCap-1M 数据集,将区域框-短语对齐与整图级115词详细描述捆绑,填补现有数据空白。
-
设计“区域级短文本+整图级长文本”双任务联合训练框架,使检测器在保持框回归精度的同时吸收大模型语义知识。
-
提出“先对齐后协同”的两阶段训练流程:先训练投影器将视觉特征映射到大语言模型空间,再端到端微调检测器与大语言模型,实现双向增益。

论文链接:
https://arxiv.org/pdf/2501.18954
论文二:SOLAMI: Social Vision-Language-Action Modelingfor Immersive Interaction with 3D Autonomous Characters
方法:
系统首先用VQ-VAE分别量化SMPL-X身体、手部及相对变换动作,再用SpeechTokenizer提取语义语音token,配合角色人设形成多轮对话模板;继而在46K动作-文本与410K语音-文本对上预训练LLM对齐三模态,随后在5.7K合成对话指令微调;推理时前端VR采集用户数据,后端一次前向同时输出动作token与语音token,经 SoundStorm与运动解码器实时驱动3D角色完成社交互动。

创新点:
-
设计首个端到端Social VLA架构,把用户语音和动作统一成离散token,与文本一起送入解码式LLM,直接同步生成角色语音与全身动作。
-
构建SynMSI合成数据集,利用现有文本-动作语料与GPT-4o剧本迭代,仅自动生产6.3K多轮多模态对话即可达到媲美真实采集的效果。
-
推出轻量VR交互系统,Quest3实时捕获用户语音和全身骨骼,后端双H800GPU以2.6秒端到端延迟驱动3D角色,实现低延迟沉浸式对话。

论文链接:
https://arxiv.org/pdf/2412.00174
论文三:EdgeTAM: On-Device Track Anything Model
方法:
文章先用RepViT-M1等轻量主干替换 Hiera,把 Memory Attention块从4减至2以削参数。然后在每帧记忆特征进入注意力前插入2D Spatial Perceiver,用256个全局查询与256个非重叠局部查询分别压缩并保持空间结构,复杂度从O(TCH²W²) 降至O(TCHW(Ng+Nl))。最后以SAM 2-HieraB+为教师,在SA-1B图像阶段对F16做MSE 蒸馏,在SA-V视频阶段再对记忆注意力输出加 MSE,全程配合任务损失端到端训练,即可在移动SoC上实时完成任意提示的视频分割与追踪。

创新点:
-
发现SAM 2的新瓶颈——Memory Attention 而非图像编码器,并设计2D Spatial Perceiver用全局+局部可学习查询压缩时空记忆,实现8×计算削减。
-
提出面向视频的跨阶段知识蒸馏流程,在图像与视频训练两阶段同时约束图像编码器和记忆模块特征,零推理开销再涨1.3-3.3J&F。
-
构建EdgeTAM统一框架,兼容任意SAM2变体,首次在iPhone15 ProMax上达成16FPS,速度比SAM2提升22倍且精度不降。

论文链接:
https://arxiv.org/pdf/2501.07256
但很多学生找到了热门的选题,却卡在代码和写作上!可见论文要录用,选题-idea-代码-写作都缺一不可!
图灵学术论文辅导,汇聚经验丰富的实战派导师团队,针对计算机各类领域提供1v1专业指导,直至论文录用!每天2个免费咨询名额,机会有限先到先得!
本文选自gongzhonghao【CVPR顶会精选】
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)