AI视频数据分析系统技术架构解析:YOLO+VLM大小模型协同方案实践
AI视频数据分析系统技术架构解析:YOLO+VLM大小模型协同方案实践
SEO关键词:AI视频分析系统、YOLO视频监控、VLM视觉大模型、MediaMTX、Redis消息队列、RAG架构、智能安防系统、计算机视觉项目实战

大家好 这里是「代码简单说」,欢迎大家关注同名公众号,不定时更新更多实用有趣的教程 也欢迎大家在评论区一起讨论交流!~
最近看到一个比较有意思的 AI 视频分析项目,其整体架构设计非常值得借鉴。
原文地址:YOLO结合多模态大模型,5种协同模式,10分钟打通任意场景,提示词定义安防,打造百路级别最强AI基座
发布时间:2026-06-12 12:00:00
作者:SuperIceAI
提示:作者个人观点,仅供参考
这个项目并不是简单地把摄像头画面直接丢给大模型分析,而是采用了当前比较流行的 大小模型协同架构:
- 小模型负责实时检测
- 大模型负责语义理解
- Redis实现消息解耦
- MediaMTX负责视频流分发
- MinIO负责对象存储
- ChromaDB实现RAG规范检索
整个架构兼顾了:
- 实时性
- 准确率
- 可扩展性
- 成本控制
今天就来聊聊这套系统的技术架构设计。
一、传统AI视频分析为什么难落地

很多人第一反应是:
直接把视频发给大模型分析不就行了?
理论上可以。
但实际部署时会遇到几个问题:
1. 视频帧数量过大
假设:
- 1080P
- 25FPS
那么一分钟视频:
25 × 60 = 1500帧
一天:
129600000帧
即使大模型能力再强,也不可能实时处理这么大的数据量。
2. 成本过高
如果每一帧都调用VLM:
摄像头数量 × 帧率 × 时间
推理费用会呈指数级增长。
对于企业级监控场景几乎无法接受。
3. 响应速度不足
大模型一次推理:
1~5秒
而监控系统要求:
毫秒级发现
秒级响应
因此必须引入小模型做前置筛选。
二、大小模型协同架构
该系统最核心的设计思想:
YOLO负责发现问题
VLM负责判断问题
架构如下:
视频流
↓
YOLO检测
↓
目标跟踪
↓
ROI过滤
↓
Redis消息队列
↓
VLM分析
↓
告警生成
这种架构有点类似:
安保人员巡逻
+
专家审核
先把可疑目标找出来。
再让大模型进行深度分析。
三、整体系统架构
系统采用典型微服务思想设计。
浏览器
↓
Flask Web
↓
┌───────────────┐
│ Redis │
│ MySQL │
│ MinIO │
└───────────────┘
↓
Producer
Consumer
Saver
核心模块:
| 模块 | 职责 |
|---|---|
| Flask | 管理后台 |
| Redis | 消息队列 |
| MySQL | 数据存储 |
| MinIO | 图片视频存储 |
| Producer | 视频分析 |
| Consumer | 大模型推理 |
| Saver | 持久化 |
四、Producer设计
Producer是整个系统最繁忙的模块。
职责:
拉流
↓
解码
↓
YOLO检测
↓
目标跟踪
↓
截图
↓
推送消息
支持:
RTSP
视频文件
图片
技术栈:
PyAV
OpenCV
YOLO
FFmpeg
CUDA
YOLO目标检测
检测流程:
frame
↓
YOLO
↓
bbox
↓
BotSort
↓
目标ID
优势:
同一个目标不会重复告警
例如:
人员抽烟
持续10秒
不会产生:
100次告警
而只产生一次有效告警。
GPU批量推理
系统支持:
YOLO_INFER_BATCH_SIZE
多个任务共享GPU。
减少:
显存占用
推理延迟
提升吞吐量。
动态追帧机制
监控系统经常出现:
处理速度
<
视频产生速度
导致延迟越来越大。
解决方案:
自动跳帧
例如:
实时延迟 > 阈值
系统直接丢弃旧帧。
只保留最新画面。
保证实时性。
五、Consumer设计
Consumer负责:
VLM推理
其架构:
Supervisor
↓
多个Worker
↓
多个线程
即:
多进程
+
多线程
混合模型。
为什么不用单进程
因为VLM接口经常会出现:
超时
网络波动
推理阻塞
多进程隔离后:
一个Worker挂掉
不会影响整体服务
多端点负载均衡
支持:
Qwen
InternVL
Llama
OpenAI协议模型
统一接入。
然后:
Round Robin
轮询调度。
例如:
VLM-1
VLM-2
VLM-3
请求会自动分发。
动态降级机制
当系统压力增大:
队列等待 > 15秒
自动关闭:
Thinking
Reasoning
进入极速分类模式。
这样能够保证:
先响应
再优化
不会出现告警堆积。
六、RAG规范审查设计
这是我认为最有价值的功能之一。
很多场景并不是简单检测:
有人
有车
有火焰
而是检测:
是否符合规范
例如:
安全帽佩戴
高空作业
消防通道占用
危险区域作业
工作流程
上传规范文档:
PDF
↓
文本提取
↓
规则抽取
↓
向量化
↓
ChromaDB
运行时:
任务描述
↓
向量检索
↓
匹配规范
↓
注入Prompt
↓
VLM分析
形成:
RAG + VLM
架构。
举例
上传:
GB30871-2022
系统自动抽取:
禁止吸烟
必须佩戴安全帽
危险区域必须隔离
当摄像头发现违规行为:
VLM不仅能说:
有人在吸烟
还能说:
违反GB30871相关规定
大幅提高业务价值。
七、MediaMTX流媒体架构
很多项目容易忽略视频流分发。
如果每个分析任务都直接连接摄像头:
10个任务
=
10次拉流
摄像头压力巨大。
因此引入:
MediaMTX
统一管理流媒体。
架构:
摄像头
↓
MediaMTX
↓
多个任务
实现:
一次拉流
多处消费
支持:
RTSP
WebRTC
HLS
八、Redis解耦架构
系统采用:
Producer
Consumer
Saver
完全解耦。
通过Redis通信。
Producer
↓
Redis Queue
↓
Consumer
↓
Redis Queue
↓
Saver
优势非常明显:
独立扩容
例如:
Producer × 5
Consumer × 20
Saver × 2
互不影响。
故障隔离
即使:
VLM服务崩溃
Producer依然正常运行。
不会影响前端监控。
九、热更新机制设计
传统项目修改配置后:
停止服务
修改配置
重启服务
生产环境非常痛苦。
该系统采用:
Redis Pub/Sub
实现热更新。
配置修改后:
发布消息
↓
所有服务收到通知
↓
重新加载配置
无需人工重启。
支持:
模型切换
参数修改
任务调整
端点变更
实时生效。
十、为什么这套架构值得学习
这套系统最大的亮点并不是用了多少AI模型。
而是工程化能力。
它解决了AI项目最常见的几个问题:
| 问题 | 解决方案 |
|---|---|
| 实时性不足 | YOLO前置检测 |
| 成本过高 | 大小模型协同 |
| 系统耦合 | Redis解耦 |
| 多路视频扩展困难 | MediaMTX |
| 规范审查困难 | RAG增强 |
| 配置变更停机 | 热更新机制 |
整体来看属于比较标准的:
AI Agent
+
计算机视觉
+
RAG
+
流媒体
+
微服务
融合架构。
对于需要落地:
- 智慧园区
- 安全生产
- 工厂巡检
- 视频监控
- 智能安防
等场景的开发者来说,这套设计思路非常具有参考价值。
总结
这套 AI 视频数据分析系统采用了当前主流的 YOLO + VLM 大小模型协同架构,通过 Producer、Consumer、Saver 三层解耦设计,实现了高并发视频分析、智能告警、规范审查和实时推流能力。
从技术角度看,最值得学习的几个点是:
- 大小模型协同推理
- Redis消息队列解耦
- MediaMTX流媒体分发
- ChromaDB实现RAG规范检索
- 多进程多线程VLM推理架构
- Redis Pub/Sub热更新机制
如果你正在开发 AI 视频监控、智慧工厂或者视觉分析平台,这套架构中的很多设计思路都值得借鉴。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)