AI视频数据分析系统技术架构解析:YOLO+VLM大小模型协同方案实践

SEO关键词:AI视频分析系统、YOLO视频监控、VLM视觉大模型、MediaMTX、Redis消息队列、RAG架构、智能安防系统、计算机视觉项目实战

在这里插入图片描述

大家好 这里是「代码简单说」,欢迎大家关注同名公众号,不定时更新更多实用有趣的教程 也欢迎大家在评论区一起讨论交流!~

最近看到一个比较有意思的 AI 视频分析项目,其整体架构设计非常值得借鉴。

原文地址:YOLO结合多模态大模型,5种协同模式,10分钟打通任意场景,提示词定义安防,打造百路级别最强AI基座
发布时间:2026-06-12 12:00:00
作者:SuperIceAI
提示:作者个人观点,仅供参考

这个项目并不是简单地把摄像头画面直接丢给大模型分析,而是采用了当前比较流行的 大小模型协同架构

  • 小模型负责实时检测
  • 大模型负责语义理解
  • Redis实现消息解耦
  • MediaMTX负责视频流分发
  • MinIO负责对象存储
  • ChromaDB实现RAG规范检索

整个架构兼顾了:

  • 实时性
  • 准确率
  • 可扩展性
  • 成本控制

今天就来聊聊这套系统的技术架构设计。


一、传统AI视频分析为什么难落地

在这里插入图片描述

很多人第一反应是:

直接把视频发给大模型分析不就行了?

理论上可以。

但实际部署时会遇到几个问题:

1. 视频帧数量过大

假设:

  • 1080P
  • 25FPS

那么一分钟视频:

25 × 60 = 1500帧

一天:

129600000帧

即使大模型能力再强,也不可能实时处理这么大的数据量。


2. 成本过高

如果每一帧都调用VLM:

摄像头数量 × 帧率 × 时间

推理费用会呈指数级增长。

对于企业级监控场景几乎无法接受。


3. 响应速度不足

大模型一次推理:

1~5秒

而监控系统要求:

毫秒级发现
秒级响应

因此必须引入小模型做前置筛选。


二、大小模型协同架构

该系统最核心的设计思想:

YOLO负责发现问题
VLM负责判断问题

架构如下:

视频流
  ↓
YOLO检测
  ↓
目标跟踪
  ↓
ROI过滤
  ↓
Redis消息队列
  ↓
VLM分析
  ↓
告警生成

这种架构有点类似:

安保人员巡逻
+
专家审核

先把可疑目标找出来。

再让大模型进行深度分析。


三、整体系统架构

系统采用典型微服务思想设计。

浏览器
   ↓
Flask Web
   ↓
 ┌───────────────┐
 │ Redis         │
 │ MySQL         │
 │ MinIO         │
 └───────────────┘
   ↓
Producer
Consumer
Saver

核心模块:

模块职责
Flask管理后台
Redis消息队列
MySQL数据存储
MinIO图片视频存储
Producer视频分析
Consumer大模型推理
Saver持久化

四、Producer设计

Producer是整个系统最繁忙的模块。

职责:

拉流
↓
解码
↓
YOLO检测
↓
目标跟踪
↓
截图
↓
推送消息

支持:

RTSP
视频文件
图片

技术栈:

PyAV
OpenCV
YOLO
FFmpeg
CUDA

YOLO目标检测

检测流程:

frame
 ↓
YOLO
 ↓
bbox
 ↓
BotSort
 ↓
目标ID

优势:

同一个目标不会重复告警

例如:

人员抽烟
持续10秒

不会产生:

100次告警

而只产生一次有效告警。


GPU批量推理

系统支持:

YOLO_INFER_BATCH_SIZE

多个任务共享GPU。

减少:

显存占用
推理延迟

提升吞吐量。


动态追帧机制

监控系统经常出现:

处理速度
<
视频产生速度

导致延迟越来越大。

解决方案:

自动跳帧

例如:

实时延迟 > 阈值

系统直接丢弃旧帧。

只保留最新画面。

保证实时性。


五、Consumer设计

Consumer负责:

VLM推理

其架构:

Supervisor
      ↓
多个Worker
      ↓
多个线程

即:

多进程
+
多线程

混合模型。


为什么不用单进程

因为VLM接口经常会出现:

超时
网络波动
推理阻塞

多进程隔离后:

一个Worker挂掉
不会影响整体服务

多端点负载均衡

支持:

Qwen
InternVL
Llama
OpenAI协议模型

统一接入。

然后:

Round Robin

轮询调度。

例如:

VLM-1
VLM-2
VLM-3

请求会自动分发。


动态降级机制

当系统压力增大:

队列等待 > 15秒

自动关闭:

Thinking
Reasoning

进入极速分类模式。

这样能够保证:

先响应
再优化

不会出现告警堆积。


六、RAG规范审查设计

这是我认为最有价值的功能之一。

很多场景并不是简单检测:

有人
有车
有火焰

而是检测:

是否符合规范

例如:

安全帽佩戴
高空作业
消防通道占用
危险区域作业

工作流程

上传规范文档:

PDF
↓
文本提取
↓
规则抽取
↓
向量化
↓
ChromaDB

运行时:

任务描述
↓
向量检索
↓
匹配规范
↓
注入Prompt
↓
VLM分析

形成:

RAG + VLM

架构。


举例

上传:

GB30871-2022

系统自动抽取:

禁止吸烟
必须佩戴安全帽
危险区域必须隔离

当摄像头发现违规行为:

VLM不仅能说:

有人在吸烟

还能说:

违反GB30871相关规定

大幅提高业务价值。


七、MediaMTX流媒体架构

很多项目容易忽略视频流分发。

如果每个分析任务都直接连接摄像头:

10个任务
=
10次拉流

摄像头压力巨大。


因此引入:

MediaMTX

统一管理流媒体。

架构:

摄像头
 ↓
MediaMTX
 ↓
多个任务

实现:

一次拉流
多处消费

支持:

RTSP
WebRTC
HLS

八、Redis解耦架构

系统采用:

Producer
Consumer
Saver

完全解耦。

通过Redis通信。

Producer
    ↓
Redis Queue
    ↓
Consumer
    ↓
Redis Queue
    ↓
Saver

优势非常明显:

独立扩容

例如:

Producer × 5
Consumer × 20
Saver × 2

互不影响。


故障隔离

即使:

VLM服务崩溃

Producer依然正常运行。

不会影响前端监控。


九、热更新机制设计

传统项目修改配置后:

停止服务
修改配置
重启服务

生产环境非常痛苦。


该系统采用:

Redis Pub/Sub

实现热更新。

配置修改后:

发布消息
↓
所有服务收到通知
↓
重新加载配置

无需人工重启。


支持:

模型切换
参数修改
任务调整
端点变更

实时生效。


十、为什么这套架构值得学习

这套系统最大的亮点并不是用了多少AI模型。

而是工程化能力。

它解决了AI项目最常见的几个问题:

问题解决方案
实时性不足YOLO前置检测
成本过高大小模型协同
系统耦合Redis解耦
多路视频扩展困难MediaMTX
规范审查困难RAG增强
配置变更停机热更新机制

整体来看属于比较标准的:

AI Agent
+
计算机视觉
+
RAG
+
流媒体
+
微服务

融合架构。

对于需要落地:

  • 智慧园区
  • 安全生产
  • 工厂巡检
  • 视频监控
  • 智能安防

等场景的开发者来说,这套设计思路非常具有参考价值。


总结

这套 AI 视频数据分析系统采用了当前主流的 YOLO + VLM 大小模型协同架构,通过 Producer、Consumer、Saver 三层解耦设计,实现了高并发视频分析、智能告警、规范审查和实时推流能力。

从技术角度看,最值得学习的几个点是:

  • 大小模型协同推理
  • Redis消息队列解耦
  • MediaMTX流媒体分发
  • ChromaDB实现RAG规范检索
  • 多进程多线程VLM推理架构
  • Redis Pub/Sub热更新机制

如果你正在开发 AI 视频监控、智慧工厂或者视觉分析平台,这套架构中的很多设计思路都值得借鉴。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐