小白程序员必看!收藏这份视觉模型发展史,从CNN到VLA的完整进阶指南
本文带你回顾视觉模型的发展历程,从基础的图像矩阵表示开始,深入解析CNN、ViT、Transformer等核心架构,再到自监督学习、生成模型(GAN到Diffusion),最后通过CLIP和VLA模型展示视觉AI如何打通图文并走向具身智能。全文通俗易懂,适合小白和程序员快速掌握视觉AI技术演进脉络。
开篇
你用手机拍了一张模糊的老照片,打开某个 App,点一下"修复"——三秒后,一张清晰的彩色照片出现了。你告诉AI:“帮我画一只穿西装的猫在月球上喝咖啡”——十秒后,AI 交出了一张以假乱真的图。你对着机器人说"把桌上的杯子放到架子上"——它走过去,真的放了。
这三件事背后,分别是视觉基础模型的三种能力:理解图像、生成图像、操控世界。
这篇文章,从图像在计算机里的最底层表示讲起,经过 CNN、Transformer、自监督学习,到生成模型(GAN → Diffusion → Flow Matching),再到 CLIP 打通图文,最后落在 VLA(视觉-语言-动作)模型上。一条线串完,你会看到整个视觉 AI 从"看懂"到"画出"再到"动手"的完整演进。
本文基于课堂笔记,借助大模型辅助理解与知识拓展后整理而成,力求通俗易懂。文中部分案例和图片来自课件。
一、图像在计算机里是什么
在讲模型之前,先回到最底层:计算机看到的图像,就是一个数字矩阵。

一张 224×224 的彩色图,就是 224×224×3(3通道,RGB) = 150,528 个数字。所有视觉模型的工作,本质上都是对这堆数字做变换。
一个类比很直观:灰度图就像一张黑白照片,每个像素记录"有多亮";彩色图就是三张灰度图叠在一起(红、绿、蓝各一张),混合出你看到的颜色。
二、CNN:用"小窗口"理解图像
全连接为什么不行
最朴素的想法:把 150,528 个像素拉平成一个向量,丢进全连接网络。
问题立刻暴露:一层 1000 个神经元的全连接层,参数量 = 150,528 × 1000 ≈ 1.5 亿。图再大一点就训不动了。更要命的是,全连接把每个像素当独立特征——猫耳朵紧挨着猫脸这个空间关系,被完全忽略了。
卷积的三招
CNN 用三个设计解决了这些问题:
-
局部连接:一个 3×3 的卷积核(Kernel),每次只看一小片区域。
-
权值共享:同一个卷积核扫遍全图。不管猫在左上角还是右下角,同一个"猫耳朵探测器"都能捕捉到。
-
逐层抽象:堆叠多层卷积,从边缘 → 纹理 → 部件 → 物体,逐步构建理解。
池化:只留最关键的信号
池化(Pooling)在特征图上滑一个窗口,每个窗口只保留一个值:
- Max Pooling:取最大值(保留最强响应)
- Avg Pooling:取均值(保留整体趋势)
一个 2×2 Max Pool 把 4×4 的特征图压成 2×2——计算量降到 1/4,特征的位置微小偏移也不影响结果。
一句话总结 CNN:用可学习的小模板扫描图像,逐层从像素中提炼出语义。
以前文章单独介绍过,这里简单带过。
三、CV 任务万花筒:为什么难以统一
CNN 很强,但计算机视觉的任务极其碎片化:
| 任务 | 输入 → 输出 | 粒度 |
|---|---|---|
| 图像分类 | 图 → 一个标签 | 图像级 |
| 目标检测(YOLO) | 图 → 多个框 + 类别 | 区域级 |
| 语义分割 | 图 → 逐像素类别 | 像素级 |
| 抠图(Matting) | 图 → 逐像素透明度(0~1 连续值) | 像素级 |
| 深度估计 | 图 → 逐像素距离 | 像素级 |
| 图像复原 | 退化图 → 清晰图 | 像素级 |
| 图像生成 | 文本 → 图像 | 生成 |
注意抠图(Matting)和语义分割的区别:分割是逐像素的二分类(前景/背景),边界粗糙;抠图需要边界处精细的连续值——比如一根发丝可能是 0.3 的透明度,半透明婚纱需要逐像素的 alpha 值。这就是为什么影视合成、证件照换背景需要专门的 matting 模型。
每种任务的输出形式不同(标量、框、矩阵、图像),历史上各有各的专属架构——YOLO 做检测、U-Net 做分割、R-CNN 做实例分割……无法用一个统一模式囊括。

对比 NLP:所有任务都是"token 序列 → token 序列"(翻译、问答、摘要),所以一个 Transformer 通吃。CV 缺的正是这种统一性。
所有的NLP任务都是预测下一个词。

还有一个有趣的共性:图像复原类任务(超分、去模糊、去噪)都是不适定问题——无数种高清原图都可能产生同一张模糊图,解不唯一。深度学习的破局方式是:从海量数据中学到"图像长什么样"的先验,从无穷多可能解中挑一个最合理的。
四、ViT:把图像变成"句子"
2020 年,Google 提出了 ViT(Vision Transformer),做了一件极其简单但影响深远的事:
把图像切成块,变成 token 序列。很巧妙的做法,把图片切成块,变成NLP任务中的句子一样。

就这么简单。没有卷积,没有局部性假设,直接用 NLP 的标准 Transformer。
关键结论:在大数据预训练下(ImageNet-21k),ViT 精度超越 CNN。但小数据下不如 CNN——因为 CNN 自带"局部性 + 平移不变"的归纳偏置,ViT 什么都没有,全靠数据学。
ViT 的真正意义不在于"比 CNN 强",而在于:视觉和语言终于站在了同一个计算范式上。 图像是 token,文本也是 token——它们可以一起丢进同一个模型处理。这是后续所有多模态模型的根基。
当然,ViT 本身只解决了分类。真正用单一模型吃下多种 CV 任务(分割、检测、深度估计……),要等到后面的视觉基础模型和 SAM。但统一的 token 范式,是从 ViT 这一步开始的。
五、自监督学习:不用标注也能学会"看"
ImageNet 有 1400 万张人工标注的图片,但互联网上有几十亿张无标注图片。如何不花一分钱标注费,让模型学会强视觉特征?答案是自监督学习。
路线一:掩码重建(MAE)
何恺明 2021 年提出的 MAE(Masked Autoencoder):
-
把图像切成 patch
-
随机遮住 75%
-
Encoder 只处理剩余 25%(省计算)
-
Decoder 重建被遮住的像素
遮住 75% 还能还原 → 模型必须真正理解语义结构,而非记纹理。训练目标就是一个简单的 MSE 重建损失。

路线二:对比学习(SimCLR / MoCo)
对同一张图做两次不同的数据增强(裁剪、翻转、颜色抖动),得到两个视图:
- 同一张图的两个视图 → 特征拉近(正对)
- 不同图 → 特征推远(负对)
模型被迫学到"不管怎么变换,本质是同一个东西"的不变性表示。

路线三:自蒸馏(DINO / DINOv2)
Meta 的 DINO 系列走第三条路——teacher-student 自蒸馏:
- 同一张图的两个视图,分别过 teacher 和 student 网络
- 让 student 的输出对齐 teacher
- Teacher 通过 EMA(指数移动平均)缓慢更新
不需要负样本,不需要掩码重建,方法极简但效果惊人。
DINOv2(2023) 用 1.42 亿张高质量图片预训练,产出的视觉特征通吃所有下游任务——分类、检测、分割、深度估计,接个轻量头就能用。它就是视觉领域的"BERT":一个通用的视觉特征底座。
DINO 系列有个很酷的可视化:用 PCA 把每个 patch 的 768 维特征降到 3 维,映射成 RGB 颜色。结果同类物体自动变成同色——模型在无监督下就"学会"了语义分割。
六、SAM:一个模型分割万物

2023 年 Meta 发布的 SAM(Segment Anything Model) 把"基础模型"理念推向了分割任务:
给任意提示(点、框、文本),分割出任意物体。
架构三件套:
| 组件 | 作用 |
|---|---|
| Image Encoder(ViT + MAE 预训练) | 图像 → 特征(只算一次,可缓存) |
| Prompt Encoder | 点/框/文本 → 提示 embedding |
| Mask Decoder(双向注意力) | 特征 + 提示 → 分割 mask |
Mask Decoder 中的双向交叉注意力是关键设计:prompt token 查询图像特征(“这个位置是什么”),图像特征也感知 prompt(“用户想要什么”)——两者充分交互,分割结果精准响应用户意图。
训练数据:SA-1B 数据集,1100 万张图像,11 亿个 mask。意义:从"每种物体训一个分割模型"变成"一个模型分割万物"。2024 年发布的 SAM 2 进一步扩展到视频分割,支持时序一致性,让"分割万物"从静态图片走向了动态视频。
七、生成模型:从理解世界到画出世界
前面讲的都是判别式模型——回答"这是什么"。接下来是生成式模型——回答"世界可以是什么样"。
7.1 GAN:生成器与判别器的零和对决
2014 年 Goodfellow 提出的 GAN,核心是两个网络博弈:
- Generator:从噪声生成假图,目标是骗过判别器
- Discriminator:判断真假,目标是识破生成器
类比囚徒困境中的博弈——理想结局是纳什均衡:生成器完美以假乱真,判别器只能猜 50/50。
但 GAN 有硬伤:训练不稳定(容易震荡)、模式坍塌(只生成少数几种图)、难以精确控制。

7.2 Normalizing Flow:可逆的橡皮泥
从高斯噪声出发,通过一系列可逆变换,把简单分布"揉捏"成复杂分布。每步可逆意味着可以精确计算概率。
缺点:可逆性约束太强,限制了网络设计自由度。
7.3 Diffusion Model
扩散模型的思路极其优雅:
训练:往图像中不断加入噪声,最终图像会变成纯随机噪声,这个过程叫正向扩散过程Forward diffusion
推理:生成图片)时则相反,一步一步去掉噪声来得到图片,这个过程称之为反向扩散过程 Reverse diffusion

为什么它能击败 GAN 和 Flow 成为主流:训练稳定(简单 MSE)、生成质量最高、多样性好、可通过文本精确控制。
当今绝大多数顶级生成模型都基于 Diffusion:Stable Diffusion 1.x/2、DALL·E 3、Midjourney、Sora。
7.4 Flow Matching:新一代替代范式
2023 年提出的 Flow Matching 是生成模型的新一代范式,与经典 Normalizing Flow 不同——它不要求每步可逆,也不算雅可比行列式,而是用回归直接学一个速度场:
- Diffusion 走弯曲路径(SDE),需要很多步
- Flow Matching 走直线(ODE):xₜ = (1-t)·ε + t·x₀
直线意味着步数更少、采样更快。Stable Diffusion 3、FLUX 等最新模型已经切换到 Flow Matching。
八、CLIP:打通图与文的桥梁
2021 年 OpenAI 发布的 CLIP(Contrastive Language-Image Pre-training) 是多模态基础模型的里程碑。
核心思想极其简洁:用对比学习,把图像和文本映射到同一个向量空间。

CLIP 的革命性在于:开放世界识别。不需要在特定数据集上训练,用文本描述什么就能分什么。
更深远的影响:CLIP 证明了"图像和文本可以映射到同一个空间"——后面大量多模态模型(DALL·E 2、Stable Diffusion、LLaVA 等)都直接建立在 CLIP 的图文对齐基础上。
图像和文本映射到同一空间为现在大家都在使用的文生图,文生视频打下基础。
九、VLA:从看懂世界到操控世界
前面讲的所有模型,无论理解还是生成,都还是在"屏幕里"工作。具身智能(Embodied AI) 要更进一步——让 AI 拥有"身体"(机器人),能感知真实环境并执行物理动作。
多模态模型的终极延伸:不只是"看懂"和"画出",而是动手操控物理世界。
VLA(Vision-Language-Action)模型将三种模态统一建模:

关键洞察:动作也是 token。 关节角度、夹爪开合、移动速度——离散化后和文本 token 没有本质区别。整个流程就是"token in → token out"。
当前主要的 VLA 模型:
| 模型 | 机构 | 特点 |
|---|---|---|
| RT-2 | Google DeepMind | 开山之作,VLM 直接输出动作 token |
| OpenVLA | Stanford | 开源 7B,Llama 2 + DINOv2 + SigLIP |
| π₀ | Physical Intelligence | Flow Matching 生成连续动作 |
| Gemini Robotics | Google DeepMind | 基于 Gemini,强语言推理 + 操作 |
技术路线分化为两派:
- 离散动作 token(RT-2、OpenVLA):直接用 LLM 自回归生成
- 连续动作流(π₀、CogACT):用 Diffusion / Flow Matching 生成更精细的操作
总结:一条线串完视觉 AI 的演进

核心逻辑只有一句话:把一切变成 token,让 Transformer 统一处理。 图像是 token,文本是 token,动作也是 token。当所有模态都站在同一个计算范式上,"一个模型理解并操控整个世界"就不再是科幻。
如何学习大模型 AI ?
由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。
但是具体到个人,只能说是:
“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套 AI 大模型突围资料包:
- ✅ 从零到一的 AI 学习路径图
- ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
- ✅ 百度/阿里专家闭门录播课
- ✅ 大模型当下最新行业报告
- ✅ 真实大厂面试真题
- ✅ 2026 最新岗位需求图谱
所有资料 ⚡️ ,朋友们如果有需要 《AI大模型入门+进阶学习资源包》,下方扫码获取~

① 全套AI大模型应用开发视频教程
(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)

② 大模型系统化学习路线
作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!

③ 大模型学习书籍&文档
学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。

④ AI大模型最新行业报告
2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

⑤ 大模型项目实战&配套源码
学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。

⑥ 大模型大厂面试真题
面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

以上资料如何领取?

为什么大家都在学大模型?
最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!

不出1年,“有AI项目经验”将成为投递简历的门槛。
风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!


这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


以上全套大模型资料如何领取?

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)