大模型技术全景:AI、机器学习、深度学习,三者的关系到底是什么?一文搞懂
目录
-
- 开篇:为什么总感觉这几个词“混着说”
-
- 一张图看懂三者的包含关系
-
- 人工智能(AI):最宏大的目标
- 3.1 什么是人工智能
- 3.2 人工智能的两条路线
-
- 机器学习(ML):实现 AI 的核心路径之一
- 4.1 机器学习的本质
- 4.2 传统机器学习的三类任务
- 4.3 机器学习的痛点
-
- 深度学习(DL):机器学习的进阶武器
- 5.1 深度学习的核心:神经网络
- 5.2 深度学习为什么在这个时代爆发
- 5.3 深度学习的代表结构
-
- 大模型:深度学习的规模化延伸
- 6.1 大模型从何而来
- 6.2 大模型与三者的关系定位
-
- 三者关系总结:一张对比表理清边界
-
- 常见误区澄清
-
- 结语:顺着脉络理解,就不容易被概念绕晕
1. 开篇:为什么总感觉这几个词“混着说”
如果你刚接触技术圈,大概率会频繁听到这样几个词:人工智能(AI)、机器学习(ML)、深度学习(DL)、大模型(LLM)。它们有时候被并列使用,有时候又被互相替代,甚至很多文章会把“深度学习”直接等同于“人工智能”。
这种混用并不奇怪,因为这几个概念本身就层层嵌套、关系紧密。但如果要真正理解大模型处在技术版图的什么位置,就必须先把 AI、机器学习、深度学习三者之间的关系理清楚。
本文会用最直白的方式,带你彻底搞懂这三个概念的边界与联系,并说明“大模型”是如何在这条技术脉络上生长出来的。
2. 一张图看懂三者的包含关系
先给出一个最经典的结论:
人工智能 ⊃ 机器学习 ⊃ 深度学习
也就是说,深度学习是机器学习的一个子集,机器学习又是人工智能的一个子集。大模型则是深度学习发展到一定阶段后,在规模、算力与数据共同驱动下涌现出的具体形态。
下面这张流程图可以帮你快速建立整体认知:
这张图表达了三层含义:
- 人工智能是最大的目标,只要让机器表现出“像人一样”的智能行为,都属于广义 AI。
- 机器学习是通往 AI 的一条核心路径,强调“从数据中学习规律”,而不是靠人手工编写规则。
- 深度学习是机器学习中更现代、更强大的分支,依靠多层神经网络自动提取特征。
如果用一个更生活化的类比,可以把它们的关系想象成俄罗斯套娃:
- 人工智能是最大的那个套娃,代表一个宏大目标;
- 机器学习是中间套娃,是实现这个目标的一种核心方法;
- 深度学习是最里面的套娃,是机器学习中更具体的技术路线;
- 大模型则是在深度学习这个套娃上,投入更大规模数据与算力后打磨出的“加强版”。
以后看到“AI”“机器学习”“深度学习”“大模型”这四个词时,可以先判断它是在讲目标、方法,还是具体技术路线,这样就不容易混淆。
3. 人工智能(AI):最宏大的目标
3.1 什么是人工智能
人工智能是一个相对宽泛的愿景,目标是让机器具备感知、理解、推理、决策、创作等能力。只要一个系统能够完成通常需要人类智能才能完成的任务,它就可以被纳入人工智能的范畴。
人工智能并不限定实现方式。早在上世纪,人们就已经通过“专家系统”来实现某些 AI 能力:由人类专家把知识整理成一条条规则,例如“如果发烧且咳嗽,那么可能感冒”,再交给计算机执行。
人工智能领域还有一个经常被提起的判断标准:图灵测试。它的核心思想是,如果一台机器能够在对话中让人类无法分辨对方是人还是机器,就可以认为它具备了某种“智能”表现。
当然,图灵测试更多衡量的是“看起来像不像人”,并不等同于真正意义上的理解。现代人工智能研究已经延伸出许多细分方向,例如计算机视觉、自然语言处理、语音识别、机器翻译、机器人学、推荐系统等。它们共同构成了 AI 的完整版图,而机器学习只是其中实现这些能力的一条重要路径。
3.2 人工智能的两条路线
- 规则驱动:靠人编写明确规则,适合逻辑清晰、场景封闭的问题。
- 数据驱动:让机器从大量样本中找到规律,更适合规则难以穷举的复杂场景。
机器学习就属于后者,它不要求人类把知识总结成规则,而是让算法自己在数据中“学”出经验。
4. 机器学习(ML):实现 AI 的核心路径之一
4.1 机器学习的本质
机器学习不再显式地告诉计算机每一步该怎么做,而是给它大量输入与输出样本,让它在样本中寻找映射关系。一个经典定义是:
如果一个程序在任务 T 上的表现,随着经验 E 的增加而提升,那么这个程序就在学习。
例如,与其手工编写“如何识别猫”的规则,不如给模型成千上万张标注好的猫与非猫图片,让算法自己总结出“怎样算一只猫”。
4.2 传统机器学习的三类任务
- 监督学习:训练数据带标签,例如房价预测、垃圾邮件分类。
- 无监督学习:数据没有标签,让模型自行发现结构,例如聚类、降维。
- 强化学习:通过“试错 + 奖励”学习策略,例如游戏 AI、机器人控制。
常见的传统机器学习算法包括线性回归、逻辑回归、决策树、随机森林、支持向量机等。这类算法在许多结构化数据场景中依然非常实用。
为了更好地区分这三类任务,可以这样记:
- 监督学习的核心是“有答案的学习”。训练数据中每个样本都标注了正确答案,模型的任务是学会从输入预测输出。除了房价预测和垃圾邮件分类,典型应用还包括信用评分、疾病诊断、图像分类等。常见算法有线性回归、逻辑回归、决策树、随机森林、支持向量机等。
- 无监督学习的核心是“没有答案,自己找规律”。模型需要从无标签数据中发现隐藏结构。常见的聚类算法如 K-Means,可以把相似用户自动分组;降维算法如 PCA,则常用于数据可视化和去噪。
- 强化学习的核心是“在环境中试错”。模型不是一次性给出答案,而是在与环境持续交互中做出动作并获得奖励或惩罚,目标是最大化长期累计奖励。典型应用包括 AlphaGo、自动驾驶决策、机器人控制等。
这三类任务并不是完全割裂的,实际项目中经常组合使用。例如先通过无监督学习做预训练或降维,再用监督学习进行精调;强化学习中也可能使用神经网络来近似策略或价值函数。
4.3 机器学习的痛点
传统机器学习往往依赖“特征工程”:需要人手动设计并提取对任务有帮助的特征。比如做图像分类,过去可能需要人工设计边缘、纹理、颜色直方图等特征。特征设计得好不好,直接决定模型效果。
这也为深度学习登上舞台埋下了伏笔——能不能让模型自己学特征?
5. 深度学习(DL):机器学习的进阶武器
5.1 深度学习的核心:神经网络
深度学习属于机器学习,但它使用“深度神经网络”作为模型。所谓“深度”,是指网络包含很多隐藏层,可以逐层提取从低级到高级的抽象特征。
以人脸识别为例:
- 底层网络可能学会识别边缘、颜色块;
- 中层网络学会组合出眼睛、鼻子等局部结构;
- 高层网络则能识别完整的人脸语义。
整个过程不再需要人类手工设计特征,网络会端到端地自动完成。
5.2 深度学习为什么在这个时代爆发
深度学习的概念并不新鲜,早在上世纪就已出现。它真正爆发的背后,是三个要素的同时成熟:
- 大数据:互联网与传感器带来了海量训练样本。
- 强算力:GPU 等并行计算设备大幅加速了神经网络训练。
- 更好的算法:激活函数、优化器、归一化、残差连接等技术让深层网络可训练。
如果再往前追溯,深度学习大致经历过三次比较明显的发展浪潮:
- 1940—1960 年代:以感知机为代表的早期神经网络研究,但受限于理论工具与算力,很快遇到瓶颈。
- 1980—1990 年代:反向传播算法的提出让多层网络可以被训练,但数据不足与计算昂贵等问题依旧限制其规模。
- 2006 年之后:深度置信网络、ReLU 激活函数、GPU 训练等进展相继出现,尤其是 2012 年 AlexNet 在 ImageNet 图像识别竞赛中大幅刷新纪录,深度学习的潜力开始被广泛认可。
现在人们常说的“深度学习”,主要建立在第三次浪潮所积累的数据、算力与算法基础之上。它不是突然出现的技术,而是几十年研究积累后的集中爆发。
5.3 深度学习的代表结构
- CNN(卷积神经网络):擅长图像等空间结构数据。
- RNN / LSTM:擅长序列数据,曾经广泛应用于文本与语音。
- Transformer:通过注意力机制并行处理序列,成为当前大语言模型的基础架构。
正是 Transformer 的出现,为大模型的规模化发展打开了大门。
6. 大模型:深度学习的规模化延伸
6.1 大模型从何而来
大模型并不是一个与 AI、机器学习、深度学习并列的独立学科,而是深度学习在“大规模预训练”范式下的产物。
其核心思路是:在一个超大神经网络上,用海量语料进行预训练,让模型先学会语言的通用规律,再针对具体任务做微调或提示。模型规模越大、数据越充分,其在理解与生成上的能力往往越强,甚至出现“涌现能力”。
可以把大模型的训练过程粗略拆成三个阶段:
- 预训练:在海量文本上学习语言规律,让模型掌握词汇、语法、常识与推理等通用能力。这一阶段成本最高,通常需要成百上千张 GPU 连续训练数月。
- 微调:利用人类标注的高质量指令数据,让模型学会“按照要求回答问题”,从单纯续写文本转向完成具体任务。
- 对齐:通过人类反馈强化学习等方法,让模型更符合人类价值观、更少输出有害内容,同时提升回答的有用性与稳定性。
值得注意的是,“大”并不是唯一追求。更大的参数规模带来了更强能力,但也带来训练成本、推理延迟与部署门槛等问题。因此,行业也在探索小模型、蒸馏、量化与混合专家结构等方向,试图在能力与效率之间取得平衡。
6.2 大模型与三者的关系定位
- 从目标看,大模型服务于人工智能这个总目标。
- 从方法看,大模型使用机器学习,尤其是自监督学习来学习语言规律。
- 从结构看,大模型依赖深度学习,主流架构是 Transformer。
因此可以说:大模型是深度学习中一条极具代表性的技术分支,也是当前最接近通用人工智能愿景的落地形态之一。
7. 三者关系总结:一张对比表理清边界
下面从“解决什么问题”“实现方式”“典型代表”三个维度进行对比:
| 概念 | 解决什么问题 | 实现方式 | 典型代表 |
|---|---|---|---|
| 人工智能 AI | 让机器具备类人智能 | 规则或数据驱动均可 | 专家系统、智能助手 |
| 机器学习 ML | 从数据中学习规律 | 统计学习、概率建模 | 决策树、SVM、随机森林 |
| 深度学习 DL | 自动提取高层特征 | 多层神经网络 | CNN、RNN、Transformer |
| 大模型 LLM | 通用语言理解与生成 | 超大规模深度预训练 | GPT、BERT、Claude |
从这张表中可以清楚地看到:每一个内层概念都继承了外层目标,同时采用了更具体、更现代的实现手段。
8. 常见误区澄清
误区一:AI 就是深度学习
错误。深度学习只是实现 AI 的一条路径。规则系统、传统机器学习同样属于 AI 的范畴,而且很多工业场景仍然依赖它们。
误区二:机器学习必须用神经网络
错误。机器学习包含大量非神经网络算法,如决策树、支持向量机、贝叶斯方法等。并非所有机器学习都是深度学习。
误区三:大模型是凭空出现的新学科
不准确。大模型是深度学习在大数据、大算力驱动下发展出的规模化形态,其根基仍然是机器学习与人工智能的长期积累。
误区四:参数越多,模型一定越强
不一定。模型能力还取决于数据质量、训练方法、对齐策略与推理能力。规模是重要因素,但不是唯一因素。
9. 结语:顺着脉络理解,就不容易被概念绕晕
把这三个概念放进同一条时间线与包含关系中,一切就会变得清晰:
- 人工智能回答了“我们要做什么”;
- 机器学习回答了“如何让机器自己学”;
- 深度学习回答了“用什么结构学得更好”;
- 大模型则是这条路径在当前规模下的集大成者。
理解它们之间的层层嵌套关系,不仅有助于你看懂技术文章,更能帮助你判断一项新技术到底处于版图的哪个位置。希望这篇文章能帮你建立起一张清晰的技术全景图。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)