目录

    1. 开篇:为什么总感觉这几个词“混着说”
    1. 一张图看懂三者的包含关系
    1. 人工智能(AI):最宏大的目标
    • 3.1 什么是人工智能
    • 3.2 人工智能的两条路线
    1. 机器学习(ML):实现 AI 的核心路径之一
    • 4.1 机器学习的本质
    • 4.2 传统机器学习的三类任务
    • 4.3 机器学习的痛点
    1. 深度学习(DL):机器学习的进阶武器
    • 5.1 深度学习的核心:神经网络
    • 5.2 深度学习为什么在这个时代爆发
    • 5.3 深度学习的代表结构
    1. 大模型:深度学习的规模化延伸
    • 6.1 大模型从何而来
    • 6.2 大模型与三者的关系定位
    1. 三者关系总结:一张对比表理清边界
    1. 常见误区澄清
    1. 结语:顺着脉络理解,就不容易被概念绕晕

1. 开篇:为什么总感觉这几个词“混着说”

如果你刚接触技术圈,大概率会频繁听到这样几个词:人工智能(AI)、机器学习(ML)、深度学习(DL)、大模型(LLM)。它们有时候被并列使用,有时候又被互相替代,甚至很多文章会把“深度学习”直接等同于“人工智能”。

这种混用并不奇怪,因为这几个概念本身就层层嵌套、关系紧密。但如果要真正理解大模型处在技术版图的什么位置,就必须先把 AI、机器学习、深度学习三者之间的关系理清楚。

本文会用最直白的方式,带你彻底搞懂这三个概念的边界与联系,并说明“大模型”是如何在这条技术脉络上生长出来的。

2. 一张图看懂三者的包含关系

先给出一个最经典的结论:

人工智能 ⊃ 机器学习 ⊃ 深度学习

也就是说,深度学习是机器学习的一个子集,机器学习又是人工智能的一个子集。大模型则是深度学习发展到一定阶段后,在规模、算力与数据共同驱动下涌现出的具体形态。

下面这张流程图可以帮你快速建立整体认知:

人工智能 AI

机器学习 ML

深度学习 DL

大模型 LLM

专家系统 / 规则系统

传统机器学习算法

CNN / RNN / Transformer

GPT / BERT / Claude 等

这张图表达了三层含义:

  1. 人工智能是最大的目标,只要让机器表现出“像人一样”的智能行为,都属于广义 AI。
  2. 机器学习是通往 AI 的一条核心路径,强调“从数据中学习规律”,而不是靠人手工编写规则。
  3. 深度学习是机器学习中更现代、更强大的分支,依靠多层神经网络自动提取特征。

如果用一个更生活化的类比,可以把它们的关系想象成俄罗斯套娃:

  • 人工智能是最大的那个套娃,代表一个宏大目标;
  • 机器学习是中间套娃,是实现这个目标的一种核心方法;
  • 深度学习是最里面的套娃,是机器学习中更具体的技术路线;
  • 大模型则是在深度学习这个套娃上,投入更大规模数据与算力后打磨出的“加强版”。

以后看到“AI”“机器学习”“深度学习”“大模型”这四个词时,可以先判断它是在讲目标、方法,还是具体技术路线,这样就不容易混淆。

3. 人工智能(AI):最宏大的目标

3.1 什么是人工智能

人工智能是一个相对宽泛的愿景,目标是让机器具备感知、理解、推理、决策、创作等能力。只要一个系统能够完成通常需要人类智能才能完成的任务,它就可以被纳入人工智能的范畴。

人工智能并不限定实现方式。早在上世纪,人们就已经通过“专家系统”来实现某些 AI 能力:由人类专家把知识整理成一条条规则,例如“如果发烧且咳嗽,那么可能感冒”,再交给计算机执行。

人工智能领域还有一个经常被提起的判断标准:图灵测试。它的核心思想是,如果一台机器能够在对话中让人类无法分辨对方是人还是机器,就可以认为它具备了某种“智能”表现。

当然,图灵测试更多衡量的是“看起来像不像人”,并不等同于真正意义上的理解。现代人工智能研究已经延伸出许多细分方向,例如计算机视觉、自然语言处理、语音识别、机器翻译、机器人学、推荐系统等。它们共同构成了 AI 的完整版图,而机器学习只是其中实现这些能力的一条重要路径。

3.2 人工智能的两条路线

  • 规则驱动:靠人编写明确规则,适合逻辑清晰、场景封闭的问题。
  • 数据驱动:让机器从大量样本中找到规律,更适合规则难以穷举的复杂场景。

机器学习就属于后者,它不要求人类把知识总结成规则,而是让算法自己在数据中“学”出经验。

4. 机器学习(ML):实现 AI 的核心路径之一

4.1 机器学习的本质

机器学习不再显式地告诉计算机每一步该怎么做,而是给它大量输入与输出样本,让它在样本中寻找映射关系。一个经典定义是:

如果一个程序在任务 T 上的表现,随着经验 E 的增加而提升,那么这个程序就在学习。

例如,与其手工编写“如何识别猫”的规则,不如给模型成千上万张标注好的猫与非猫图片,让算法自己总结出“怎样算一只猫”。

4.2 传统机器学习的三类任务

  1. 监督学习:训练数据带标签,例如房价预测、垃圾邮件分类。
  2. 无监督学习:数据没有标签,让模型自行发现结构,例如聚类、降维。
  3. 强化学习:通过“试错 + 奖励”学习策略,例如游戏 AI、机器人控制。

常见的传统机器学习算法包括线性回归、逻辑回归、决策树、随机森林、支持向量机等。这类算法在许多结构化数据场景中依然非常实用。

为了更好地区分这三类任务,可以这样记:

  • 监督学习的核心是“有答案的学习”。训练数据中每个样本都标注了正确答案,模型的任务是学会从输入预测输出。除了房价预测和垃圾邮件分类,典型应用还包括信用评分、疾病诊断、图像分类等。常见算法有线性回归、逻辑回归、决策树、随机森林、支持向量机等。
  • 无监督学习的核心是“没有答案,自己找规律”。模型需要从无标签数据中发现隐藏结构。常见的聚类算法如 K-Means,可以把相似用户自动分组;降维算法如 PCA,则常用于数据可视化和去噪。
  • 强化学习的核心是“在环境中试错”。模型不是一次性给出答案,而是在与环境持续交互中做出动作并获得奖励或惩罚,目标是最大化长期累计奖励。典型应用包括 AlphaGo、自动驾驶决策、机器人控制等。

这三类任务并不是完全割裂的,实际项目中经常组合使用。例如先通过无监督学习做预训练或降维,再用监督学习进行精调;强化学习中也可能使用神经网络来近似策略或价值函数。

4.3 机器学习的痛点

传统机器学习往往依赖“特征工程”:需要人手动设计并提取对任务有帮助的特征。比如做图像分类,过去可能需要人工设计边缘、纹理、颜色直方图等特征。特征设计得好不好,直接决定模型效果。

这也为深度学习登上舞台埋下了伏笔——能不能让模型自己学特征?

5. 深度学习(DL):机器学习的进阶武器

5.1 深度学习的核心:神经网络

深度学习属于机器学习,但它使用“深度神经网络”作为模型。所谓“深度”,是指网络包含很多隐藏层,可以逐层提取从低级到高级的抽象特征。

以人脸识别为例:

  • 底层网络可能学会识别边缘、颜色块;
  • 中层网络学会组合出眼睛、鼻子等局部结构;
  • 高层网络则能识别完整的人脸语义。

整个过程不再需要人类手工设计特征,网络会端到端地自动完成。

5.2 深度学习为什么在这个时代爆发

深度学习的概念并不新鲜,早在上世纪就已出现。它真正爆发的背后,是三个要素的同时成熟:

  1. 大数据:互联网与传感器带来了海量训练样本。
  2. 强算力:GPU 等并行计算设备大幅加速了神经网络训练。
  3. 更好的算法:激活函数、优化器、归一化、残差连接等技术让深层网络可训练。

如果再往前追溯,深度学习大致经历过三次比较明显的发展浪潮:

  1. 1940—1960 年代:以感知机为代表的早期神经网络研究,但受限于理论工具与算力,很快遇到瓶颈。
  2. 1980—1990 年代:反向传播算法的提出让多层网络可以被训练,但数据不足与计算昂贵等问题依旧限制其规模。
  3. 2006 年之后:深度置信网络、ReLU 激活函数、GPU 训练等进展相继出现,尤其是 2012 年 AlexNet 在 ImageNet 图像识别竞赛中大幅刷新纪录,深度学习的潜力开始被广泛认可。

现在人们常说的“深度学习”,主要建立在第三次浪潮所积累的数据、算力与算法基础之上。它不是突然出现的技术,而是几十年研究积累后的集中爆发。

5.3 深度学习的代表结构

  • CNN(卷积神经网络):擅长图像等空间结构数据。
  • RNN / LSTM:擅长序列数据,曾经广泛应用于文本与语音。
  • Transformer:通过注意力机制并行处理序列,成为当前大语言模型的基础架构。

正是 Transformer 的出现,为大模型的规模化发展打开了大门。

6. 大模型:深度学习的规模化延伸

6.1 大模型从何而来

大模型并不是一个与 AI、机器学习、深度学习并列的独立学科,而是深度学习在“大规模预训练”范式下的产物。

其核心思路是:在一个超大神经网络上,用海量语料进行预训练,让模型先学会语言的通用规律,再针对具体任务做微调或提示。模型规模越大、数据越充分,其在理解与生成上的能力往往越强,甚至出现“涌现能力”。

可以把大模型的训练过程粗略拆成三个阶段:

  1. 预训练:在海量文本上学习语言规律,让模型掌握词汇、语法、常识与推理等通用能力。这一阶段成本最高,通常需要成百上千张 GPU 连续训练数月。
  2. 微调:利用人类标注的高质量指令数据,让模型学会“按照要求回答问题”,从单纯续写文本转向完成具体任务。
  3. 对齐:通过人类反馈强化学习等方法,让模型更符合人类价值观、更少输出有害内容,同时提升回答的有用性与稳定性。

值得注意的是,“大”并不是唯一追求。更大的参数规模带来了更强能力,但也带来训练成本、推理延迟与部署门槛等问题。因此,行业也在探索小模型、蒸馏、量化与混合专家结构等方向,试图在能力与效率之间取得平衡。

6.2 大模型与三者的关系定位

  • 从目标看,大模型服务于人工智能这个总目标。
  • 从方法看,大模型使用机器学习,尤其是自监督学习来学习语言规律。
  • 从结构看,大模型依赖深度学习,主流架构是 Transformer。

因此可以说:大模型是深度学习中一条极具代表性的技术分支,也是当前最接近通用人工智能愿景的落地形态之一。

7. 三者关系总结:一张对比表理清边界

下面从“解决什么问题”“实现方式”“典型代表”三个维度进行对比:

概念解决什么问题实现方式典型代表
人工智能 AI让机器具备类人智能规则或数据驱动均可专家系统、智能助手
机器学习 ML从数据中学习规律统计学习、概率建模决策树、SVM、随机森林
深度学习 DL自动提取高层特征多层神经网络CNN、RNN、Transformer
大模型 LLM通用语言理解与生成超大规模深度预训练GPT、BERT、Claude

从这张表中可以清楚地看到:每一个内层概念都继承了外层目标,同时采用了更具体、更现代的实现手段。

8. 常见误区澄清

误区一:AI 就是深度学习

错误。深度学习只是实现 AI 的一条路径。规则系统、传统机器学习同样属于 AI 的范畴,而且很多工业场景仍然依赖它们。

误区二:机器学习必须用神经网络

错误。机器学习包含大量非神经网络算法,如决策树、支持向量机、贝叶斯方法等。并非所有机器学习都是深度学习。

误区三:大模型是凭空出现的新学科

不准确。大模型是深度学习在大数据、大算力驱动下发展出的规模化形态,其根基仍然是机器学习与人工智能的长期积累。

误区四:参数越多,模型一定越强

不一定。模型能力还取决于数据质量、训练方法、对齐策略与推理能力。规模是重要因素,但不是唯一因素。

9. 结语:顺着脉络理解,就不容易被概念绕晕

把这三个概念放进同一条时间线与包含关系中,一切就会变得清晰:

  • 人工智能回答了“我们要做什么”;
  • 机器学习回答了“如何让机器自己学”;
  • 深度学习回答了“用什么结构学得更好”;
  • 大模型则是这条路径在当前规模下的集大成者。

理解它们之间的层层嵌套关系,不仅有助于你看懂技术文章,更能帮助你判断一项新技术到底处于版图的哪个位置。希望这篇文章能帮你建立起一张清晰的技术全景图。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐