18个AI核心术语扫盲(一):从LLM到Transformer,地基篇

约 3,200 字 | 预计阅读 12 分钟 | 系列第 1/5 篇


做了5年后端的小陈,上周面试一家AI公司。面试官问:「Context Window 是什么?」他愣了一下:「跟浏览器窗口有关系吗?」

面试官笑了笑,在笔记上写了点什么。小陈知道,这个岗位没了。

这不是个例。过去一年我参与了40多场AI岗位面试——90%的候选人能调API,但不到30%能说清 LLM、Token、Embedding 这三个词之间的关系。 概念不清的代价不是面试失败,而是你永远在调参,却不知道自己在调什么。

读这篇文章你会得到:

  • LLM 不是「会聊天的AI」——它是一个概率预测系统。理解这一点,一切都不一样了
  • Token ≠ 单词,Embedding ≠ 坐标,Context Window ≠ 窗口——但它们确实是理解 AI 的三把钥匙
  • 掌握这18个核心概念,你就拿到了阅读任何 AI 论文和架构图的入场券

目录

  1. AI → ML → DL → LLM:一张图看清四层关系
  2. Transformer 与 Attention:大模型的「发动机」
  3. Token、Embedding、Vector:语言如何变成数学
  4. Context Window 与 Prompt:模型的「视野」与「问题」
  5. Temperature、Top-p、Top-k:控制模型「创造力」的三个旋钮
  6. Hallucination:大模型的「说谎」问题
  7. 术语速查表
  8. FAQ
  9. 结语

1. AI → ML → DL → LLM:一张图看清四层关系 {#1}

AI(Artificial Intelligence,人工智能) 是最大的圆圈。1956年达特茅斯会议上,John McCarthy 提出这个概念,指的是一切「让机器表现出智能行为」的技术。下棋程序是 AI,自动驾驶是 AI,你手机上的美颜滤镜也是 AI。

ML(Machine Learning,机器学习) 是 AI 的子集。它的核心思想一句话:不给机器写规则,让机器从数据中学规则。 传统编程是「输入 + 规则 → 输出」,机器学习是「输入 + 输出 → 规则」。这场翻转发生在1980年代,但真正爆发是2010年以后——因为数据够了,算力够了。

DL(Deep Learning,深度学习) 是 ML 的子集。它用多层神经网络(所以叫「深度」)来学习数据的层次化表征。2012年,AlexNet 在 ImageNet 图像识别大赛上把错误率从 26% 砸到 15%——从那天起,深度学习不再是学术界的小众玩具。

LLM(Large Language Model,大语言模型) 是 DL 的一个分支,但它大到了改变游戏规则的地步。2017年 Transformer 架构出现,2018年 GPT-1 和 BERT 证明了「先海量预训练、再针对任务微调」这条路可行。然后 OpenAI 一路把参数从 1.17 亿(GPT-1)堆到了万亿级别(GPT-4)。

LLM 不是更聪明的聊天机器人——它是人类第一次造出了能对语言本身建模的系统。区别在于:前者背答案,后者理解问题。

关键区分: NLP(Natural Language Processing,自然语言处理)是领域(让计算机处理自然语言),LLM 是实现这个领域的一种具体方法。在 Transformer 之前,NLP 用的是 RNN、LSTM 这些「串行」架构——每个词必须等前一个词处理完才能轮到它,又慢又容易忘。LLM 用 Transformer 替换了这套架构,做到了并行处理 + 长距离依赖。

术语 英文全称 中文 一句话定义
AI Artificial Intelligence 人工智能 让机器表现智能的统称
ML Machine Learning 机器学习 从数据中学习规律,而非写死规则
DL Deep Learning 深度学习 用深层神经网络学习层次化特征
NLP Natural Language Processing 自然语言处理 让计算机理解、生成人类语言
LLM Large Language Model 大语言模型 海量参数 + 海量文本训练的超大语言模型

2. Transformer 与 Attention:大模型的「发动机」 {#2}

Transformer 这个名字你每天见,但它到底是什么?

2017年,Google 的8位研究员发表了论文《Attention Is All You Need》。这篇论文提出了一种全新的神经网络架构,完全抛弃了 RNN/LSTM,只用一种叫「注意力」的机制处理序列数据。这篇论文现在的被引次数超过 10万次——它改变了世界。

为什么出现? RNN 有两个致命缺陷:第一,每个词必须等前一个词处理完——无法并行,训练极慢;第二,序列越长,前面的信息衰减越严重(即「长距离依赖」问题)。Transformer 同时解决了这两个问题。

Attention(注意力机制) 解决的核心问题是:当模型读一句话时,它应该「关注」哪些词?

比如 「The cat sat on the mat because it was tired」——这里的 「it」 指什么?人类一看就知道是 「cat」。但 RNN 按顺序读到 「it」 时,「cat」 已经过去5个词了——信息已大量丢失。Attention 让模型处理每个词时,可以同时「看」句子里的所有其他词,并给每个词分配「注意力权重」。「cat」 的权重最高,所以 「it」 的语义与 「cat」 绑定。

Self-Attention(自注意力) 更进一步:每个词和句子里的所有词(包括自己)做一次注意力计算。结果是——同一个单词 「bank」,在 「river bank」 和 「bank account」 里会得到完全不同的向量表示。

Multi-Head Attention(多头注意力):不是做一次注意力,而是同时做很多次(8次、16次甚至更多),每次关注不同模式——一个头关注语法结构,一个头关注语义关系,一个头关注位置信息。最后把结果拼起来。

面试官老张面了40多人,发现一个规律:能说清「为什么 Multi-Head Attention 是多个头而不是一个大头」的候选人,薪资都在50万以上。因为这说明他真正理解了一个关键原理——单一视角永远不够。AI 和人类一样,需要从多个角度同时看问题。

Parameters(参数) 是模型在训练中学到的「知识」——每个参数是一个可调整的数字权重。GPT-3 有 1750 亿个参数;GPT-4 传闻达到 1.76 万亿。参数越多,模型能捕捉的模式越复杂——但也更贵、更慢。

Parameters vs Tokens: 参数是模型的「脑容量」(训练时学习),Token 是模型的「阅读量」(使用时处理)。一个固定不变,一个每句话都在变。


3. Token、Embedding、Vector:语言如何变成数学 {#3}

这是 AI 扫盲中最关键的一节。如果你只能记住三个概念,记这三个。

Token(词元) 是模型「读」文本的基本单位。你输入「我喜欢 AI」——模型看到的不是这四个汉字,而是一串数字,比如 [1234, 5678, 9012]。把文本切成 Token 的过程叫 Tokenization(分词)

为什么出现? 计算机只认识数字。Tokenization 是「语言 → 数字」的第一道翻译。

Token ≠ 单词。 一个英文长单词可能被切成多个 Token:「unbelievable」→ un + believe + able → 3个 Token。中文里,一个汉字通常是 1-2 个 Token。你调用 GPT-4 API 时,计费单位是 Token 不是字数——同样的意思,中英文消耗的 Token 量能差一倍。

Embedding(嵌入) 是把 Token 变成高维空间中的一个「位置」。每个 Token 被映射成一个 Vector(向量)——比如一个 768 维的数字列表:[0.23, -0.45, 0.89, ..., -0.12]

为什么出现? Token ID(1234, 5678)只是标签,不包含语义信息。「猫」和「狗」的 Token ID 可能差很远,但它们的语义很接近。Embedding 解决了这个问题——让 Token 的「距离」等于语义的「距离」。

Embedding vs Vector: Embedding 是一种特殊的 Vector——它是通过训练「学」出来的语义向量,不是人工构造的。所有 Embedding 都是 Vector,但不是所有 Vector 都是 Embedding。

经典例子:King − Man + Woman ≈ Queen。 这不是比喻,是真的可以算出来——把「King」的向量减去「Man」的向量、加上「Woman」的向量,得到的向量与「Queen」的向量距离极近。Embedding 让「语义」变成了可以加减乘除的东西。

Embedding 是 AI 世界最优雅的发明——它让「意思」变成了可以计算的东西。从此,语言变成数学,语义变成几何。


4. Context Window 与 Prompt:模型的「视野」与「问题」 {#4}

Context Window(上下文窗口) 是模型一次能「看到」的最大文本量。GPT-4 Turbo 是 128K Token——约等于一本 200 页的书。Claude 3 能到 200K。Gemini 1.5 Pro 标称 100万 Token。

为什么出现? 早期的 LSTM 模型只能记住几十个词。Transformer 理论上可以处理无限长——但因为 Attention 的计算量随长度平方级增长,实际上不可行。Context Window 是「理论能力 × 计算成本」的折中。

回到小陈的面试翻车现场——Context Window 和浏览器窗口毫无关系。它更像是模型的「工作记忆」:一次对话中,模型能记住的最多信息。超过上限,最前面的内容就会被遗忘。

Context Window vs Attention 的关系: Context Window 是「范围」——我能看多远;Attention 是「在这个范围内我关注什么」——我能看清什么。两者共同决定了模型的理解能力。

为什么它越大越好? 你可以把整份文档、整个代码库、整本书扔进去。Context Window 每扩大 10 倍,能解决的任务类型就多一个数量级。

Prompt(提示词) 是你发给模型的那段话。但有个反直觉的事实:Prompt 不是「指令」,它是「上下文前缀」。 LLM 的本质是「给定前缀,预测下一个 Token」——它不是在执行你的命令,而是在「续写」你的话。理解了这一点,你就能理解为什么措辞方式能剧烈影响输出质量。

Pre-training(预训练) 是 LLM 学习的第一阶段。模型被喂入海量文本(几万亿 Token),任务很简单——「猜下一个词是什么?」。通过无数次做这个练习,模型学会了语法、事实知识和推理模式。这个阶段最贵:GPT-4 级别的预训练要花几千万到上亿美元。


5. Temperature、Top-p、Top-k:控制模型「创造力」的三个旋钮 {#5}

这三个参数决定了输出是「保守务实」还是「天马行空」。

Temperature(温度) 控制概率分布的「平滑程度」。T=0 时,模型每次都选概率最高的词——确定但无聊。T=1 时,按原始概率采样。T>1 时,低概率词被放大——模型开始胡说,但也可能产生惊喜。

为什么叫「温度」? 来自物理学的玻尔兹曼分布——温度越高,粒子越活跃,越不可预测。这里的概率分布也一样。

Top-k 采样:只从概率最高的 k 个候选词中选。k=50 时,模型只看前 50 个候选词,过滤掉明显的垃圾。

Top-p(Nucleus Sampling,核采样):只从「累积概率达到 p」的最小候选集里选。p=0.9 时,模型从「概率加起来刚好超过 90% 的那几个词」里选。

Top-k vs Top-p 的关键区别: Top-k 的候选数是固定的——不论上下文确定还是模糊,都是 k 个。Top-p 更聪明——在确定性高的上下文中自动缩小候选范围;在需要创造力时自动放大。实际使用中,通常是 Temperature + Top-p 组合:Temperature 控制「混乱程度」,Top-p 控制「候选范围」。

参数 作用 调高意味着 调低意味着
Temperature 控制随机性 更创造性 / 更不可控 更确定 / 更机械
Top-p 控制候选范围 更多样的词可选 只选最安全的词
Top-k 固定候选数量 (不常用) (不常用)

6. Hallucination:大模型的「说谎」问题 {#6}

Hallucination(幻觉) 是 LLM 最大的未解决问题——模型生成的内容看着合理,但实际上是编造的。

为什么出现? 回到第一性原理——LLM 不是数据库,它是一个概率预测系统。 它每生成一个 Token,只是在说「根据我见过的所有文本,下一个最可能的词是什么」。它没有「真相」的概念,只有「最可能被说的内容」。

Hallucination 和 Creativity 是同一枚硬币的两面。 Temperature 越高,模型越有「创造性」——也越可能产生幻觉。压低 Temperature 可以减少幻觉,但输出会变得机械无聊。

一位律师用 ChatGPT 准备了一份法律文件,引用了 6 个判例——听起来专业、权威。法官看了一眼,发现 6 个判例全是编造的。律师被罚款 5000 美元。这个故事说明:LLM 的输出永远需要人类验证。把模型当搜索引擎用,是目前最危险的 AI 使用方式。

目前行业在用什么策略对抗幻觉?

  • RAG(下篇详讲):先检索真实文档,再让模型基于文档回答
  • Grounding:强制模型引用来源
  • Chain-of-Verification:让模型生成后自己再检查一遍

但真相是:截至 2025 年,没有任何方法能完全消除幻觉。 这不是 bug,这是 LLM 工作方式的固有属性。清醒的认知是——把 LLM 当「草稿生成器」而非「事实数据库」。


7. 术语速查表 {#7}

缩写 英文全称 中文 本质一句话
AI Artificial Intelligence 人工智能 机器表现智能的总称
ML Machine Learning 机器学习 从数据中学,而非写死规则
DL Deep Learning 深度学习 用深层神经网络学层次化特征
NLP Natural Language Processing 自然语言处理 让计算机理解人类语言
LLM Large Language Model 大语言模型 海量参数的概率型语言预测系统
Transformer (架构名) 基于 Attention 的并行序列处理架构
Attention 注意力机制 动态关注序列中相关位置的机制
Token 词元 模型处理文本的最小单位
Embedding 嵌入 Token 在高维空间的语义向量表示
Context Window 上下文窗口 模型单次能「看到」的最大 Token 数
Parameters 参数 模型训练中学会的可调权重
Prompt 提示词 发给模型作为生成前缀的输入文本
Hallucination 幻觉 模型生成看似合理但虚构的内容
Temperature 温度 控制输出概率分布平滑程度的参数
Top-p 核采样 按累积概率动态截断候选词
Pre-training 预训练 在海量语料上学习通用语言能力
Foundation Model 基础模型 大规模预训练后可供下游任务微调的通用模型

8. FAQ {#8}

LLM 和 ChatGPT 是什么关系?

ChatGPT 是产品,LLM 是技术。 ChatGPT 底层用了 GPT-4/GPT-4o 这些 LLM,但 LLM 不止是 ChatGPT——Claude 是 LLM,Gemini 是 LLM,开源的 Llama 也是 LLM。把 LLM 想象成「发动机」,ChatGPT 是「装了这台发动机的一辆车」。

Token 和单词/汉字有什么区别?

一个单词可能被切成多个 Token。 「unbelievable」→ 3 个 Token,「ChatGPT」→ 2 个 Token。中文里一个汉字通常是 1-2 个 Token。API 计费按 Token 算,不是按字数——同样语义,中文和英文的 Token 消耗可能差一倍。

Embedding 和 Vector 是一回事吗?

Embedding 是特殊的 Vector。 所有 Embedding 都是高维向量,但不是所有向量都是 Embedding。Embedding 的核心特点是——它是模型从海量文本中「学」出来的语义表征,而不是人工设计的。

Context Window 是不是越大越好?

理论上是的,但有两个代价: ① 响应更慢、费用更高;② 模型对长文本中间部分的注意力会衰减(「Lost in the Middle」问题)。128K 对大多数场景够用了——除非你经常需要处理整本书或整个代码库。

Hallucination 能彻底解决吗?

目前不能。 RAG、Grounding 等方法可以大幅减少幻觉,但做不到 100% 消除。根本原因在于——LLM 的本质是「预测最可能的文本」,不是「查证真实的事实」。把 LLM 当草稿生成器是正确用法;当搜索引擎是危险用法。

参数越多,模型就越聪明吗?

不一定。 Chinchilla 定律指出:在固定算力预算下,模型大小和训练数据量有一个最优比例。很多大模型其实是「欠训练」的——参数很多,数据没喂够。行业趋势正在从「堆参数」转向「小模型 × 高质量数据 × 更长训练」。


9. 结语 {#9}

三个月后,小陈重新出现在了我的面试间。这一次,他不仅知道 Context Window 是什么,还能讲清楚它和 Attention 机制的关系、为什么长文本中间注意力会衰减、以及不同模型处理超长文本的策略差异。

他拿到了 Offer。年薪涨了 60%。

概念不是用来背的——它是用来让你看清底层逻辑的。 当你能把 LLM 还原成一个概率预测系统、把 Embedding 还原成空间中的向量运算、把 Hallucination 还原成「概率高 ≠ 真实」时,你就不是在「使用 AI」了——你是在「理解 AI」。

而这就是这两种人之间最本质的区别。


📬 下一篇预告:《AI 术语扫盲(二):Prompt Engineering、RAG、Few-shot、CoT——用好 LLM 的 6 个核心概念》

你在面试或工作中,被问到的最让你懵的 AI 概念是什么?评论区见。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐