【从词向量到Transformer:大语言模型(LLM)的技术演进简述】
·
引言
自然语言处理(NLP)领域在过去几年经历了革命性变革。从简单的词向量到Transformer架构,技术的每一步跨越都推动着模型从"机械记忆"迈向"语义理解"。
词向量:符号化表征的局限
- 技术背景
早期NLP使用one-hot编码表示词语,每个词对应一个高维稀疏向量,如:猫[1,0,0,0] 狗[0,1,0,0] - 核心问题
语义鸿沟:向量正交导致模型无法捕捉词语间关系(如猫与狗同为宠物)
维度灾难:词汇规模扩大时,存储与计算成本激增
词嵌入:语义空间的构建
- 技术突破
将词语映射到低维稠密向量空间,使语义相近的词语向量距离更近 - 优势
迁移学习:预训练的词向量可以用于下游任务,如:情感分类
类比推理:支持向量运算,如:“国王-男+女=女王”
实际应用:电商场景中,手机与耳机向量相似度高于手机与黄金,助力于推荐系统
序列建模:RNN短期记忆局限
-
技术架构
循环神经网络RNN与其变体LSTM引入门控制机制,处理序列数据并保留上下文信息 -
优势
支持文本生成 -
局限
长依赖失效:随着序列长度增加,模型难以捕捉远距离词关系
训练低效:时序依赖导致无法并行计算
Transformer:颠覆性架构与并行化革命
-
核心创新
通过自注意力机制和位置编码,彻底解决了长依赖与训练低效问题 -
自注意力机制
动态权重分配:每个词与序列中的所有词计算注意力权重,捕捉全局依赖关系。如:狗拿耗子,因为它多管闲事,这里的 它 通过自注意力机制关联到 狗 而非 耗子
并行计算:摒弃RNN中的时序计算,实现矩阵并行化,训练速度提升数倍
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)