别一上来就啃 Transformer:程序员的大模型学习路线图
别一上来就啃 Transformer:程序员的大模型学习路线图
0 基础入门大模型,Transformer、BERT 这些迟早要学——但你的第一口,真不一定从这里咬下去。
我观察身边程序员学大模型,常见两种翻车现场:
一种人天天刷 Prompt、LangChain、LoRA,像集邮一样攒概念,问「RAG 和 Agent 有啥区别」——沉默三秒,开始百度。
另一种人一上来就钻 Attention 公式,三个月推导完,本地模型还没跑起来,热情先被数学耗干了。
大模型学习和传统编程不太一样。老路子是「基础 → 进阶 → 项目」,这里更管用的一条是:
先学会用大模型 → 再搞懂它为啥能说话 → 最后把它塞进真实业务里。
下面按这条逻辑,把完整知识架构拆成六个阶段。你可以当地图用,走到哪一站,心里都有数。
第一站:大模型开发入门——先让模型在你电脑上跑起来
这一阶段的目标很简单:从「只会打开网页版 ChatGPT 聊天」,进化到「我电脑里有个模型,Python 能调它」。
大模型项目介绍和环境搭建
先搞清楚 LLM 是什么、Token 是啥、上下文窗口为啥会爆、GPT / DeepSeek / Qwen 这些名字各代表哪一派。不用背参数表,知道「选模型就像选数据库——没有万能,只有合不合适」就行。
私有化部署大模型
用 Ollama 把模型拉到本地,配个 ChatBox 可视化聊两句。第一次看模型在自己机器上跑,那种感觉很像当年第一次 Hello World 跑通——土,但真实。
本地部署的好处:不用每次对话都担心 API 账单,调试 Prompt 可以放飞自我,删了重来也不心疼。
Python 基础语法
变量、函数、文件读写、异常处理。别被「AI 工程师」吓到,这阶段 Python 要求不高——能写脚本、能调库、报错看得懂,够用了。你写 Java 的 if-else 都能转,这点语法真不算门槛。
Python 调用大模型 API
封装 HTTP 请求,对接本地 Ollama 或云端 API,处理流式输出。到这里,你已经从「用户」变成「开发者」了——模型不再是网页里那个对话框,而是你程序里的一个函数调用。
阶段实战:智能聊天机器人
搭一个能对话、能记几轮历史的聊天机器人,CLI 或简单 Web 都行。功能可以很土,但跑通那一刻,后面学 RAG、Agent 才有抓手。
这一站的心态: 别急着当算法大神,先当「大模型套壳程序员」——会调 API、会搭架子,不丢人,这是正经起点。
第二站:大模型应用开发——从调接口到能拿出 Demo
会调 API 只是入门。业务方要看的不是 curl 命令,是「能不能帮我做个智能助手」。这一阶段,就是把 Python 工程能力和低代码平台练到能 快速出活。
Python 语言进阶
面向对象的封装、继承、多态——大模型项目里迟早要拆 DocumentLoader、LlmClient、ChatSession 这些类,OOP 是模块化的基本功。
闭包、装饰器、正则表达式,属于 Python 的「瑞士军刀」,写框架、写中间件时常用。
HTTP、TCP、Socket 网络编程——调 API 你只碰了皮毛,后面 RAG 要接各种服务、Agent 要调外部工具,网络这块得稳。
多进程、多线程、并发——文档批量入库、向量批量写入,单线程慢慢跑,你会怀疑人生的。
数据处理与统计分析
SQL:单表多表查询、窗口函数。企业数据多在库里,不会 SQL,RAG 的知识源从哪来?
NumPy:矩阵运算、ndarray。Embedding 本质是向量,后面会不断跟数组打交道。
Pandas:Series、DataFrame、聚合统计、数据清洗。大模型项目有句老话——Garbage In, Garbage Out。数据洗不干净,模型再聪明也救不了。
Matplotlib / Seaborn:可视化。分析数据分布、看训练曲线,总得会画几张图。
大模型入门
建立术语地图:Embedding 是什么、Fine-tuning 和 RAG 各解决什么问题、Agent 为啥突然 everywhere。这些词单独搜都能搜到,串起来才是一张完整的认知网。
Prompt Engineering
Zero-Shot、Few-Shot、提示词撰写与优化。Prompt 是大模型时代的「新 SQL」——写法不对,模型再强也答不到点子上。金融动态评估、行业分析这类项目,练的就是把 Prompt 写稳。
智能体平台开发(Coze + Dify)
Coze:搭智能体、私有化部署、拖工作流。像玩乐高,先拼出形状,再研究每块砖。
Dify:Docker 部署、接 RagFlow、建本地知识库 Agent。从低代码平台入手有个好处——你会直观看到「检索 → 拼 Prompt → 生成」整条链路。之后用 LangChain 手写,不是从零抽象,而是「我知道最终要长成啥样」的复现。
阶段实战
RFM 会员价值度预估、零售数据分析练 Pandas;金融行业动态风向评估练 Prompt;Coze 技术面试助手、Dify + RagFlow 智能体练平台和知识库。
这一站的关键: 能跟业务方说「给我一周,我能搭个 Demo」。Demo 丑没关系,能跑就行。
第三站:大模型核心开发技术——搞懂模型为啥能说话
很多程序员想跳过这一站,直奔 LangChain。可以理解——机器学习公式看起来就像另一种语言。但跳过后,RAG 召回差你不知道为啥、Embedding 模型选型心里没底、微调该不该做全凭感觉。
这一阶段,就是给大模型这栋大楼 打地基。
机器学习
算法分类、建模流程、特征工程。KNN、决策树、集成学习——老算法,但「怎么评估模型好不好」这套思路,RAG 评测、Agent 效果评估一样用。
分类任务的模型评估:准确率、召回率、F1。别只会背公式,想想「检索召回率」和这有啥关系——本质都是「找对了多少」。
深度学习
PyTorch:张量创建与运算、自动微分、激活函数。深度学习界的 NumPy Plus。
神经网络基础:反向传播、网络构建、损失函数、优化器。知道梯度是怎么把模型往正确方向推的,后面看 LoRA 就不会觉得是完全的黑魔法。
CNN:卷积网络结构、图像分类案例。为后面 CV 和多模态埋伏笔。
RNN:循环网络、文本生成案例。理解「序列」怎么处理,对 NLP 很重要。
NLP 自然语言处理基础
Jieba 分词、One-Hot、Word Embedding、Word2Vec——词怎么变成计算机能算的数字,这条线要捋清楚。
文本张量表示、数据分析、特征处理、数据增强。
RNN、LSTM、GRU 网络结构——老一代序列模型,现在是理解 Transformer 的前传。
Seq2Seq、注意力机制、英译法案例——Attention 第一次登场,认真看,后面全是它的天下。
NLP 技术进阶
传统 RNN/LSTM/Bi-LSTM/GRU 深入,Seq2Seq 原理,Transformer 入门和原理——大模型的祖师爷,迟早要拜。
NLP 基础任务
随机森林、FastText 原理与构建流程。BERT 原理及应用、模型优化。文本分类、模型压缩(量化、剪枝、知识蒸馏)。
阶段实战
销售数据分类预测、Cifar10 图像分类、RNN 文本生成、Seq2Seq 英译法、迁移学习实践、头条文本分类项目。
学习建议: 别每个算法都学一遍陷入泥潭。按三条线串——
- 表示线:词 → One-Hot → Word2Vec → BERT 向量
- 结构线:RNN → LSTM → Transformer
- 任务线:分类 → 生成 → 翻译 → 抽取
每学完一块,问自己:「这和我后面做的 RAG / 微调有啥关系?」
BERT 向量 → 文档 Embedding;注意力机制 → 理解 LLM 上下文;模型评估 → RAG 评测。有这条线,算法就不只是考试题。
第四站:大模型智能体开发——企业真正买单的地方
如果说前三站是「练级」,这一站就是 下副本。大部分公司的 AI 需求,就落在 RAG 知识库和 Agent 自动化这两块。
LangChain 框架
安装、六大组件、工具链使用。向量数据库构建与检索,ChatGLM 等模型集成,完整 RAG 搭建方案。LangChain 像大模型世界的 Spring Boot——东西多、抽象多,但企业项目里确实常见。
RAG 开发基础
RAG 原理、实现流程:文档加载 → 切片 → 向量化 → 检索 → 拼 Prompt → 生成。听起来五步,每步都有坑。切片切大了检索不准,切小了上下文丢失;向量模型选不对,语义相近的文档根本召不回来。
RAG 开发进阶
文档处理、向量化技术、增强生成、Query 改写。用户问「那个政策咋回事」,和文档里写的「关于 XX 规定的说明」,字面不一样,意思一样——Query 改写就是干这个的。
RAG 系统优化
向量检索优化、生成优化、RAG 评估、性能优化。RAG 不是搭完就完,上线之后才是开始。召回率、准确率、响应延迟,每一项都能折腾很久。
智能体开发基础
Agent 设计原则、核心原理与机制。ReAct 范式、Function Calling、工具调用——让模型从「只会说」变成「能动手」,这是 Agent 和聊天机器人的分水岭。
LangGraph 框架
图计算模型、多智能体协作。一个 Agent 搞不定的事,几个 Agent 分工协作——像项目组里前端、后端、DBA 各干各的,但得有人协调。
LangSmith 框架
AI 应用监控、评估、与 LangChain 集成。链路透不传、哪一步拖后腿、幻觉从哪冒出来——没有监控,优化就是盲人摸象。
阶段实战
职业教育领域 RAG 智慧问答:Milvus / Redis、Query 意图识别与改写、模块化架构,企业级问答系统的完整形态。
人力资源 RAG 简历推荐:文档向量化、检索增强、Agent 配置,招聘场景的真实痛点。
InsightScan 智扫通 Agent:ReAct、Function Call、多维度评估,生产级 C 端智能客服。
SmartVoyage 旅行助手:A2A 多 Agent、FastAPI + Streamlit,多代理协作的交互式应用。
Agent 智能工单:规则过滤、意图识别、Kafka / PostgreSQL,复杂业务场景下的全流程自动化。
特别提醒: RAG 不是「调个向量库就完事」。文档怎么切、Metadata 怎么设计、召回不够怎么办、幻觉怎么控、没有标准答案怎么评估——至少完整做透一个项目,从 PDF 入库到前端对话,全流程自己搭一遍。面试时这一个项目,比十个 Demo 都有说服力。
第五站:大模型定制开发——潜水区,憋气也要下来
前面都是「用别人训好的模型」,这一站开始「动模型本身」。对应学习路线里的深水区——微调、蒸馏、部署优化,前面欠的算法债,该还了。
Transformer 原理
Encoder / Decoder 架构、多头注意力、前馈层、LayerNorm、位置编码、子层连接。建议配合手写 Mini-GPT 或 Karpathy 的 «Let’s build GPT»——看 PPT 十遍,不如自己写一遍 forward。
迁移学习
预训练 + 微调范式,BERT 与 Hugging Face 生态,FastText。站在巨人肩膀上,别从零训,聪明人都这么干。
大模型主流运行机制
LLM 主要类别、评价指标。DeepSeek、ChatGLM、Qwen 架构差异、预训练任务、预训练 + 微调实战。选模型像选车——不是马力越大越好,看路况(场景)和预算(算力)。
大模型微调开发
全量微调 SFT:数据多、算力够时考虑,效果上限高,成本也最高。
参数高效微调 PEFT:LoRA、QLoRA——绝大多数企业的首选,改几个矩阵就适配垂直领域,像给通用模型换了个专业面具。
DeepSpeed:大模型并行训练加速,多卡玩家的必备。
部署推理优化:vLLM、Ollama,训完得能跑、跑得快、跑得省。
选学专题
大模型蒸馏(硬标签蒸馏、小模型向大模型学习)。OpenClaw 多智能体框架。DeepSeek 算法与论文解读。
阶段实战
微博文本信息抽取:LoRA + P-Tuning + Flask API 上线,感受「训完就能调」的完整闭环。
Qwen 文本摘要:QLoRA + GPTQ 量化 + vLLM 部署,体验「又要效果又要速度又要省显存」的三难选择。
中医药知识图谱:DeepSeek 抽取实体关系、Neo4j 图数据库、Faiss 向量检索、LangGraph 多 Agent 协同、Streamlit 交互界面——垂直领域平台的集大成者。
微调啥时候上?简易决策
- 数据不到 500 条、领域术语多 → 先 RAG,微调备选
- 数据 500~5000 条、输出格式固定 → LoRA / QLoRA
- 要改「说话风格 / 角色人设」→ SFT
- 要让模型「记住」大量私有知识 → RAG 为主,微调辅助格式遵循
别啥都想微调——微调不是万能钥匙,是贵且精的工具。
第六站:全模态大模型——给 AI 装上眼睛
文本玩溜了,图像和视频也在招手。这一阶段拓展 CV 和 AIGC,让技能树多开几条枝。
图像分析基础
计算机视觉基础、图像特性分析、图像处理。图像增强、经典分类网络、语义分割与实例分割——CNN、ResNet、Unet、Mask R-CNN 逐个过。
多模态大模型
GAN、扩散模型原理。Stable Diffusion 网络构成、训练方式、预测方法。文生图案例、LoRA / DreamBooth 微调、图像生成小程序。
阶段实战
图像几何颜色增强、鲜花分类、VOC 语义分割、Mask R-CNN 气球实例分割、Stable Diffusion 文生图项目。
定位建议: 除非目标岗位明确是 CV / AIGC,否则这一站可以往后排。但对理解「图文混合 RAG」和「Agent 接视觉工具」很有帮助——未来多模态是趋势,先知道门朝哪开。
加餐:面试专题——八股债,迟早要还
项目经验是面子,基础扎实是里子。面试前集中补这几块:
数据结构与算法:栈、树、链表、排序、查找、递归、贪心、动态规划——老面孔,别丢分。
机器学习 & 深度学习:分类、回归、聚类、神经网络,能讲清楚原理和应用场景。
NLP & CV 专题:BERT、Transformer、CNN、YOLO,结合项目讲比干背定义强十倍。
大模型专题:RAG 原理、Agent 架构、LoRA / QLoRA、推理优化——把项目经验和八股拧成一股绳。
三种走法:对号入座
零基础 / 转行: 入门 → 应用开发 → 智能体开发(RAG/Agent)→ 回头补核心算法 → 定制开发 → 全模态。先出活再啃公式,避免三个月推导 Attention 却连 chatbot 都没搭过。
有后端 / 全栈经验: 入门快速过 → 应用开发(数据处理可跳过部分)→ 智能体开发 → 定制开发 → 算法按需补。Python 和 SQL 有基础,直接冲进 LangChain 效率更高。
算法 / 研究向: 入门 → 核心算法 → 定制开发 → 智能体开发 → 全模态。先夯实 Transformer 和微调,再用框架做工程化。
写在最后
大模型时代,程序员最忌两种极端:
只刷概念不动手——背了 RAG 定义,从没自己切过文档、建过向量库。
一头扎进 Transformer 数学——公式推导完,API 还没调通。
Transformer 和 BERT 一定要学,但你的第一口,可以从 本地跑起一个模型、写出第一个 Python 聊天机器人 开始。
每个阶段至少做一个能展示的项目。遇到问题,再回头补原理——这比「先学完理论再动手」靠谱得多。
毕竟,大模型不会因为你把 Attention 公式背熟了,就自动帮你写完 RAG pipeline。
那个,还得你自己动手。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)