【向导篇】一篇讲透人工智能的发展
1 AI 基础认知
1.1 什么是AI
AI(Artificial Intelligence,人工智能)是一种让计算机具备理解、学习、推理、生成内容以及执行任务能力的技术。AI 不再是固定程序的机械运行,而是可以通过数据学习、自主判断、适配不同场景的智能技术。过去的软件依赖固定规则运行,而 AI 更像一种能够从数据中学习规律,并自主完成目标的新型计算方式。今天的 AI 已经不只是聊天机器人,它已经能够:写文章、写代码、生成图片、分析数据、制作 PPT等。
1.2 人工智能的发展
Ⅰ 规则时代
早期科学家像循循善诱的教师,试图将人类积累的全部知识编纂成一部部规则手册,逐条逐句地“教”给计算机。
这一阶段的主流范式是符号主义,其核心是基于逻辑符号的规则推理,工作原理类似于层层嵌套的复杂“if-else”语句,试图用确定的逻辑链条模拟智能行为(同期虽已出现连接主义、行为主义的萌芽,但尚未成为主流)。
局限:
- 缺乏灵活性:系统完全按预设剧本执行,一旦遇到模糊表述或规则之外的场景便束手无策。这条路越走越窄,科学家必须另寻他途。
- 规则永远写不完:现实世界太过纷繁复杂!就像你无法用几条简单的“if-else”规则(如有胡子、会喵喵叫)来精准定义所有“猫”——总会遇到无毛猫、断尾猫,甚至一只学猫叫的狗,让你精心构建的规则体系瞬间崩塌。
Ⅱ 机器学习
面对规则编写的全面溃败,科学家彻底转变了思路:不再直接“传授”规则,而是给机器海量带标签或无标签的示例(即数据),让它通过算法自主挖掘其中的内在规律。
这就像教孩子认识猫,我们不再费心背诵“猫的定义”,而是让他反复观察几百张猫与非猫的图片,让他自己在对比中悟出区别——这种“数据驱动”的理念,正是机器学习与符号主义的本质分野。
机器学习核心流程——以短视频APP推荐为例:
- 数据准备
- 收集数据:获取用户行为原始数据,如短视频观看时长、点赞/收藏记录、划走速度、评论内容等。
- 清洗数据:剔除无效记录,如手滑误点、1秒内划走的无效播放、重复点击等噪声数据。
- 特征工程:提取关键特征指标,如“单条视频观看占比”“同类视频累计点赞次数”“连续观看同领域视频的数量”等。
- 模型训练——让机器学会“用户喜欢什么”的规律
- 选择算法:采用协同过滤等主流推荐算法。
- 拟合模型:利用用户行为数据训练模型,自动学习“观看A类视频的用户往往也喜欢B类”“观看时长超过50%的视频,用户更倾向于点赞”等潜在规律。
- 评估与优化
- 测试数据:用新用户的行为数据验证推荐内容的表现。
- 核心指标:重点关注“推荐视频点击率”“平均观看时长”等关键指标。
- 调优迭代:动态调整算法参数(如提升“同类视频连续观看数”的权重),持续优化推荐匹配度。
局限:
- 特征工程成本高昂:需要工程师针对每个任务人工设计专属特征,费时费力——比如要让模型识别熊猫,就得专门标注“黑眼圈、圆脸型”等特征;换作老虎识别任务,又得重新设计“条纹、额前王字”等特征,无法跨任务自动迁移。
- 复杂任务力不从心:难以处理带有逻辑链条和因果关系的复杂场景,比如“小明去超市买牛奶,发现没带钱,于是回家取”这一完整因果链,机器学习难以有效建模。
机器学习专栏(持续更新)→ 点击跳转
Ⅲ 深度学习
为攻克机器学习“依赖人工设计特征”的核心瓶颈,科学家提出了“多层神经网络”架构,旨在模拟人脑的层级化信息处理机制,让机器从原始数据(如图像像素、声音波形)中自动逐层提炼特征——这正是深度学习的革命性突破,彻底将人工特征工程从流程中解放出来。
神经网络核心流程——继续以短视频推荐为例:
- 层级化特征提取(模拟人脑):按“浅层→中层→深层”逐级处理用户行为数据
- 浅层网络:提取最原始的微观行为,如“点击视频A”“观看视频B超过30秒”“划走视频C”“点赞视频D”;
- 中层网络:整合基础行为,形成局部兴趣模式,如“连续3次点击美食视频”“观看宠物视频平均时长超过40秒”“从不划走搞笑视频”;
- 深层网络:组合局部兴趣,凝练为用户核心兴趣标签,如“重度美食爱好者”“宠物控”“偏爱短平快搞笑内容”。
- 自动特征工程(核心优势):彻底告别人工设计!机器直接从用户的原始行为数据(点击、时长、划走、点赞)中自主挖掘关键模式——例如自动发现“观看美食视频占比超过60%”且“连续5天点击探店内容”的用户应归类为“美食爱好者”,全程无需人工预设特征。
- 端到端学习(高效闭环):输入用户原始行为数据,直接输出最终推荐结果,中间各层级协同优化,无需人工干预,形成从数据到结果的完整闭环。
深度学习专栏(持续更新)→ 点击跳转
Ⅳ 大模型时代
然而,我们并不满足于只培养某一领域的“专才”——我们渴望的是一个“通才”:一个模型,既能谈天说地、吟诗作对,又能编程解题、逻辑推理,无所不能。
2017年,Transformer架构的横空出世带来了根本性突破。它让模型具备“一目十行”的能力,能够并行处理海量文本数据,并精准捕捉词语之间跨越长距离的依赖关系,彻底攻克了传统模型(如RNN)顺序处理效率低下、长文本记忆衰减的顽疾。
如果说Transformer架构解决的是“如何高效地学习”这一工程层面问题,那么大模型则在此基础上,将“用多大规模去学习”推向了前所未有的极致——海量参数、天量数据,造就了真正意义上的通用人工智能雏形。
AI专栏(持续更新)→ 点击跳转
2 Spring AI 应用
在传统项目开发中,你需要将大量精力投入业务逻辑的拆解、流程梳理与代码的逐行实现。如果把传统应用比作一台由固定电路驱动的专用机器——接通电源后只能执行预设动作,那么引入AI框架之后,你便是在为这台机器装上一颗能够理解自然语言的智能大脑。而Spring AI这样的框架,正是这颗大脑的标准化接口与即插即用的电源适配器。
Spring AI本质上是一个面向AI应用开发的统一抽象层。它的核心价值在于:将OpenAI、阿里云、DeepSeek等不同厂商的SDK差异彻底屏蔽,让你无需关心底层API的调用细节,只需沿用Spring Boot熟悉的编程习惯与开发范式,就能无缝驱动任何主流大模型——一套代码,任意切换,极低成本完成AI能力集成。
一句话总结:Spring AI让AI集成从“定制化开发”变成“标准化配置”,让Java开发者用最少的改动,让应用获得最强大的智能能力。
详情请阅读 -> Spring AI 笔记
3 AI 项目的痛点
Ⅰ 领域知识缺失
模型不懂行业术语、公司内部黑话和产品信息,导致模型回答不专业、不准确,甚至产生错误。
案例:在金融领域,用户 OTC指“场外交易”
用户问:‘我的OTC怎么还没审核通过’
模型回答关于医药领域中的OTC的问题
Ⅱ 格式与任务不匹配
业务需要结构化输出(如意图标签、JSON格式),但模型倾向于生成自由文本,导致输出结果难以被后端系统解析和集成,自动化流程中断。
Ⅲ 价值观与风格偏差
模型风格随机,可能不符合企业所需的严谨、中立、专业的客服语调,甚至存在安全风险,用户体验差,影响品牌形象,存在合规风险。
Ⅳ 数据分布偏移
模型无法获取和理解公司内部的非公开文档、知识库和最新政策。 无法构建基于私有知识的智能问答等应用。
Ⅴ 巨大的部署与推理成本
训好的大模型对计算资源(GPU显存)要求极高,普通服务器根本无法承载,导致部署成本成为财务负担。用户问一个问题,模型需要好几秒甚至更长时间才能回答,用户体验极差。
如何解决这些痛点
- 模型微调:就是为了解决领域知识缺失、格式与任务不匹配、价值观和风格偏差的痛点 ,把通用模型培训成我们的业务专家。
- 模型压缩(量化):就是为了解决部署成本高、推理速度慢 ,给模型瘦身,让它能跑在更便宜的设备上,并且提高推理速度。
- RAG等技术:就是为了解决数据分布偏移、私域数据不可及的问题 ,给模型一本随时可查私域数据手册,让模型根据手册回答问题。
4 模型
4.1 什么是模型
通俗的理解,模型的核心功能在于描述 输入数据 与 输出结果 之间的关系,并把这个关系变成一个可以反复使用的工具。也就是说,模型就是机器学习算法从数据中学到的一个“ 规律 ”,然后把这个“规律”保存下来,变成一个可以反复使用的工具 。
案例:图像分类
需求:在安防监控中识别异常物体,自动驾驶场景中识别交通标志等,实现图像中的目标检测。
输入数据:从摄像头中获取的图像。
输出结果:图像中物体的类别标签,如“汽车”,“交通标识”,“行人”等。
训练集(学习)数据量:对于复杂的安防或自动驾驶相关任务,由于任务复杂,需要 100000 张甚至更多的图像数据来训练模型。
4.2 预训练
预训练模型是指已经在大量数据上训练过的模型,这些数据通常是通用的、广泛的语料库或数据集。预训练模型的目标是通过在大规模数据上学习丰富的特征表示,使得它们能够在多种下游任务中应用。
预训练模型通常具备以下特点:
- 大规模训练:预训练模型通常是在大规模数据集上进行训练,如 Wikipedia(维基百科)、Common Crawl(通用爬虫)、BooksCorpus(书籍) 等,学习到的表示能够捕捉丰富的语法和语义信息。
- 通用性:由于预训练模型通常是在多样化的任务或数据集上训练的,它们的表示非常通用,可以应用到多种任务中,而不需要从头开始训练。
在NLP领域,预训练模型往往是语言模型。因为语言模型的训练是无监督(没有人工标注数据,模型自己学习)的,可以获得大规模语料,同时语言模型又是许多典型NLP任务的基础,如机器翻译,文本生成,阅读理解等。
4.3 微调模型
简单来说,模型微调就是迁移学习在深度学习中的一种核心技术。迁移学习的主要思想是将从一个领域(源领域)学习到的知识、经验或技能,应用到另一个相关但不同的领域(目标领域)中,以解决目标领域中数据不足、标注成本高或任务相似但环境不同等问题,核心在于实现知识的有效迁移与再利用。
微调是指将预训练模型应用到特定任务的数据集上,并调整模型的参数,使其更好地适应新任务。通常是使用新任务的数据集继续训练预训练模型,让模型学习特定任务的特征。
微调的作用是:
- 保留通用知识 :在自然语言处理领域,预训练模型已经学到了强大的语言表征能力,包括语法、句法、基础语义和部分常识。假设我们要训练一个模型来识别电影评论中的情感倾向(积极或消极)。使用预训练模型进行微调,它已经知道“喜欢”“精彩”等词通常表示积极的情感,“讨厌”“糟糕”等词表示消极的情感,我们只需要在电影评论数据上对模型进行一些调整,就能快速得到一个准确的情感分类模型。
- 注入领域知识 :虽然预训练模型学到了很多通用知识,但不同领域的数据分布和任务目标可能差异很大。这时候,就需要在特定领域的小规模数据集上进行有监督训练(有人工标注的目标)。这个特定领域的数据集就像是给模型的一本“专属教材”,它包含了该领域特有的信息和模式。
4.4 常见的微调方法(进阶)
(一)BERT
Ⅰ 概述
BERT(Bidirectional Encoder Representations from Transformers)是由Google于2018年10月提出的一种基于Transformer的预训练语言模型。它在NLP任务中取得了突破性的成果,极大地提升了模型在问答、文本分类等任务上的表现。
Bert模型适合用于语言表达, 语言理解方面的任务, 不适合用于生成式的任务。
BERT包含两个预训练任务:
Ⅱ 预训练
任务一 : Masked Language Model (MLM:带mask的语言模型训练)
在原始训练文本中, 随机的抽取15%的token作为参与MASK(遮挡)任务的对象
在这些被选中的token中, 数据生成器并不是把它们全部变成[MASK], 而是有下列3种情况:
- 在80%的概率下, 用[MASK]标记替换该token, 比如my dog is hairy -> my dog is [MASK]
- 在10%的概率下, 用一个随机的单词替换token, 比如my dog is hairy -> my dog is apple
- 在10%的概率下, 保持该token不变, 比如my dog is hairy -> my dog is hairy
模型在训练的过程中, 模型快速学习该token的分布式上下文的语义, 尽最大努力学习原始语言说话的样子。同时因为原始文本中只有15%的token参与了MASK操作, 并不会破坏原语言的表达能力和语言规则。
任务二 : Next Sentence Prediction (NSP:下一句话预测任务)
输入句子对(A, B),模型来预测句子B是不是句子A的真实的下一句话。随机选的下一句,可能是,可能不是,不准确。
所有参与任务训练的语句都被选中作为句子A.
- 其中50%的B是原始文本中真实跟随A的下一句话.
- 其中50%的B是原始文本中随机抽取的一句话.
- 模型预测第二个句子是否是第一个句子的下一句,输出是一个二分类标签
Ⅲ 微调

a:句子对任务
- 输入:[CLS] + 句子1 + [SEP] + 句子2 + [SEP]
- 输出:[CLS]标记的隐藏状态经过一个全连接层,输出分类结果(如是否相似)。
b:文本分类(用的最多)
- 输入:[CLS] + 句子 + [SEP]
- 输出:[CLS]标记的隐藏状态经过一个全连接层,输出类别概率。
c:问答任务 (QA)
- 输入:[CLS] + 问题 + [SEP] + 段落 + [SEP]
- 输出:模型预测答案在段落中的起始和结束位置。
d:命名体识别(NER)
- 输入:[CLS] + 句子 + [SEP]
- 输出:每个单词的隐藏状态经过一个分类层,输出实体标签(如人名、地名)。
(二)GPT
Ⅰ 概述
GPT是大模型的典型代表,采用 无监督预训练 + 有监督微调 的方式,适用于 自然语言生成(NLG) 任务。
GPT模型是在Google BERT模型之前提出的, 与BERT最大的区别在于GPT采用了传统的语言模型方法进行预训练, 即使用单词的上文来预测单词, 而BERT是采用了双向上下文的信息共同来预测单词。正是因为训练方法上的区别, 使得GPT更擅长处理自然语言生成任务(NLG), 而BERT更擅长处理自然语言理解任务(NLU)。
Ⅱ 预训练
GPT的预训练方法基于自回归(autoregressive)原理,即根据已知的上下文预测下一个词的概率。通过在大规模文本数据上训练模型,使其能够捕捉到语言的统计规律和语义信息,从而生成连贯、有意义的文本。
Ⅲ 微调

a: 分类任务
- 给定一段文本,输出分类结果,如情感分类。
- 输入:在给定文本首尾分别添加token“Start/Extract”,送入GPT模型。
- 输出:经过一个全连接层,输出类别概率
b: 蕴含任务
- 给定两段文本,判断前者对后者的关系,如判断第一句对第二句是蕴含、不蕴含还是无关。
- 输入:在两个句子中间添加分割符“Delim”,再在整个文本首尾加上“Start/Extract”,送入GPT模型。
- 输出:经过一个全连接层,输出类别概率
c: 相似度任务(对称性句子关系任务)
- 给定两段文本,判断二者关系,如判断两个句子是否相似。
- 输入:将两个句子分别作为前句或后句,构造两个完整文本,各自送入GPT模型。
- 输出:经过一个全连接层,输出类别概率
d: 多选任务
- 给定一段文本和多个答案,判断哪个正确。
- 输入:将给定文本和N个答案结合,构造N个完整文本,各自送入GPT模型。
- 输出:经过一个全连接层,输出类别概率
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)