人工智能的历史与演进

从符号推理、统计学习到基础模型、生成式人工智能与智能体

人工智能并不是沿着单一、线性的路线发展起来的。符号推理、统计学习、神经计算、大规模表示学习、生成式模型和具身系统分别解决了智能问题的不同部分。本文从算法、数据、计算基础设施、工程实践和社会期待之间的相互作用出发,系统梳理人工智能的发展历史与技术演进。

文中的年代和能力描述用于教学性概览,并不等同于完整的研究史。图中的定量数值如未特别说明均为示意值,不能理解为覆盖所有系统的统一实测指标。

图1:人工智能历史与演进中的部分重要节点。

时期

主导思想

典型系统

局限与转折

20世纪40—50年代

形式神经元、控制论与计算

早期神经模型、定理证明程序

硬件、数据和学习方法有限

1956—70年代

符号智能

搜索、逻辑、规划和早期语言系统

脆弱性与组合爆炸

80年代

知识工程

专家系统与规则库

知识获取困难、维护成本高

90—2000年代

统计机器学习

语音、视觉、排序和概率模型

依赖特征工程且规模有限

2010年代

深度表示学习

CNN、序列模型和强化学习

计算、数据质量与鲁棒性问题

2020年代

基础模型与生成式AI

Transformer、多模态模型和智能体

可靠性、效率、治理与对齐

表1:人工智能发展的主要阶段;各阶段之间存在重叠。

1. 基础:计算、逻辑与智能问题

人工智能的思想基础早于“人工智能”这一名称。数理逻辑提供了表达命题和规则的形式语言;可计算性理论帮助人们理解哪些问题可以通过通用程序表达和求解;控制论则从系统角度强调感知、反馈、控制和适应。早期神经元模型把生物神经元简化为阈值单元,使研究者能够用数学和工程方法分析网络。

人工智能从一开始就存在一条重要张力。一种传统强调显式符号、规则和搜索,把智能看作对结构化表示的操作;另一种传统强调分布式数值计算和从样本中学习,把智能看作参数随经验而调整。现代系统往往融合两种观点,但这种张力依然有助于分析知识、泛化、解释和不确定性方面的不同假设。

2. 达特茅斯时期与符号人工智能

1956年的达特茅斯研讨会帮助人工智能成为一个明确的研究领域。研究者提出,学习和智能的某些方面可以被足够精确地描述,并由机器进行模拟。早期程序展示了定理证明、棋类博弈、问题求解和简单语言处理等能力。搜索算法探索可能的行动序列,启发式方法则试图把计算集中在更有希望的分支上。

当世界能够用清晰规则表示、搜索空间又可控时,符号方法十分有效,也比较容易追踪推理步骤。然而,真实环境往往包含模糊性、不完整信息、噪声和例外情况。随着知识库变大,手工编码所有事实和规则的成本越来越高。这些局限推动了概率方法、机器学习以及后来的混合式方法。

图2:人工智能主要范式及其向混合系统的融合。

方法

知识表示

优势

典型弱点

逻辑与规则

符号、谓词和产生式规则

推理过程可追踪

面对不确定性时脆弱

搜索与规划

状态、行动和目标

适合结构化问题空间

组合规模快速增长

概率模型

概率分布与依赖关系

能够处理不确定性

依赖模型假设且推理可能昂贵

神经学习

分布式参数

擅长模式识别并易于扩展

可解释性弱且依赖数据

混合系统

规则与学习表示结合

互补利用不同方法优势

集成与验证复杂

表2:有影响力的人工智能传统比较。

3. 专家系统、知识工程与人工智能寒冬

20世纪70—80年代,专家系统成为实用人工智能的重要路线。系统把领域专家的知识编码成规则,再由推理机根据事实应用规则。医学、配置、诊断和工业运维等领域的系统证明,有限范围内的专业知识可以产生经济价值。由于推理链通常能够被记录,系统还可以给出相对清晰的解释。

专家系统也暴露出知识获取这一工程难题。专家未必能够把隐性经验完整地表达为规则,规则库在不断加入例外后还可能出现冲突。系统离开设计范围后往往表现很差。当承诺的进展超过了实际成果,研究资金和公众热情会在一些时期下降,这些时期常被称为人工智能寒冬。由此得到的长期经验是:技术演示必须与真实部署环境、维护成本和边界条件相匹配。

4. 统计学习与数据中心转向

从20世纪90年代开始,统计机器学习的影响不断扩大。工程师不再为每一种情况手写规则,而是通过样本估计模型参数。决策树、支持向量机、图模型、隐马尔可夫模型和集成方法被应用于语音识别、信息检索、欺诈检测、计算机视觉和推荐系统。虽然特征工程仍然重要,但模型评估更加定量化,基准数据集也逐渐成为研究和工程交流的共同语言。

统计学习把智能重新表述为泛化问题:模型应当在来自相关分布的新样本上保持良好表现。这使数据采集、标注、实验设计和错误分析成为核心工作。同时,基准性能与真实可靠性之间的差异更加明显。分布偏移、类别不平衡、伪相关和反馈回路成为长期存在的问题。

图3:主要时代训练计算量增长的示意图;曲线为定性示意,不代表统一测量标准。

5. 深度学习与表示学习

深度学习改变了特征工程与表示学习之间的平衡。卷积神经网络利用图像中的局部性和位移结构,学习分层视觉特征;循环神经网络及其门控变体LSTM、GRU用于建模序列;深度强化学习则把神经感知与行动选择连接起来,并在游戏和仿真环境中展示了从交互中学习的潜力。

更大的数据集、更好的优化方法、专用加速器、分布式训练和开源框架共同推动了深度学习的发展。基准任务上的突破增强了人们对端到端学习的信心,但规模增长也带来训练不稳定、实验成本高、数据泄漏、能耗和故障解释困难等问题。

技术

主要贡献

典型任务

工程关注点

CNN

局部和层次化视觉特征

图像分类、检测、医学影像

分布变化、分辨率和数据偏差

RNN/LSTM/GRU

学习时间序列表示

语音、预测、序列标注

长序列与并行化

注意力机制

按内容建立动态交互

翻译、检索、多模态融合

长上下文计算成本

强化学习

从交互和奖励中学习

游戏、机器人、运营优化

探索与安全

自监督学习

从无标注结构中学习

语言、视觉和音频

目标设计与评估

表3:深度学习基本模块及其工程作用。

6. Transformer与基础模型

Transformer架构使注意力机制成为语言和多模态任务中的主流。它支持高度并行的训练,并能以灵活方式连接词元、图像块、音频单元和其他表示。大规模预训练语料使模型在适应具体任务前就能够获得广泛的统计结构。

基础模型改变了人工智能的使用接口。用户不一定要为每一个任务训练一个独立模型,而可以通过提示、微调、指令优化、偏好优化、检索增强、工具调用和结构化输出,使通用模型适配不同应用。然而,能力广泛并不等于事实正确、因果理解、稳定规划或安全行动。因此,评估需要同时考虑任务成功率、校准性、鲁棒性、来源可追溯性和运行控制。

图4:从基础设施到应用的现代人工智能技术栈示意。

7. 生成式人工智能、智能体与多模态系统

生成式模型能够生成文本、图像、音频、视频、代码和结构化结果,可用于总结、翻译、方案起草、候选方案生成和交互式探索。多模态系统把多种输入和输出模态连接起来,使应用能够在同一个工作流中处理文档、图表、语音、图像和行动。

智能体系统在模型外增加了控制循环。智能体可以理解目标、分解步骤、调用工具、检查结果、修订计划,并在关键节点请求人工审批。这种架构可以提升开放式工作的实用性,但也增加了失败面。工具权限、状态管理、提示注入、数据泄露、成本失控和责任归属都需要在设计阶段明确处理。

应区分模型智能与系统智能。模型提供学习到的表示和生成能力,外围系统则提供检索、记忆、工具、策略、监控和用户界面约束。许多生产效果最终更多取决于系统层,而不是基础模型的单项基准分数。

系统层

核心问题

典型控制

需要监测的风险

数据

有哪些信息可用且被允许使用?

权限、血缘、脱敏

泄露、偏差、知识过期

模型

模型能够推断或生成什么?

评估、微调、安全护栏

幻觉、脆弱性

工具

系统能够执行哪些行动?

最小权限、沙箱、审批

未授权或不可逆操作

工作流

步骤如何排列与终止?

状态机、预算、重试

循环、漂移和隐性依赖

治理

谁承担责任?

审计、评审、事件响应

责任不清

表4:生成式与智能体系统的控制框架。

图5:多维能力画像示意;能力取决于任务和运行环境。

8. 硬件、系统与规模化经济

人工智能的历史也是计算系统的历史。早期研究依赖大型机和实验室专用硬件;后来,通用处理器、向量指令、图形处理器、张量加速器、高带宽存储器、高速互连、分布式存储和数据中心基础设施共同推动了进步。真正决定方法能否落地的,通常不是单颗芯片,而是包括加速器、存储、网络、编译器、运行时、数据管道、供电和散热在内的完整系统。

规模化并不是没有边界的。内存容量和带宽会限制模型大小与批处理方式;分布式训练中通信可能成为主要瓶颈;当模型服务大量请求时,推理成本会直接影响产品可行性。高效注意力、量化、稀疏化、蒸馏、缓存、混合专家路由和专用芯片,都是针对这些约束的工程回应。

9. 评估、可靠性与人机协作

人工智能评估已经从孤立演示逐步转向分层测量。基准测试能够在明确条件下测量某一能力,但不能单独证明安全性、实用性或通用智能。高质量评估应说明任务、数据来源、基线、不确定性、成本、时延、失败严重程度和运行环境。人类表现是有价值的参照,但不是一个固定常数:专业水平、时间限制、工具、激励和工作负载都会影响结果。

当责任划分明确时,人机协作通常更有效。人工智能可以扩展搜索范围、起草候选方案或发现异常,人类则负责目标设定、情境判断和责任承担。在高影响领域,人工复核必须是真实有效的,而不是形式化盖章:复核者需要足够的时间、信息和权限来质疑系统。

评估维度

示例指标

重要性

建议实践

能力

准确率、任务成功率、通过率

判断系统能否完成任务

使用留出数据和真实任务

鲁棒性

压力测试、分布偏移表现

发现脆弱假设

覆盖边界与对抗场景

校准性

置信度与正确率的关系

支持合理依赖

报告不确定性和拒答

效率

时延、成本、能耗

决定运行可行性

测量端到端系统而非仅模型FLOPs

人因

工作质量、时间和负荷

衡量协作价值

比较辅助与非辅助工作流

表5:多维人工智能评估框架。

10. 治理、安全与开放研究问题

随着人工智能能力增强并接入真实工作流,治理逐渐成为技术设计的一部分。数据权利、隐私、模型文档、可审计性、访问控制、红队测试、事件响应和生命周期监测,都不应被视为上线后的附加工作。它们会从一开始就影响架构、采购和运营流程。

开放研究问题包括可靠推理、因果与物理理解、高效持续学习、长时规划、不确定性估计、可解释性以及与不同人类目标的对齐。另一个挑战是如何衡量进展而不鼓励针对基准的狭窄优化。未来评估需要奖励在现实约束下有用、稳定和可治理的行为,而不是只奖励孤立的高分输出。

11. 人工智能演进带来的经验

  • 表示学习与搜索并非互相排斥。学习到的表示可以降低搜索复杂度,结构化搜索也可以改善规划和验证。
  • 数据质量和问题定义常常比模型规模更重要。更大的模型无法修复错误目标、数据泄漏或失效的反馈回路。
  • 基础设施是算法故事的一部分。存储、互连、编译器和能源决定了哪些方法真正可行。
  • 基准是测量工具,而不是智能的定义。解读结果时必须结合不确定性、基线和运行环境。
  • 部署会改变问题。监控、权限、人因和激励机制都会成为系统行为的一部分。
  • 人工智能发展具有周期性。兴奋期与低谷期都能产生有价值的技术和组织经验。

结语

人工智能的历史可以理解为抽象层次不断扩展的过程:从规则到统计表示,从单个模型到基础模型,再从孤立预测发展到能够感知、推理、生成和行动的系统。未来进步很可能依赖学习与结构的结合、规模与效率的平衡,以及能力与可靠治理的共同发展。与其问某一种范式是否战胜了另一种范式,不如针对具体的人类目标和技术约束,选择合适的组合。

附注:本文用于详细教学和技术参考。标记为“示意”的图表为概念性表达,不应理解为精确的经验测量。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐