AI 是怎么玩游戏的?——从 AlphaGo 到大模型智能体,一篇讲透“AI 通关游戏”的来龙去脉

你可能经常在新闻里看到这样的标题:《AI 击败星际争霸职业选手》《AI 战胜 Dota 2 世界冠军》《AI 在《我的世界》里自己挖矿造装备》。很多人第一反应是:这 AI 难道像人一样盯着屏幕、握着鼠标打游戏吗?它是怎么学会操作的?为什么 AI 公司乐此不疲地让 AI 去“通关游戏”,而不是直接做点有用的东西?

这篇博文试着把这些问题一次讲清楚。全文约一万字,我们会沿着时间线梳理 AI 打游戏的技术演进,拆解三条主要技术路线背后的原理,聊聊 AI 公司为什么在这个方向上砸钱,最后谈谈这件事对普通玩家和游戏行业到底意味着什么。如果你是一名玩家,读完你会明白:新闻里那些“AI 通关”和你想象的“AI 玩游戏”,其实是两回事;而它们的未来,可能会以你意想不到的方式回到你的游戏里。


一、AI 打游戏,到底“打”的是什么?

先把一个常见的误解排除掉。

当我们说“AI 通关了某个游戏”时,绝大多数情况下,AI 并不是通过一个摄像头盯着你的显示器、再机械臂去敲键盘鼠标的。主流的做法是:AI 与游戏之间有一条专用的数据通道——要么通过游戏厂商提供的官方接口(API),要么通过模拟器直接读写游戏内存。AI 看到的不是渲染出来的画面,而是结构化的游戏状态:地图上每个单位在哪里、血量是多少、资源有多少、技能冷却还剩几秒。AI 发出的也不是“按下 W 键”这样的物理操作,而是直接往游戏引擎里写入一条指令:“把 3 号士兵移动到坐标 (120, 45)”。

这就像一个极其夸张的“开挂者”:它的“眼睛”能看到战争迷雾之外的信息(在很多研究设定中会被刻意限制),它的“手”能以每秒上千次的速度精确下达操作。所以新闻里常见的“AI 碾压人类职业选手”,和人类玩家坐在电脑前公平对战,严格来说并不是同一种比赛。

理解了这一点,后面的内容就好消化了:所谓“AI 通关游戏”,本质上是让算法在一个规则明确、反馈即时的封闭环境里,通过大量试错学会一套最大化“奖励”的决策策略。游戏只是试炼场,真正被锻炼的是决策能力本身。

那为什么是游戏?这就要从 AI 研究的历史说起了。


二、为什么 AI 研究者们痴迷于游戏?

用游戏来检验 AI 水平,不是近几年才有的时尚,而是这个领域半个多世纪的传统。

上世纪五十年代,计算机科学的奠基人之一艾伦·图灵就提出,可以用下棋来检验机器是否具备智能。1952 年,亚瑟·塞缪尔在 IBM 的计算机上写出了第一个会自我学习的跳棋程序——它通过和自己对弈不断改进,最终达到了相当高的水平。这是“机器学习”这个词的诞生现场之一。

1997 年,IBM 的“深蓝”在国际象棋上击败世界冠军卡斯帕罗夫,成为人工智能历史上最著名的里程碑。深蓝靠的是暴力搜索:评估每一步棋之后所有可能的走向,再配合人类棋手调教出来的棋局评估函数。它证明了在规则完全透明、信息完全可见的游戏里,机器的算力和搜索深度可以碾压人类的直觉。

但真正让全世界震动的,是 2016 年的 AlphaGo。围棋的棋盘是 19×19,搜索空间约为 10 的 170 次方——这个数字比宇宙中的原子总数还大得多,暴力搜索根本行不通。人类顶尖棋手在这一直依靠“棋感”:一种难以言说的局面判断能力。DeepMind 用深度神经网络来逼近这种棋感,再用强化学习通过自我对弈不断打磨,最终以 4:1 击败了李世石,一年后的 AlphaGo Zero 更是在完全不使用任何人类棋谱的情况下,从零自学三天就击败了它的前辈。

为什么 AI 公司纷纷把游戏当成主战场?原因有三个:

第一,游戏是决策问题的“完美实验室”。 现实世界里的决策——自动驾驶、机器人操作、金融交易——要么试错成本太高(撞一次车代价巨大),要么反馈周期太长(一笔投资几年后才能看到结果),要么连“规则”本身都说不清。而游戏里,输赢清清楚楚,一秒钟能模拟几百局,失败的代价只是重开一把。对需要海量试错才能学习的算法来说,这是最理想的训练场。

第二,游戏的难度可以无限加码。 从井字棋到围棋,从吃豆人到星际争霸,游戏给 AI 出了一个难度阶梯分明的“题库”。星际争霸 II 每回合约有 10 的 26 次方种可能操作,还要处理战争迷雾带来的不完整信息、长达几十分钟的长期规划、以及多兵种协同——这些特性让攻克它几乎等价于攻克一类真实的复杂决策问题。谁能先搞定,谁的技术就领先。

第三,故事讲得好听。 “AI 在股票市场上盈利 3%”远没有“AI 击败世界冠军”有传播力。游戏是大众文化的一部分,人机大战天然具有戏剧性,是展示技术实力最好的舞台。这一点很现实,但确实是各大公司的重要考量。

接下来,我们进入正题:他们具体是怎么做到的?


三、路线一:深度强化学习——把游戏当成“试错机器”

3.1 一套通用的学习循环

2013 年,DeepMind 在神经信息处理系统大会(NeurIPS)上发表了一篇改变行业的论文:他们用一个叫 DQN 的神经网络,直接在原始像素画面上学会了玩数十款雅达利游戏,其中不少达到了超越人类的水平。这是深度强化学习(Deep Reinforcement Learning,DRL)的成名之战。

它的思路用一句话概括就是:试错,记住,改进。

想象一个完全不懂吃豆人的 AI。它一开始随机乱按手柄,大多数时候很快撞鬼死掉,得到很低的分数(研究者称之为“奖励”)。但偶尔它误打误撞吃掉了豆子,分数涨了——这个信号被算法捕捉到:刚才那串操作里,似乎有什么值得重复的东西。通过一种叫“时序差分学习”的机制,算法会把最终奖励像记账一样,回溯分摊到之前的每一步操作上。这样一轮轮玩下去,神经网络逐渐学会了价值判断:处在某个画面状态时,按哪个键“未来预期得分最高”。

这个“观察—行动—奖励—改进”的循环,就是强化学习的核心。它最迷人的地方在于不需要人教:没人告诉 AI“鬼是会吃掉你的”“豆子是要吃的”,这些它全部自己摸索出来。2015 年 DeepMind 把这套方法扩展到 49 款雅达利游戏并登上《自然》杂志,震动学界——因为同一套算法、同一个网络结构,不看说明书就能打通几十款玩法各异的游戏,这种通用性是前所未有的。

不过雅达利毕竟是单人、画面简单、反馈密集的小游戏。真正的大 Boss,是星际争霸和 Dota 这样的多人在线竞技游戏。

3.2 AlphaStar:一个“星际战队”的自我进化

2019 年,DeepMind 在《自然》杂志上公布了 AlphaStar:一个在星际争霸 II 中达到宗师级水平的 AI,在官方天梯上排名超过了 99.8% 的活跃玩家。

星际争霸对 AI 的残酷之处在于:每回合可选操作约 10 的 26 次方种(远超围棋的全部棋局数量);战争迷雾意味着你看不到对手在干什么;一场对局包含数千次决策,胜负却要到最后才揭晓;而且这还是实时游戏,思考时间以毫秒计。

AlphaStar 的训练分两个阶段。

第一阶段:模仿人类。 研究团队从暴雪拿到了数十万份匿名人类对战录像,先用监督学习让神经网络模仿人类玩家的操作。这一步相当于先教会 AI 基本常识:什么兵营出什么兵、什么时候该开分矿、什么阵型合理。靠模仿,AlphaStar 一上来就达到了人类玩家中上游的水平,击败了 84% 的活跃玩家。这非常关键——纯靠随机自我对弈从零摸索,可能要花指数级多的时间才能重新“发明”人类几十年积累的战术。

第二阶段:AlphaStar 联赛。 这是整个系统最精妙的部分。如果只是让一个 AI 和自己对弈,它很容易陷入死胡同:学出一套克制自己的打法,然后原地打转,甚至“失忆”——学会新打法的同时忘掉怎么打旧对手。DeepMind 的解法是建一个“联赛”(League):训练出一群风格各异的 AI 选手,有人负责当主力(Main Agent),有人专门扮演“刺客”(Exploiter),任务是找到主力阵容的漏洞并狠狠利用。主力们则必须在一个五花八门的对手池里保持胜率。为了公平,DeepMind 还限制了 AI 的每分钟操作次数(APM),不许它用人类做不到的手速取胜。最终这个联赛跑了约 44 天,用了上千块 TPU 芯片并行训练,诞生出能 10:1 击败职业选手的策略。

3.3 OpenAI Five:十万块 CPU 的算力狂飙

几乎在同一时间,OpenAI 在 Dota 2 上做出了 OpenAI Five。2019 年 4 月,它在直播中以 2:0 击败了当年的世界冠军战队 OG——这是历史上第一次有 AI 在电子竞技比赛中击败冠军队伍。

OpenAI Five 的方法更“暴力美学”:核心是自我对弈(Self-play)。它每天和自己打相当于人类一百八十年的对局量,持续训练了十个月。硬件规模骇人听闻:早期版本用了 256 块 GPU 和 128,000 个 CPU 核来并行模拟对局。这个系统完全从随机操作起步,人类只给了很有限的先验知识(比如大概该走哪条路),战术理解全部是自我对弈中涌现出来的。

自我对弈的魅力在于它会自发产生“军备竞赛”:当一方学会抱团推进,另一方就会学会拉扯分带;当一方学会集火,另一方就学会分散站位。只要算力管够,这种对抗会自己滚雪球式地推高双方的策略水平。2019 年 4 月 OpenAI 把 OpenAI Five 放到公网上任人挑战,结果它以 99.4% 的胜率碾压了来自全球的对手,其中还包括很多职业玩家。

值得一提的是,OpenAI Five 并不限制英雄池,五个人工智能各有独立的网络参数,靠一种叫“团队精神”的超参数(Team Spirit)来调节个人收益和团队胜利的权重——这个超参数从 0 调到 1,AI 的风格就从“各自抢人头”平滑过渡到“舍己为人打配合”。团队还发现一个有趣的结论:这个只被训练来打败 AI 对手的纯竞技系统,稍加调整后就能和人类队友协作——他们现场让 OpenAI Five 陪人类主播打比赛,配合得居然像模像样。

3.4 中国力量:腾讯“绝悟”

在这条路线上,中国公司也有一席之地。腾讯 AI Lab 的“绝悟”(JueWu)系统在 2020 年登上了《自然》杂志封面:它在热门手游《王者荣耀》上达到了顶级职业电竞水平,而且不像 OpenAI Five 那样只精通十几个英雄,它不受英雄池限制。

“绝悟”的技术栈同样是多智能体强化学习加大规模并行训练,但它的环境更苛刻:手游节奏更快、操作维度更高、英雄技能组合数以百计。研究过程中诞生了不少有趣的技术,比如用“课程学习”让 AI 先学补兵、再学对线、最后学团战,像教练带新人一样循序渐进。今天你在《王者荣耀》里遇到的“绝悟试炼”人机模式,背后就是这个系统的民用化版本——很多玩家在不知情的情况下已经领教过它的厉害了。

3.5 另一个方向:不用赢你,只要开得比你好

除了“赢”,还有一条精致的支线:索尼的 GT Sophy。2022 年,索尼 AI 与《GT 赛车》系列开发商 Polyphony Digital 合作的自动驾驶 AI 登上了《自然》杂志。它不追求打赢世界冠军,而是要开得像一个兼具超人技巧和赛车礼仪的车手:在极限速度下超车,同时遵守赛规、尊重对手的行驶路线、避免碰撞。为此,研究者在奖励函数里加入了大量“体育精神”相关的项。这项研究的意义在于:真实世界的机器人(比如自动驾驶汽车)需要的恰恰不是“不惜一切代价赢”,而是在复杂约束下做出既高效又安全、还能被人类接受的决策。GT Sophy 后来被放进《GT 赛车 7》作为游戏内的对手,让玩家在娱乐中体验与顶级 AI 切磋。

3.6 强化学习路线的天花板

这套“自我对弈 + 海量算力”的路线威力巨大,但天花板也很明显:

其一,泛化能力差。 AlphaStar 只会打星际,换个游戏就得从头再来。它掌握的是“星际争霸的智能”,不是“通用的智能”。2025 年 Springer 上一篇有趣的研究就分析了人类玩家如何专门针对 AlphaStar 的固定套路开发出克制策略——高度特化的 AI 一旦策略被摸透,反而成了可以被算计的对象。

其二,算力成本高得离谱。 OpenAI Five 的十万 CPU 核不是谁都能烧得起的,AlphaStar 的联赛训练同样是百万美元级别的投入。这也是为什么这条路线基本只有顶级实验室在玩。

其三,它需要游戏厂商的深度配合。 Dota 2 和星际争霸 II 都为研究者开放了特制的研究接口。对于绝大多数游戏——比如你硬盘里的《Gears 5》——既没有这样的接口,也不开放这种许可,这条路线就走不通。

于是,另一条路线登场了。这条路线不需要游戏厂商开门,甚至不需要游戏本身——它只需要看视频。


四、路线二:模仿学习——看视频就能学会玩

强化学习是从零自学的“天才儿童”,那模仿学习(Imitation Learning)就是跟着高手录像一步步模仿的“学徒”。它的基本思路极其朴素:人类玩家是怎么操作的,你就让 AI 学着怎么操作。

这条路线的最大优势是数据来源便宜。全球每天有数亿人玩游戏,产生的游戏视频汗牛充栋。这些视频不需要标注——画面就是输入,操作就是输出,天然构成训练数据。

2022 年 OpenAI 发布的 VPT(Video PreTraining)是这条路线上的代表作。研究人员与一家游戏公司合作,先让志愿者边玩《我的世界》边录制键盘鼠标操作,训练出一个“逆动力学模型”——给定前后两帧画面,反推出中间发生了什么操作。然后,把这个模型应用到网上七万小时的《我的世界》无标注游戏视频上,自动“脑补”出每一帧背后的操作,从而生成海量带操作标签的训练数据。用这些数据预训练出来的模型,已经能做出砍树、合成、建房子等复杂行为;再用少量带奖励信号的强化学习微调,它成功合成了钻石镐——在当时的研究界,这被认为是一个几乎不可能完成的任务,因为合成钻石镐需要几十步环环相扣的操作,任何一步出错就得重来。

如果说 VPT 证明了“看视频能学会操作”,那么更近的工作则把这种思路推向了工业规模。2026 年公布的 NitroGen 系统,用超过 1000 款游戏、累计约 4 万小时的游戏视频进行训练,目标是让模型获得跨游戏的通用操作能力;而 Game-TARS 则在超过 5000 亿 token 的多模态游戏数据上预训练,直接操控键盘鼠标和图形界面,在多款从未见过的 3D 游戏里完成任务。这两者的意义在于:它们开始摆脱“一个游戏一个模型”的老路,朝“一个模型通吃多种游戏”迈进——这正是通用人工智能想要的能力。

模仿学习路线绕开了强化学习最大的两个痛点:不需要为每个游戏单独搭建训练环境,也不需要奖励函数这种精巧的手工设计。但它有自己的难题:人类视频里充满了“无效操作”和“犹豫”,AI 照单全收会学来一身毛病;而且模仿只能学到人类展示过的东西,难以超越人类的策略上限。所以现实中最好的系统往往是混合型的:先用模仿学习打底,再用强化学习突破。


五、路线三:大语言模型智能体——把“打游戏”变成“思考 + 调用工具”

2023 年之后,随着 ChatGPT 掀起的浪潮,第三条路线成为当下最热、也是离你我最“像人”的一条:用大语言模型(LLM)和多模态视觉语言模型(VLM)直接驱动一个智能体(Agent)去玩游戏。

5.1 大模型玩游戏的三个基本件

一个现代游戏智能体的架构,通常由三个基本件构成:

感知。 截屏,或读取游戏画面/文本状态,由多模态模型理解“我现在在哪、面前有什么、血量多少”。这模拟的是人的眼睛。

规划与记忆。 大语言模型把“通关游戏”这种宏大目标分解成一步步可执行的小任务,并在长流程中记住之前做过什么、什么有效什么无效。这模拟的是人的大脑。

行动与反馈。 模型输出具体操作——调用游戏 API、执行一段控制代码,或者模拟键鼠点击——然后根据游戏反馈(成功、失败、报错信息)反思和调整。这模拟的是手和学习能力。

在这条路线上,2023 年的 Voyager 是一个无法绕开的里程碑。

5.2 Voyager:在《我的世界》里自学的终身学习者

Voyager 由英伟达、加州理工等机构的研究者提出,是第一个由大语言模型驱动的开放式具身智能体:你把它丢进《我的世界》,不给任何脚本和任务清单,它会自己决定下一步该探索什么、学习什么,终身不停地成长。

它有三个精妙的设计:

第一,自动课程。 GPT-4 充当“出题老师”,根据智能体当前的技能水平和世界状态,不断提出难度适中、富有探索价值的新目标:先学会砍树,再学会做工作台,然后挑战更复杂的东西。这解决了开放式游戏的核心难题——没人告诉它“接下来该干嘛”,它自己给自己找事做。

第二,技能库。 这是 Voyager 最独特的设计。它不把学到的技能存在神经网络权重里,而是存成可执行的代码函数:“砍树”是一段代码,“做石镐”是一段代码。这些代码写在技能库里,随时可以检索、复用、组合。想造新东西时,它先查库:“做铁镐”的技能也许可以拆解复用“挖矿”和“合成”的旧技能。这种代码化的技能表示可解释、可组合,还天然避免了“灾难性遗忘”——学新东西不会把旧本领忘掉。

第三,迭代纠错。 代码写错了?环境会反馈执行错误;目标没达成?自我验证机制会发现。Voyager 把错误信息喂回大模型,让它修改代码重试,直到成功为止。

效果是惊人的:与此前最好的方法相比,Voyager 获得的独特物品数量是对方的 3.3 倍,探索距离是 2.3 倍,解锁关键科技里程碑的速度最快快了 15.3 倍。更重要的是,把这套技能库带进一个全新世界,它还能从旧技能出发解决从没见过的新任务,展现出真正的迁移能力。

值得注意的是实现成本:Voyager 只是通过 API 黑盒调用 GPT-4,用提示词驱动,完全不微调模型参数。这意味着个人开发者也可以用同样的思路搭建自己的游戏智能体——这是它和 AlphaStar 那种百万美元项目的本质区别。

5.3 反思机制:让 AI 从失败中长记性

Voyager 引出的另一个重要概念是反思(Reflection)。2023 年的 Reflexion 框架提出了一个优雅的想法:不更新模型权重,而是让 AI 在每次失败后,用自然语言写一段“复盘笔记”存进记忆——“我刚才死是因为没看身后”“绕到敌人背后需要等它转身”——下次行动前把这些笔记读一遍。这被形象地称为“语言化的强化学习”:奖励信号不落在梯度上,而落在文字记忆里。

这条思路在后来的游戏智能体上被大量复用:智能体打完一局,回看自己的操作轨迹(进阶版本甚至回看游戏录像),总结哪里做错了、下次怎么改,然后再打一局。几轮下来,成绩曲线持续上升,而且全程没有碰过一次模型参数。近期的一些基准测试专门研究这种“越打越强”的动态提升过程,发现带有反思机制的智能体在多轮改进后,面对同一游戏的变体任务也能举一反三——这种“学会学习”的能力,恰恰是通往通用智能的关键。

5.4 从专用接口到“像人一样看屏幕点鼠标”

Voyager 这类早期智能体还依赖《我的世界》的专用代码接口(Mineflayer),说不上真正的“玩游戏”。但新一代智能体正在逼近真正的通用操作:直接看屏幕、直接发键鼠事件,就像坐在电脑前的人一样。2025–2026 年的多项工作——如 Lumine 能在 3D 环境里连续执行数小时的实时任务,以及前面提到的 Game-TARS、NitroGen——都在这条路上推进。近期研究者们甚至开始搭建标准化的跨游戏评测平台(比如基于虚幻引擎 5 的 OmniGameArena),要求智能体在不针对单款游戏定制的前提下,在多款游戏里边看画面边操作完成任务,并追踪它们的自我进步轨迹。

换句话说,这条路线的终极形态是:不需要游戏厂商配合、不需要特殊接口,给你任何一款新游戏,看看画面、翻翻说明书,就能上手——这已经是“通用智能”的定义了。


六、路线四:干脆自己造世界——世界模型的兴起

以上三条路线,AI 智能体都是在别人造好的游戏里训练。而 2024–2025 年,一个更激进的思路出现了:如果游戏不够多、不够多样,那就让 AI 自己生成无限多的游戏世界,在自己的世界里练。

这就是“世界模型”(World Model)。2025 年 8 月,Google DeepMind 发布了 Genie 3:你只需要输入一句文字描述——“一条维多利亚风格的街道,尽头有一扇通往沙漠的发光传送门”——它就实时生成一个 720p 分辨率、24 帧每秒、可自由探索的交互式 3D 世界。你可以在里面走动、转动视角、改变天气、添加物体,世界会记住你几分钟前做过的修改(它的“世界记忆”约能维持一分钟)。这些物理规律不是手工编码的引擎规则,而是模型通过自监督学习从数据中“悟”出来的。

造这样的世界是为了什么?DeepMind 的回答非常直白:训练智能体。他们把自己的 SIMA 智能体放进 Genie 3 生成的世界里,下达“走到那棵红色的树旁边”之类的目标,智能体通过向世界模型发送导航指令来完成任务。因为环境无限多样且生成速度极快,智能体可以在现实中几乎不可能遇到的场景里反复练习——比如模拟一只鹿突然冲上公路的极端情况,训练自动驾驶如何安全应对。

这条路线的战略意义在于:它同时解决了训练数据的稀缺性和危险性。真实世界里,你不可能为了训练机器人而让它在真实公路上撞一万次车;而在世界模型里,你可以让 AI 体验十亿种现实世界从未发生过的情境。DeepMind 把世界模型称为“通向 AGI 的关键垫脚石”,而英伟达的 Jim Fan 则称这类技术预示着“游戏引擎 2.0”——未来开发者不再需要显式的 3D 资产和渲染管线,一段提示词就能驱动模型权重生成整个世界。

当然,世界模型目前还有明显局限:交互时长只有几分钟,多智能体交互还难以建模,物理细节上时有幻觉。但方向已经足够清晰:游戏的终点不是被 AI 通关,而是成为 AI 训练的无限燃料。


七、为什么 AI 公司抢着做这件事?一盘大棋

现在我们可以回答开头的问题了:AI 公司为什么要花巨资让 AI 打游戏?综合来看,是五重动机的叠加。

其一,游戏是通往通用智能的阶梯。 打游戏锻炼的核心能力——感知、规划、决策、协作、从失败中学习——没有任何一项是游戏独有的,它们全部能迁移。游戏环境可控、可重复、反馈即时,是训练这些能力的最佳温床。从吃豆人到星际争霸,AI 每攻克一类游戏,就证明自己又掌握了一类决策问题的通用解法。DeepMind 从雅达利走向围棋、走向蛋白质结构预测(AlphaFold),再到如今的世界模型,这条“从游戏走向科学”的路径已经走通了两次。

其二,游戏里练出的本事直接服务于机器人。 具身智能(Embodied AI)需要 AI 在物理世界里感知和行动,而真实机器人又慢又贵还容易摔坏。游戏和仿真环境里的策略,稍加调整就能迁移到机械臂、无人机、自动驾驶上。GT Sophy 研究的“高效但守规矩的决策”,绝尘(JueWu)研究的大规模协作,本质都是在为真实世界的机器智能铺路。这也是为什么 Minecraft 这类游戏的智能体研究如此火热——方块世界的操作逻辑和真实世界有结构性的相似。

其三,数据飞轮。 自我对弈可以无限生成新数据,游戏视频网上俯拾皆是,世界模型可以自己造训练环境。在高质量人类数据逐渐枯竭的时代,游戏是少数几个能无限扩产数据的地方。

其四,人才与技术的练兵场。 训练 AlphaStar 积累的大规模分布式强化学习系统、训练 OpenAI Five 磨练的亿级并行模拟框架,后来都变成了这些实验室做更大事情的基础设施。某种意义上,游戏项目是顶尖工程团队的“演习”。

其五,传播与招聘。 不可否认,“AI 击败世界冠军”是效果最好的技术广告和人才招聘广告。一场人机大战带来的全球关注度,胜过一百篇论文。


八、冷水:那些新闻没告诉你的局限

讲了这么多光鲜的成就,也必须泼几盆冷水。理解这些局限,你才能对“AI 通关游戏”建立一个不浮夸的认知。

第一,绝大多数胜利都不是在“公平条件”下取得的。 AI 拥有完美的反应速度(即便限制了 APM,单次操作的精度也远超人类)、全图视野(很多研究用到了隐藏信息训练价值网络)、以及永不疲惫的执行。人类选手输给的常常不是“策略”,而是这些系统性优势。即便 DeepMind 刻意压低操作上限,也无法完全抹平差距。

第二,它们往往极其“偏科”。 OpenAI Five 只会打 Dota 2 还限定在特定规则版本,AlphaStar 换个地图版本就要重新训练。2025 年那篇研究人类如何开发新策略反制 AI 的论文说明:特化的 AI 一旦被研究透,在开放式博弈中反而脆弱。真正的通用性——拿到任何新游戏快速上手——直到最近的大模型智能体路线才开始有了眉目。

第三,成本令人咋舌。 AlphaStar 背后是 44 天、上千块 TPU 的联赛训练;OpenAI Five 背后是 12.8 万核 CPU 并行十个月。这种投入只有极少数机构承担得起。相比之下,Voyager 这种“调 GPT-4 API + 写提示词”的路线成本低了几个数量级,这本身也说明技术范式正在转移。

第四,“通关”的定义其实很窄。 新闻里的“通关”大多指竞技对抗中的胜利,或者某个预设任务的完成。而真正开放的游戏体验——被一段剧情打动、和队友开玩笑、在风景里闲逛——目前没有任何 AI 真正“会玩”。AI 攻克的是游戏的目标函数,而不是游戏作为文化体验的全部。

第五,对游戏生态的反作用力已经开始显现。 当 AI 玩家大量涌入多人游戏,公平性、反作弊、匹配体验都会受到冲击;当 AI 能自动生成关卡和内容,游戏从业者的角色也在被重新定义。这些问题没有标准答案,但值得整个行业严肃对待。


九、对普通玩家来说,这一切意味着什么?

聊了这么多,你可能想问:这些大新闻跟我这个普通玩家有什么关系?关系其实比想象中近。

你会在单机里遇到它们。 《王者荣耀》的绝悟试炼、《GT 赛车 7》里的 GT Sophy,都是顶级研究 AI 的民用化落地。未来你游戏里的 NPC 不再只会沿固定脚本行动,而是会学习你的打法、针对你的习惯调整策略——单机游戏将拥有无穷尽的“会思考的对手”。

你的队友和对手可能是 AI,而且越来越好。 OpenAI Five 证明了纯竞技训练的 AI 稍加调整就能与人类协作。随着大模型智能体成熟,“AI 队友听懂你的自然语言指挥”“AI 陪练针对你的弱点特训”都会变成标配功能。

做游戏的门槛会大幅降低。 Voyager 用代码当技能、世界模型用提示词造世界,这些技术下沉到工具层之后,普通玩家用语言描述就能生成自己的关卡、自己的 NPC、自己的任务线——游戏创作会从专业工作变成大众表达。

看懂新闻的姿势也变了。 下次再看到“AI 通关某游戏”的标题,你可以多问三句:它用的是特权接口还是真看屏幕?它是从零自学还是看了人类录像?它打的是通用能力还是只此一家的特化策略?这三个问题一问,大部分耸动标题的水分就能挤出来。


十、结语:游戏的尽头是智能

从 1952 年塞缪尔的跳棋程序,到 2019 年击败世界冠军的 OpenAI Five,再到今天在《我的世界》里终身学习、在自造世界里自我训练的 Voyager 和 SIMA——AI 打游戏的历史,几乎就是人工智能本身的演进史。

这件事表面上是“机器抢人类的娱乐”,本质上却是人类借游戏理解智能如何产生。每攻克一款游戏,我们对“如何从经验中学习”的理解就深一层;而这些理解正在溢出游戏世界,流向蛋白质折叠、材料科学、机器人与自动驾驶。DeepMind 从雅达利走向 AlphaFold 拿了诺贝尔奖,是这条路径最有力的注脚。

至于你我这样的玩家,不必焦虑,大可期待:当 AI 把“打不打得过”的问题彻底解决之后,它下一个要学会的课题,恰恰是游戏里最人性的部分——为什么我们会为虚拟世界里的一个选择而感动。那一天还很远,但每一次“AI 通关”的新闻,都是朝着那一天迈出的一小步。


十一、四条路线横向对比:一张表看懂技术版图

读到这里,我们把前面四条路线横向拉通对比一下,方便你建立一个整体框架:

维度深度强化学习模仿学习大模型智能体世界模型
代表系统AlphaStar、OpenAI Five、绝悟VPT、NitroGenVoyager、Reflexion、Game-TARSGenie 3 + SIMA
数据来源自我对弈产生人类游戏视频大模型预训练 + 环境反馈模型自造环境
需要游戏接口吗需要深度定制看视频就行,不需要早期需要,新一代只看屏幕完全不需要游戏本身
算力成本极高(百万美元级)高低(调 API 即可)极高(目前只有顶级实验室)
通用性差,一个游戏一个模型中,可跨游戏迁移操作好,目标就是通用理论上限最高,尚处早期
能否超越人类能(APM 和精度优势)受限于人类上限部分场景已超越待验证
谁能玩得起顶级实验室和大厂中型研究团队个人开发者目前只有 Google 这个级别

这张表里最有意思的趋势是从左下角到右上角的大迁移:成本越来越低,通用性越来越强。AlphaStar 时代只有烧得起十万核 CPU 的机构才能入场;到了 Voyager 时代,一个会写代码的研究生加几个 GPT-4 的 API 额度就能做出登上周报封面的成果。技术的民主化速度,比大多数人想象的快。

还需要补充一句:这四条路线并非互相替代,而是正在融合。最新的系统往往先用海量视频做模仿预训练(路线二),再用强化学习提升(路线一),套上智能体的规划与反思框架(路线三),最后在世界模型里大规模练兵(路线四)。未来“AI 通关某游戏”的系统,大概率是四种思路的混血儿。


十二、自己动手:一个普通开发者如何复现“AI 玩游戏”

看到这里,跃跃欲试的读者可能会问:我自己能不能搭一个游戏智能体?答案是完全可行,而且比你想的便宜得多。以最容易上手的 Voyager 路线为例,整体流程大致是这样的:

第一步,选环境。 推荐《我的世界》的 Java 版 + Mineflayer 开源框架,它提供了用 JavaScript 读写游戏状态的代码接口,是社区里最成熟的选择。想要更简单,也可以从 Gymnasium(OpenAI Gym 的继任者)里的经典控制游戏入手,几行代码就能跑起来强化学习。

第二步,接大模型。 准备一个 GPT-4 级别的多模态模型 API(国内的同类大模型 API 也可以),Voyager 官方代码库是 MIT 协议开源的,克隆下来填上 API 密钥就能跑。它的三大模块——自动课程、技能库、迭代纠错——都是现成的,跑通后你能亲眼看着它从砍第一棵树开始,一步步学会合成越来越复杂的东西。

第三步,加反思。 在基础框架上引入 Reflexion 式的复盘机制:每局结束后把失败轨迹交给大模型,让它写出自然语言复盘存进记忆。这是性价比最高的改进——不花一分钱训练成本,效果往往立竿见影。

第四步,走向真实屏幕(进阶)。 如果你想让智能体像人一样看屏幕、点鼠标,可以接入截图工具加键鼠模拟库,把“观察-思考-操作”的循环搭起来。这条路目前是研究前沿,坑也最多,但正因如此,踩出来的每一篇笔记都有价值。

整个过程中最贵的开销是 API 调用费,跑一个 Voyager 级别的实验,几十到几百美元就能搞定——和 AlphaStar 时代的天文数字相比,这是五个数量级的差距。一个人、一台笔记本、一个周末,你就能亲手复现 2023 年登上各大媒体头条的成果。这大概也是这个时代做 AI 最迷人的地方:最前沿的东西,第一次离普通人这么近。

当然,要提醒一句:如果你打算让智能体去玩网游,请务必先阅读用户协议——绝大多数在线游戏的条款禁止任何形式的自动化操作,单机游戏和自建环境才是安全的试验田。


十三、附录:AI 打游戏大事记

  • 1952 年:塞缪尔写出会自我学习的跳棋程序,“机器学习”概念萌芽。
  • 1997 年:IBM 深蓝击败国际象棋世界冠军卡斯帕罗夫,暴力搜索的巅峰。
  • 2013 年:DeepMind 的 DQN 直接从像素学会数十款雅达利游戏,深度强化学习横空出世。
  • 2015 年:DQN 登上《自然》杂志封面;同年 AlphaGo 横空出世。
  • 2016 年:AlphaGo 4:1 击败李世石,人工智能成为全球话题。
  • 2017 年:AlphaGo Zero 抛弃人类棋谱,三天从零自学成神。
  • 2019 年:AlphaStar 登上星际争霸 II 宗师梯队,超越 99.8% 的人类玩家;OpenAI Five 在直播中 2:0 击败 Dota 2 世界冠军 OG,随后以 99.4% 的胜率横扫公网挑战者。
  • 2020 年:腾讯绝悟攻克《王者荣耀》,首个不限英雄池的电竞级 AI;OpenAI 用七个字概括趋势:规模就是一切。
  • 2022 年:OpenAI 发布 VPT,看七万小时无标注视频学会合成钻石镐;索尼 GT Sophy 登上《自然》,成为游戏内 AI 车手的标杆。
  • 2023 年:Voyager 与 Reflexion 相继发表,大语言模型智能体路线确立,“用提示词玩游戏”成为新范式。
  • 2024 年:DeepMind 发布 Genie 2,世界模型首次实现可交互生成。
  • 2025 年:Genie 3 实现 720p、24 帧的实时交互世界,SIMA 智能体在其中完成长程任务;Game-TARS、NitroGen 等跨游戏智能体把“通用游戏操作”推向新高度。
  • 2026 年:标准化的跨游戏智能体评测平台出现,行业开始认真衡量“AI 到底离通用玩家还有多远”。

七十年间,AI 从棋盘上的一颗棋子,走进了无数玩家朝夕相处的屏幕里。这份年表还会继续写下去——而且接下来的每一笔,恐怕都会比过去更快。


参考资料

  1. Mnih et al., Human-level control through deep reinforcement learning, Nature, 2015.
  2. Vinyals et al., Grandmaster level in StarCraft II using multi-agent reinforcement learning, Nature, 2019. DeepMind 博客
  3. Berner et al., Dota 2 with Large Scale Deep Reinforcement Learning, arXiv:1912.06680, 2019. OpenAI: OpenAI Five defeats Dota 2 world champions
  4. Wang et al., Voyager: An Open-Ended Embodied Agent with Large Language Models, 2023. GitHub 仓库
  5. Baker et al., Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos, OpenAI, 2022.
  6. Shinn et al., Reflexion: Language Agents with Verbal Reinforcement Learning, 2023.
  7. Ye et al., Towards Playing Full MOBA Games with Deep Reinforcement Learning(腾讯绝悟), Nature Machine Intelligence, 2020.
  8. Wurman et al., Outracing champion Gran Turismo drivers with deep reinforcement learning(GT Sophy), Nature, 2022.
  9. Google DeepMind, Genie 3 官方页面, 2025.
  10. OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents, arXiv:2606.09826, 2026.
  11. A Survey on Large Language Model-Based Game Agents, arXiv:2404.02039.
  12. Human strategic innovation against AI systems, Springer, 2025.
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐