AI 是怎么玩游戏的?——从 AlphaGo 到大模型智能体,一篇讲透“AI 通关游戏”的来龙去脉
AI 是怎么玩游戏的?——从 AlphaGo 到大模型智能体,一篇讲透“AI 通关游戏”的来龙去脉
你可能经常在新闻里看到这样的标题:《AI 击败星际争霸职业选手》《AI 战胜 Dota 2 世界冠军》《AI 在《我的世界》里自己挖矿造装备》。很多人第一反应是:这 AI 难道像人一样盯着屏幕、握着鼠标打游戏吗?它是怎么学会操作的?为什么 AI 公司乐此不疲地让 AI 去“通关游戏”,而不是直接做点有用的东西?
这篇博文试着把这些问题一次讲清楚。全文约一万字,我们会沿着时间线梳理 AI 打游戏的技术演进,拆解三条主要技术路线背后的原理,聊聊 AI 公司为什么在这个方向上砸钱,最后谈谈这件事对普通玩家和游戏行业到底意味着什么。如果你是一名玩家,读完你会明白:新闻里那些“AI 通关”和你想象的“AI 玩游戏”,其实是两回事;而它们的未来,可能会以你意想不到的方式回到你的游戏里。
一、AI 打游戏,到底“打”的是什么?
先把一个常见的误解排除掉。
当我们说“AI 通关了某个游戏”时,绝大多数情况下,AI 并不是通过一个摄像头盯着你的显示器、再机械臂去敲键盘鼠标的。主流的做法是:AI 与游戏之间有一条专用的数据通道——要么通过游戏厂商提供的官方接口(API),要么通过模拟器直接读写游戏内存。AI 看到的不是渲染出来的画面,而是结构化的游戏状态:地图上每个单位在哪里、血量是多少、资源有多少、技能冷却还剩几秒。AI 发出的也不是“按下 W 键”这样的物理操作,而是直接往游戏引擎里写入一条指令:“把 3 号士兵移动到坐标 (120, 45)”。
这就像一个极其夸张的“开挂者”:它的“眼睛”能看到战争迷雾之外的信息(在很多研究设定中会被刻意限制),它的“手”能以每秒上千次的速度精确下达操作。所以新闻里常见的“AI 碾压人类职业选手”,和人类玩家坐在电脑前公平对战,严格来说并不是同一种比赛。
理解了这一点,后面的内容就好消化了:所谓“AI 通关游戏”,本质上是让算法在一个规则明确、反馈即时的封闭环境里,通过大量试错学会一套最大化“奖励”的决策策略。游戏只是试炼场,真正被锻炼的是决策能力本身。
那为什么是游戏?这就要从 AI 研究的历史说起了。
二、为什么 AI 研究者们痴迷于游戏?
用游戏来检验 AI 水平,不是近几年才有的时尚,而是这个领域半个多世纪的传统。
上世纪五十年代,计算机科学的奠基人之一艾伦·图灵就提出,可以用下棋来检验机器是否具备智能。1952 年,亚瑟·塞缪尔在 IBM 的计算机上写出了第一个会自我学习的跳棋程序——它通过和自己对弈不断改进,最终达到了相当高的水平。这是“机器学习”这个词的诞生现场之一。
1997 年,IBM 的“深蓝”在国际象棋上击败世界冠军卡斯帕罗夫,成为人工智能历史上最著名的里程碑。深蓝靠的是暴力搜索:评估每一步棋之后所有可能的走向,再配合人类棋手调教出来的棋局评估函数。它证明了在规则完全透明、信息完全可见的游戏里,机器的算力和搜索深度可以碾压人类的直觉。
但真正让全世界震动的,是 2016 年的 AlphaGo。围棋的棋盘是 19×19,搜索空间约为 10 的 170 次方——这个数字比宇宙中的原子总数还大得多,暴力搜索根本行不通。人类顶尖棋手在这一直依靠“棋感”:一种难以言说的局面判断能力。DeepMind 用深度神经网络来逼近这种棋感,再用强化学习通过自我对弈不断打磨,最终以 4:1 击败了李世石,一年后的 AlphaGo Zero 更是在完全不使用任何人类棋谱的情况下,从零自学三天就击败了它的前辈。
为什么 AI 公司纷纷把游戏当成主战场?原因有三个:
第一,游戏是决策问题的“完美实验室”。 现实世界里的决策——自动驾驶、机器人操作、金融交易——要么试错成本太高(撞一次车代价巨大),要么反馈周期太长(一笔投资几年后才能看到结果),要么连“规则”本身都说不清。而游戏里,输赢清清楚楚,一秒钟能模拟几百局,失败的代价只是重开一把。对需要海量试错才能学习的算法来说,这是最理想的训练场。
第二,游戏的难度可以无限加码。 从井字棋到围棋,从吃豆人到星际争霸,游戏给 AI 出了一个难度阶梯分明的“题库”。星际争霸 II 每回合约有 10 的 26 次方种可能操作,还要处理战争迷雾带来的不完整信息、长达几十分钟的长期规划、以及多兵种协同——这些特性让攻克它几乎等价于攻克一类真实的复杂决策问题。谁能先搞定,谁的技术就领先。
第三,故事讲得好听。 “AI 在股票市场上盈利 3%”远没有“AI 击败世界冠军”有传播力。游戏是大众文化的一部分,人机大战天然具有戏剧性,是展示技术实力最好的舞台。这一点很现实,但确实是各大公司的重要考量。
接下来,我们进入正题:他们具体是怎么做到的?
三、路线一:深度强化学习——把游戏当成“试错机器”
3.1 一套通用的学习循环
2013 年,DeepMind 在神经信息处理系统大会(NeurIPS)上发表了一篇改变行业的论文:他们用一个叫 DQN 的神经网络,直接在原始像素画面上学会了玩数十款雅达利游戏,其中不少达到了超越人类的水平。这是深度强化学习(Deep Reinforcement Learning,DRL)的成名之战。
它的思路用一句话概括就是:试错,记住,改进。
想象一个完全不懂吃豆人的 AI。它一开始随机乱按手柄,大多数时候很快撞鬼死掉,得到很低的分数(研究者称之为“奖励”)。但偶尔它误打误撞吃掉了豆子,分数涨了——这个信号被算法捕捉到:刚才那串操作里,似乎有什么值得重复的东西。通过一种叫“时序差分学习”的机制,算法会把最终奖励像记账一样,回溯分摊到之前的每一步操作上。这样一轮轮玩下去,神经网络逐渐学会了价值判断:处在某个画面状态时,按哪个键“未来预期得分最高”。
这个“观察—行动—奖励—改进”的循环,就是强化学习的核心。它最迷人的地方在于不需要人教:没人告诉 AI“鬼是会吃掉你的”“豆子是要吃的”,这些它全部自己摸索出来。2015 年 DeepMind 把这套方法扩展到 49 款雅达利游戏并登上《自然》杂志,震动学界——因为同一套算法、同一个网络结构,不看说明书就能打通几十款玩法各异的游戏,这种通用性是前所未有的。
不过雅达利毕竟是单人、画面简单、反馈密集的小游戏。真正的大 Boss,是星际争霸和 Dota 这样的多人在线竞技游戏。
3.2 AlphaStar:一个“星际战队”的自我进化
2019 年,DeepMind 在《自然》杂志上公布了 AlphaStar:一个在星际争霸 II 中达到宗师级水平的 AI,在官方天梯上排名超过了 99.8% 的活跃玩家。
星际争霸对 AI 的残酷之处在于:每回合可选操作约 10 的 26 次方种(远超围棋的全部棋局数量);战争迷雾意味着你看不到对手在干什么;一场对局包含数千次决策,胜负却要到最后才揭晓;而且这还是实时游戏,思考时间以毫秒计。
AlphaStar 的训练分两个阶段。
第一阶段:模仿人类。 研究团队从暴雪拿到了数十万份匿名人类对战录像,先用监督学习让神经网络模仿人类玩家的操作。这一步相当于先教会 AI 基本常识:什么兵营出什么兵、什么时候该开分矿、什么阵型合理。靠模仿,AlphaStar 一上来就达到了人类玩家中上游的水平,击败了 84% 的活跃玩家。这非常关键——纯靠随机自我对弈从零摸索,可能要花指数级多的时间才能重新“发明”人类几十年积累的战术。
第二阶段:AlphaStar 联赛。 这是整个系统最精妙的部分。如果只是让一个 AI 和自己对弈,它很容易陷入死胡同:学出一套克制自己的打法,然后原地打转,甚至“失忆”——学会新打法的同时忘掉怎么打旧对手。DeepMind 的解法是建一个“联赛”(League):训练出一群风格各异的 AI 选手,有人负责当主力(Main Agent),有人专门扮演“刺客”(Exploiter),任务是找到主力阵容的漏洞并狠狠利用。主力们则必须在一个五花八门的对手池里保持胜率。为了公平,DeepMind 还限制了 AI 的每分钟操作次数(APM),不许它用人类做不到的手速取胜。最终这个联赛跑了约 44 天,用了上千块 TPU 芯片并行训练,诞生出能 10:1 击败职业选手的策略。
3.3 OpenAI Five:十万块 CPU 的算力狂飙
几乎在同一时间,OpenAI 在 Dota 2 上做出了 OpenAI Five。2019 年 4 月,它在直播中以 2:0 击败了当年的世界冠军战队 OG——这是历史上第一次有 AI 在电子竞技比赛中击败冠军队伍。
OpenAI Five 的方法更“暴力美学”:核心是自我对弈(Self-play)。它每天和自己打相当于人类一百八十年的对局量,持续训练了十个月。硬件规模骇人听闻:早期版本用了 256 块 GPU 和 128,000 个 CPU 核来并行模拟对局。这个系统完全从随机操作起步,人类只给了很有限的先验知识(比如大概该走哪条路),战术理解全部是自我对弈中涌现出来的。
自我对弈的魅力在于它会自发产生“军备竞赛”:当一方学会抱团推进,另一方就会学会拉扯分带;当一方学会集火,另一方就学会分散站位。只要算力管够,这种对抗会自己滚雪球式地推高双方的策略水平。2019 年 4 月 OpenAI 把 OpenAI Five 放到公网上任人挑战,结果它以 99.4% 的胜率碾压了来自全球的对手,其中还包括很多职业玩家。
值得一提的是,OpenAI Five 并不限制英雄池,五个人工智能各有独立的网络参数,靠一种叫“团队精神”的超参数(Team Spirit)来调节个人收益和团队胜利的权重——这个超参数从 0 调到 1,AI 的风格就从“各自抢人头”平滑过渡到“舍己为人打配合”。团队还发现一个有趣的结论:这个只被训练来打败 AI 对手的纯竞技系统,稍加调整后就能和人类队友协作——他们现场让 OpenAI Five 陪人类主播打比赛,配合得居然像模像样。
3.4 中国力量:腾讯“绝悟”
在这条路线上,中国公司也有一席之地。腾讯 AI Lab 的“绝悟”(JueWu)系统在 2020 年登上了《自然》杂志封面:它在热门手游《王者荣耀》上达到了顶级职业电竞水平,而且不像 OpenAI Five 那样只精通十几个英雄,它不受英雄池限制。
“绝悟”的技术栈同样是多智能体强化学习加大规模并行训练,但它的环境更苛刻:手游节奏更快、操作维度更高、英雄技能组合数以百计。研究过程中诞生了不少有趣的技术,比如用“课程学习”让 AI 先学补兵、再学对线、最后学团战,像教练带新人一样循序渐进。今天你在《王者荣耀》里遇到的“绝悟试炼”人机模式,背后就是这个系统的民用化版本——很多玩家在不知情的情况下已经领教过它的厉害了。
3.5 另一个方向:不用赢你,只要开得比你好
除了“赢”,还有一条精致的支线:索尼的 GT Sophy。2022 年,索尼 AI 与《GT 赛车》系列开发商 Polyphony Digital 合作的自动驾驶 AI 登上了《自然》杂志。它不追求打赢世界冠军,而是要开得像一个兼具超人技巧和赛车礼仪的车手:在极限速度下超车,同时遵守赛规、尊重对手的行驶路线、避免碰撞。为此,研究者在奖励函数里加入了大量“体育精神”相关的项。这项研究的意义在于:真实世界的机器人(比如自动驾驶汽车)需要的恰恰不是“不惜一切代价赢”,而是在复杂约束下做出既高效又安全、还能被人类接受的决策。GT Sophy 后来被放进《GT 赛车 7》作为游戏内的对手,让玩家在娱乐中体验与顶级 AI 切磋。
3.6 强化学习路线的天花板
这套“自我对弈 + 海量算力”的路线威力巨大,但天花板也很明显:
其一,泛化能力差。 AlphaStar 只会打星际,换个游戏就得从头再来。它掌握的是“星际争霸的智能”,不是“通用的智能”。2025 年 Springer 上一篇有趣的研究就分析了人类玩家如何专门针对 AlphaStar 的固定套路开发出克制策略——高度特化的 AI 一旦策略被摸透,反而成了可以被算计的对象。
其二,算力成本高得离谱。 OpenAI Five 的十万 CPU 核不是谁都能烧得起的,AlphaStar 的联赛训练同样是百万美元级别的投入。这也是为什么这条路线基本只有顶级实验室在玩。
其三,它需要游戏厂商的深度配合。 Dota 2 和星际争霸 II 都为研究者开放了特制的研究接口。对于绝大多数游戏——比如你硬盘里的《Gears 5》——既没有这样的接口,也不开放这种许可,这条路线就走不通。
于是,另一条路线登场了。这条路线不需要游戏厂商开门,甚至不需要游戏本身——它只需要看视频。
四、路线二:模仿学习——看视频就能学会玩
强化学习是从零自学的“天才儿童”,那模仿学习(Imitation Learning)就是跟着高手录像一步步模仿的“学徒”。它的基本思路极其朴素:人类玩家是怎么操作的,你就让 AI 学着怎么操作。
这条路线的最大优势是数据来源便宜。全球每天有数亿人玩游戏,产生的游戏视频汗牛充栋。这些视频不需要标注——画面就是输入,操作就是输出,天然构成训练数据。
2022 年 OpenAI 发布的 VPT(Video PreTraining)是这条路线上的代表作。研究人员与一家游戏公司合作,先让志愿者边玩《我的世界》边录制键盘鼠标操作,训练出一个“逆动力学模型”——给定前后两帧画面,反推出中间发生了什么操作。然后,把这个模型应用到网上七万小时的《我的世界》无标注游戏视频上,自动“脑补”出每一帧背后的操作,从而生成海量带操作标签的训练数据。用这些数据预训练出来的模型,已经能做出砍树、合成、建房子等复杂行为;再用少量带奖励信号的强化学习微调,它成功合成了钻石镐——在当时的研究界,这被认为是一个几乎不可能完成的任务,因为合成钻石镐需要几十步环环相扣的操作,任何一步出错就得重来。
如果说 VPT 证明了“看视频能学会操作”,那么更近的工作则把这种思路推向了工业规模。2026 年公布的 NitroGen 系统,用超过 1000 款游戏、累计约 4 万小时的游戏视频进行训练,目标是让模型获得跨游戏的通用操作能力;而 Game-TARS 则在超过 5000 亿 token 的多模态游戏数据上预训练,直接操控键盘鼠标和图形界面,在多款从未见过的 3D 游戏里完成任务。这两者的意义在于:它们开始摆脱“一个游戏一个模型”的老路,朝“一个模型通吃多种游戏”迈进——这正是通用人工智能想要的能力。
模仿学习路线绕开了强化学习最大的两个痛点:不需要为每个游戏单独搭建训练环境,也不需要奖励函数这种精巧的手工设计。但它有自己的难题:人类视频里充满了“无效操作”和“犹豫”,AI 照单全收会学来一身毛病;而且模仿只能学到人类展示过的东西,难以超越人类的策略上限。所以现实中最好的系统往往是混合型的:先用模仿学习打底,再用强化学习突破。
五、路线三:大语言模型智能体——把“打游戏”变成“思考 + 调用工具”
2023 年之后,随着 ChatGPT 掀起的浪潮,第三条路线成为当下最热、也是离你我最“像人”的一条:用大语言模型(LLM)和多模态视觉语言模型(VLM)直接驱动一个智能体(Agent)去玩游戏。
5.1 大模型玩游戏的三个基本件
一个现代游戏智能体的架构,通常由三个基本件构成:
感知。 截屏,或读取游戏画面/文本状态,由多模态模型理解“我现在在哪、面前有什么、血量多少”。这模拟的是人的眼睛。
规划与记忆。 大语言模型把“通关游戏”这种宏大目标分解成一步步可执行的小任务,并在长流程中记住之前做过什么、什么有效什么无效。这模拟的是人的大脑。
行动与反馈。 模型输出具体操作——调用游戏 API、执行一段控制代码,或者模拟键鼠点击——然后根据游戏反馈(成功、失败、报错信息)反思和调整。这模拟的是手和学习能力。
在这条路线上,2023 年的 Voyager 是一个无法绕开的里程碑。
5.2 Voyager:在《我的世界》里自学的终身学习者
Voyager 由英伟达、加州理工等机构的研究者提出,是第一个由大语言模型驱动的开放式具身智能体:你把它丢进《我的世界》,不给任何脚本和任务清单,它会自己决定下一步该探索什么、学习什么,终身不停地成长。
它有三个精妙的设计:
第一,自动课程。 GPT-4 充当“出题老师”,根据智能体当前的技能水平和世界状态,不断提出难度适中、富有探索价值的新目标:先学会砍树,再学会做工作台,然后挑战更复杂的东西。这解决了开放式游戏的核心难题——没人告诉它“接下来该干嘛”,它自己给自己找事做。
第二,技能库。 这是 Voyager 最独特的设计。它不把学到的技能存在神经网络权重里,而是存成可执行的代码函数:“砍树”是一段代码,“做石镐”是一段代码。这些代码写在技能库里,随时可以检索、复用、组合。想造新东西时,它先查库:“做铁镐”的技能也许可以拆解复用“挖矿”和“合成”的旧技能。这种代码化的技能表示可解释、可组合,还天然避免了“灾难性遗忘”——学新东西不会把旧本领忘掉。
第三,迭代纠错。 代码写错了?环境会反馈执行错误;目标没达成?自我验证机制会发现。Voyager 把错误信息喂回大模型,让它修改代码重试,直到成功为止。
效果是惊人的:与此前最好的方法相比,Voyager 获得的独特物品数量是对方的 3.3 倍,探索距离是 2.3 倍,解锁关键科技里程碑的速度最快快了 15.3 倍。更重要的是,把这套技能库带进一个全新世界,它还能从旧技能出发解决从没见过的新任务,展现出真正的迁移能力。
值得注意的是实现成本:Voyager 只是通过 API 黑盒调用 GPT-4,用提示词驱动,完全不微调模型参数。这意味着个人开发者也可以用同样的思路搭建自己的游戏智能体——这是它和 AlphaStar 那种百万美元项目的本质区别。
5.3 反思机制:让 AI 从失败中长记性
Voyager 引出的另一个重要概念是反思(Reflection)。2023 年的 Reflexion 框架提出了一个优雅的想法:不更新模型权重,而是让 AI 在每次失败后,用自然语言写一段“复盘笔记”存进记忆——“我刚才死是因为没看身后”“绕到敌人背后需要等它转身”——下次行动前把这些笔记读一遍。这被形象地称为“语言化的强化学习”:奖励信号不落在梯度上,而落在文字记忆里。
这条思路在后来的游戏智能体上被大量复用:智能体打完一局,回看自己的操作轨迹(进阶版本甚至回看游戏录像),总结哪里做错了、下次怎么改,然后再打一局。几轮下来,成绩曲线持续上升,而且全程没有碰过一次模型参数。近期的一些基准测试专门研究这种“越打越强”的动态提升过程,发现带有反思机制的智能体在多轮改进后,面对同一游戏的变体任务也能举一反三——这种“学会学习”的能力,恰恰是通往通用智能的关键。
5.4 从专用接口到“像人一样看屏幕点鼠标”
Voyager 这类早期智能体还依赖《我的世界》的专用代码接口(Mineflayer),说不上真正的“玩游戏”。但新一代智能体正在逼近真正的通用操作:直接看屏幕、直接发键鼠事件,就像坐在电脑前的人一样。2025–2026 年的多项工作——如 Lumine 能在 3D 环境里连续执行数小时的实时任务,以及前面提到的 Game-TARS、NitroGen——都在这条路上推进。近期研究者们甚至开始搭建标准化的跨游戏评测平台(比如基于虚幻引擎 5 的 OmniGameArena),要求智能体在不针对单款游戏定制的前提下,在多款游戏里边看画面边操作完成任务,并追踪它们的自我进步轨迹。
换句话说,这条路线的终极形态是:不需要游戏厂商配合、不需要特殊接口,给你任何一款新游戏,看看画面、翻翻说明书,就能上手——这已经是“通用智能”的定义了。
六、路线四:干脆自己造世界——世界模型的兴起
以上三条路线,AI 智能体都是在别人造好的游戏里训练。而 2024–2025 年,一个更激进的思路出现了:如果游戏不够多、不够多样,那就让 AI 自己生成无限多的游戏世界,在自己的世界里练。
这就是“世界模型”(World Model)。2025 年 8 月,Google DeepMind 发布了 Genie 3:你只需要输入一句文字描述——“一条维多利亚风格的街道,尽头有一扇通往沙漠的发光传送门”——它就实时生成一个 720p 分辨率、24 帧每秒、可自由探索的交互式 3D 世界。你可以在里面走动、转动视角、改变天气、添加物体,世界会记住你几分钟前做过的修改(它的“世界记忆”约能维持一分钟)。这些物理规律不是手工编码的引擎规则,而是模型通过自监督学习从数据中“悟”出来的。
造这样的世界是为了什么?DeepMind 的回答非常直白:训练智能体。他们把自己的 SIMA 智能体放进 Genie 3 生成的世界里,下达“走到那棵红色的树旁边”之类的目标,智能体通过向世界模型发送导航指令来完成任务。因为环境无限多样且生成速度极快,智能体可以在现实中几乎不可能遇到的场景里反复练习——比如模拟一只鹿突然冲上公路的极端情况,训练自动驾驶如何安全应对。
这条路线的战略意义在于:它同时解决了训练数据的稀缺性和危险性。真实世界里,你不可能为了训练机器人而让它在真实公路上撞一万次车;而在世界模型里,你可以让 AI 体验十亿种现实世界从未发生过的情境。DeepMind 把世界模型称为“通向 AGI 的关键垫脚石”,而英伟达的 Jim Fan 则称这类技术预示着“游戏引擎 2.0”——未来开发者不再需要显式的 3D 资产和渲染管线,一段提示词就能驱动模型权重生成整个世界。
当然,世界模型目前还有明显局限:交互时长只有几分钟,多智能体交互还难以建模,物理细节上时有幻觉。但方向已经足够清晰:游戏的终点不是被 AI 通关,而是成为 AI 训练的无限燃料。
七、为什么 AI 公司抢着做这件事?一盘大棋
现在我们可以回答开头的问题了:AI 公司为什么要花巨资让 AI 打游戏?综合来看,是五重动机的叠加。
其一,游戏是通往通用智能的阶梯。 打游戏锻炼的核心能力——感知、规划、决策、协作、从失败中学习——没有任何一项是游戏独有的,它们全部能迁移。游戏环境可控、可重复、反馈即时,是训练这些能力的最佳温床。从吃豆人到星际争霸,AI 每攻克一类游戏,就证明自己又掌握了一类决策问题的通用解法。DeepMind 从雅达利走向围棋、走向蛋白质结构预测(AlphaFold),再到如今的世界模型,这条“从游戏走向科学”的路径已经走通了两次。
其二,游戏里练出的本事直接服务于机器人。 具身智能(Embodied AI)需要 AI 在物理世界里感知和行动,而真实机器人又慢又贵还容易摔坏。游戏和仿真环境里的策略,稍加调整就能迁移到机械臂、无人机、自动驾驶上。GT Sophy 研究的“高效但守规矩的决策”,绝尘(JueWu)研究的大规模协作,本质都是在为真实世界的机器智能铺路。这也是为什么 Minecraft 这类游戏的智能体研究如此火热——方块世界的操作逻辑和真实世界有结构性的相似。
其三,数据飞轮。 自我对弈可以无限生成新数据,游戏视频网上俯拾皆是,世界模型可以自己造训练环境。在高质量人类数据逐渐枯竭的时代,游戏是少数几个能无限扩产数据的地方。
其四,人才与技术的练兵场。 训练 AlphaStar 积累的大规模分布式强化学习系统、训练 OpenAI Five 磨练的亿级并行模拟框架,后来都变成了这些实验室做更大事情的基础设施。某种意义上,游戏项目是顶尖工程团队的“演习”。
其五,传播与招聘。 不可否认,“AI 击败世界冠军”是效果最好的技术广告和人才招聘广告。一场人机大战带来的全球关注度,胜过一百篇论文。
八、冷水:那些新闻没告诉你的局限
讲了这么多光鲜的成就,也必须泼几盆冷水。理解这些局限,你才能对“AI 通关游戏”建立一个不浮夸的认知。
第一,绝大多数胜利都不是在“公平条件”下取得的。 AI 拥有完美的反应速度(即便限制了 APM,单次操作的精度也远超人类)、全图视野(很多研究用到了隐藏信息训练价值网络)、以及永不疲惫的执行。人类选手输给的常常不是“策略”,而是这些系统性优势。即便 DeepMind 刻意压低操作上限,也无法完全抹平差距。
第二,它们往往极其“偏科”。 OpenAI Five 只会打 Dota 2 还限定在特定规则版本,AlphaStar 换个地图版本就要重新训练。2025 年那篇研究人类如何开发新策略反制 AI 的论文说明:特化的 AI 一旦被研究透,在开放式博弈中反而脆弱。真正的通用性——拿到任何新游戏快速上手——直到最近的大模型智能体路线才开始有了眉目。
第三,成本令人咋舌。 AlphaStar 背后是 44 天、上千块 TPU 的联赛训练;OpenAI Five 背后是 12.8 万核 CPU 并行十个月。这种投入只有极少数机构承担得起。相比之下,Voyager 这种“调 GPT-4 API + 写提示词”的路线成本低了几个数量级,这本身也说明技术范式正在转移。
第四,“通关”的定义其实很窄。 新闻里的“通关”大多指竞技对抗中的胜利,或者某个预设任务的完成。而真正开放的游戏体验——被一段剧情打动、和队友开玩笑、在风景里闲逛——目前没有任何 AI 真正“会玩”。AI 攻克的是游戏的目标函数,而不是游戏作为文化体验的全部。
第五,对游戏生态的反作用力已经开始显现。 当 AI 玩家大量涌入多人游戏,公平性、反作弊、匹配体验都会受到冲击;当 AI 能自动生成关卡和内容,游戏从业者的角色也在被重新定义。这些问题没有标准答案,但值得整个行业严肃对待。
九、对普通玩家来说,这一切意味着什么?
聊了这么多,你可能想问:这些大新闻跟我这个普通玩家有什么关系?关系其实比想象中近。
你会在单机里遇到它们。 《王者荣耀》的绝悟试炼、《GT 赛车 7》里的 GT Sophy,都是顶级研究 AI 的民用化落地。未来你游戏里的 NPC 不再只会沿固定脚本行动,而是会学习你的打法、针对你的习惯调整策略——单机游戏将拥有无穷尽的“会思考的对手”。
你的队友和对手可能是 AI,而且越来越好。 OpenAI Five 证明了纯竞技训练的 AI 稍加调整就能与人类协作。随着大模型智能体成熟,“AI 队友听懂你的自然语言指挥”“AI 陪练针对你的弱点特训”都会变成标配功能。
做游戏的门槛会大幅降低。 Voyager 用代码当技能、世界模型用提示词造世界,这些技术下沉到工具层之后,普通玩家用语言描述就能生成自己的关卡、自己的 NPC、自己的任务线——游戏创作会从专业工作变成大众表达。
看懂新闻的姿势也变了。 下次再看到“AI 通关某游戏”的标题,你可以多问三句:它用的是特权接口还是真看屏幕?它是从零自学还是看了人类录像?它打的是通用能力还是只此一家的特化策略?这三个问题一问,大部分耸动标题的水分就能挤出来。
十、结语:游戏的尽头是智能
从 1952 年塞缪尔的跳棋程序,到 2019 年击败世界冠军的 OpenAI Five,再到今天在《我的世界》里终身学习、在自造世界里自我训练的 Voyager 和 SIMA——AI 打游戏的历史,几乎就是人工智能本身的演进史。
这件事表面上是“机器抢人类的娱乐”,本质上却是人类借游戏理解智能如何产生。每攻克一款游戏,我们对“如何从经验中学习”的理解就深一层;而这些理解正在溢出游戏世界,流向蛋白质折叠、材料科学、机器人与自动驾驶。DeepMind 从雅达利走向 AlphaFold 拿了诺贝尔奖,是这条路径最有力的注脚。
至于你我这样的玩家,不必焦虑,大可期待:当 AI 把“打不打得过”的问题彻底解决之后,它下一个要学会的课题,恰恰是游戏里最人性的部分——为什么我们会为虚拟世界里的一个选择而感动。那一天还很远,但每一次“AI 通关”的新闻,都是朝着那一天迈出的一小步。
十一、四条路线横向对比:一张表看懂技术版图
读到这里,我们把前面四条路线横向拉通对比一下,方便你建立一个整体框架:
| 维度 | 深度强化学习 | 模仿学习 | 大模型智能体 | 世界模型 |
|---|---|---|---|---|
| 代表系统 | AlphaStar、OpenAI Five、绝悟 | VPT、NitroGen | Voyager、Reflexion、Game-TARS | Genie 3 + SIMA |
| 数据来源 | 自我对弈产生 | 人类游戏视频 | 大模型预训练 + 环境反馈 | 模型自造环境 |
| 需要游戏接口吗 | 需要深度定制 | 看视频就行,不需要 | 早期需要,新一代只看屏幕 | 完全不需要游戏本身 |
| 算力成本 | 极高(百万美元级) | 高 | 低(调 API 即可) | 极高(目前只有顶级实验室) |
| 通用性 | 差,一个游戏一个模型 | 中,可跨游戏迁移操作 | 好,目标就是通用 | 理论上限最高,尚处早期 |
| 能否超越人类 | 能(APM 和精度优势) | 受限于人类上限 | 部分场景已超越 | 待验证 |
| 谁能玩得起 | 顶级实验室和大厂 | 中型研究团队 | 个人开发者 | 目前只有 Google 这个级别 |
这张表里最有意思的趋势是从左下角到右上角的大迁移:成本越来越低,通用性越来越强。AlphaStar 时代只有烧得起十万核 CPU 的机构才能入场;到了 Voyager 时代,一个会写代码的研究生加几个 GPT-4 的 API 额度就能做出登上周报封面的成果。技术的民主化速度,比大多数人想象的快。
还需要补充一句:这四条路线并非互相替代,而是正在融合。最新的系统往往先用海量视频做模仿预训练(路线二),再用强化学习提升(路线一),套上智能体的规划与反思框架(路线三),最后在世界模型里大规模练兵(路线四)。未来“AI 通关某游戏”的系统,大概率是四种思路的混血儿。
十二、自己动手:一个普通开发者如何复现“AI 玩游戏”
看到这里,跃跃欲试的读者可能会问:我自己能不能搭一个游戏智能体?答案是完全可行,而且比你想的便宜得多。以最容易上手的 Voyager 路线为例,整体流程大致是这样的:
第一步,选环境。 推荐《我的世界》的 Java 版 + Mineflayer 开源框架,它提供了用 JavaScript 读写游戏状态的代码接口,是社区里最成熟的选择。想要更简单,也可以从 Gymnasium(OpenAI Gym 的继任者)里的经典控制游戏入手,几行代码就能跑起来强化学习。
第二步,接大模型。 准备一个 GPT-4 级别的多模态模型 API(国内的同类大模型 API 也可以),Voyager 官方代码库是 MIT 协议开源的,克隆下来填上 API 密钥就能跑。它的三大模块——自动课程、技能库、迭代纠错——都是现成的,跑通后你能亲眼看着它从砍第一棵树开始,一步步学会合成越来越复杂的东西。
第三步,加反思。 在基础框架上引入 Reflexion 式的复盘机制:每局结束后把失败轨迹交给大模型,让它写出自然语言复盘存进记忆。这是性价比最高的改进——不花一分钱训练成本,效果往往立竿见影。
第四步,走向真实屏幕(进阶)。 如果你想让智能体像人一样看屏幕、点鼠标,可以接入截图工具加键鼠模拟库,把“观察-思考-操作”的循环搭起来。这条路目前是研究前沿,坑也最多,但正因如此,踩出来的每一篇笔记都有价值。
整个过程中最贵的开销是 API 调用费,跑一个 Voyager 级别的实验,几十到几百美元就能搞定——和 AlphaStar 时代的天文数字相比,这是五个数量级的差距。一个人、一台笔记本、一个周末,你就能亲手复现 2023 年登上各大媒体头条的成果。这大概也是这个时代做 AI 最迷人的地方:最前沿的东西,第一次离普通人这么近。
当然,要提醒一句:如果你打算让智能体去玩网游,请务必先阅读用户协议——绝大多数在线游戏的条款禁止任何形式的自动化操作,单机游戏和自建环境才是安全的试验田。
十三、附录:AI 打游戏大事记
- 1952 年:塞缪尔写出会自我学习的跳棋程序,“机器学习”概念萌芽。
- 1997 年:IBM 深蓝击败国际象棋世界冠军卡斯帕罗夫,暴力搜索的巅峰。
- 2013 年:DeepMind 的 DQN 直接从像素学会数十款雅达利游戏,深度强化学习横空出世。
- 2015 年:DQN 登上《自然》杂志封面;同年 AlphaGo 横空出世。
- 2016 年:AlphaGo 4:1 击败李世石,人工智能成为全球话题。
- 2017 年:AlphaGo Zero 抛弃人类棋谱,三天从零自学成神。
- 2019 年:AlphaStar 登上星际争霸 II 宗师梯队,超越 99.8% 的人类玩家;OpenAI Five 在直播中 2:0 击败 Dota 2 世界冠军 OG,随后以 99.4% 的胜率横扫公网挑战者。
- 2020 年:腾讯绝悟攻克《王者荣耀》,首个不限英雄池的电竞级 AI;OpenAI 用七个字概括趋势:规模就是一切。
- 2022 年:OpenAI 发布 VPT,看七万小时无标注视频学会合成钻石镐;索尼 GT Sophy 登上《自然》,成为游戏内 AI 车手的标杆。
- 2023 年:Voyager 与 Reflexion 相继发表,大语言模型智能体路线确立,“用提示词玩游戏”成为新范式。
- 2024 年:DeepMind 发布 Genie 2,世界模型首次实现可交互生成。
- 2025 年:Genie 3 实现 720p、24 帧的实时交互世界,SIMA 智能体在其中完成长程任务;Game-TARS、NitroGen 等跨游戏智能体把“通用游戏操作”推向新高度。
- 2026 年:标准化的跨游戏智能体评测平台出现,行业开始认真衡量“AI 到底离通用玩家还有多远”。
七十年间,AI 从棋盘上的一颗棋子,走进了无数玩家朝夕相处的屏幕里。这份年表还会继续写下去——而且接下来的每一笔,恐怕都会比过去更快。
参考资料
- Mnih et al., Human-level control through deep reinforcement learning, Nature, 2015.
- Vinyals et al., Grandmaster level in StarCraft II using multi-agent reinforcement learning, Nature, 2019. DeepMind 博客
- Berner et al., Dota 2 with Large Scale Deep Reinforcement Learning, arXiv:1912.06680, 2019. OpenAI: OpenAI Five defeats Dota 2 world champions
- Wang et al., Voyager: An Open-Ended Embodied Agent with Large Language Models, 2023. GitHub 仓库
- Baker et al., Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos, OpenAI, 2022.
- Shinn et al., Reflexion: Language Agents with Verbal Reinforcement Learning, 2023.
- Ye et al., Towards Playing Full MOBA Games with Deep Reinforcement Learning(腾讯绝悟), Nature Machine Intelligence, 2020.
- Wurman et al., Outracing champion Gran Turismo drivers with deep reinforcement learning(GT Sophy), Nature, 2022.
- Google DeepMind, Genie 3 官方页面, 2025.
- OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents, arXiv:2606.09826, 2026.
- A Survey on Large Language Model-Based Game Agents, arXiv:2404.02039.
- Human strategic innovation against AI systems, Springer, 2025.
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)