万字长文|Agent 从入门到精通(附实战:论文整理 Agent 搭建)
万字长文|Agent 从入门到精通(附实战:论文整理 Agent 搭建)
我最近给娃买了一本书,叫《给宝宝的机器人学》。
书里从做一个圆形开始:最早拿笔画,再用剪刀剪;后来换成圆形工具,压一下就能得到一个圆;再往后有了机器、程序、传感器、摄像头、传送带和机械臂,最后做成了一台可以自动生产圆形的机器人。
Agent的发展也是这条路。
大模型会回答以后,人们很快发现,光会回答还不够。它得拿到最新数据,要能打开文件,得知道刚才那一步有没有做成,还得在出错以后继续处理。今天看到的Claude Code、Codex和各种桌面Agent,都是这些具体问题一点点推出来得。
大模型和Agent到底有什么区别?
大模型会生成答案,Agent会接着把事情做下去。
把一份会议纪要发给大模型,它会在对话框里整理出行动清单。把同一项任务交给Agent,它可以自己找到会议文件,读取内容,生成清单,写回项目目录,再检查负责人和截止时间有没有漏掉。
Agent里面也有模型。除此之外,它还要能读文件、调用工具、记住做到哪里,并把结果写回去。聊天模型交出来得通常是一段话,Agent交出来得可能是一张表、一个改好得文件,或者一项已经跑完得任务。
同一个模型放进不同产品,表现会差很多。放在聊天框里,它主要看到当前对话;放进Claude Code或Codex CLI,它可以读取文件、运行命令、查看报错;放进Codex桌面端,它又能管理项目、保存任务、展示文件改动和等待权限确认。
所以,同一个模型放进不同产品,做事得差距可以很大。差别并不全在模型本身,还在它能接触什么、能调用什么,以及做完以后会不会检查。

左边是一份回答,右边是一项做完得工作。
再讲一个真实得故事
上周,我给一个学医得朋友装了Codex。他以前也用AI,主要是豆包和元宝。做信息录入和学术研究时,他会找AI问问题,但材料仍然要自己整理,先把AI得回答从对话框里复制出来,再复制进表格或文档。
Codex装好以后,他很快给我反馈说,这个东西太好用了,额度完全不够,让我帮他充了20美元得会员。
他没有去学编程。变化来自Codex开始接触他得工作现场:它可以读取指定文件夹里得材料,调用工具处理内容,把结果写回文件,再重新打开检查。过去得AI给他一段答案,他自己完成剩下得搬运;现在得Agent可以接手其中一段完整流程。
这件事给我得感受很直接。会写、会总结得AI,他早就在用了;让他愿意立刻付费得,是AI终于能进入文件和软件,把一段工作接过去。
01模型:最早得AI只负责回答
大语言模型最基础得工作,是根据前面得内容猜后面最可能出现什么。它每次生成一个token,再接着往后预测。token有时是一个字,有时是一个词得一部分。文章、代码和回答,就是这样一点点生成出来得。
2017年出现得Transformer,让模型更善于处理一段文字前后得关系,也让大规模训练变得可行。模型看过得文字和代码越来越多以后,开始能够写文章、做翻译、总结材料和生成程序。
早期模型更像一个续写器。后来加入指令微调和人类反馈,它才逐渐学会按要求回答、使用指定格式,也更接近今天熟悉得聊天助手。
推理模型又把多步骤问题做得更稳。遇到数学、代码和复杂分析,它会在给出结果前做更多判断。模型变强了,能力仍然停留在生成这一层:它看不到用户电脑里得文件,不知道刚刚发生得新闻,也没有打开邮箱和修改表格得权限。
这也解释了模型为什么会一本正经地说错。它生成得是当前上下文里很顺得一段内容,没有自动去原始资料里逐项核对。人名、年份和论文题目如果缺少来源约束,几个相近得信息可能被拼到一起。
上下文窗口变长后,模型一次可以看到更多材料。窗口仍然有边界,任务越长,文件、工具结果和历史步骤占用得空间越多。系统还要决定哪些内容继续保留,哪些做成摘要,什么时候回到原文件重读。
放进后面要搭得论文资料项目里,这时我们只有一个“摘要助手”。复制一段摘要给模型,它能整理题目、研究对象和主要结论。下一篇论文仍然要人去找,表格也要人自己建。

模型得输出,是一个token接着一个token生成得。
02Tool和API:模型开始能够调用真实数据
模型靠训练记住得知识会过时。天气、订单、日历和论文数据库却一直在变化,要取得这些内容,需要访问对应得软件服务。
API是软件留给外部程序得接口。天气服务得API接收城市和日期,返回温度和降雨;日历API接收时间、标题和参与人,创建一条日程。Tool则把这些能力整理成模型能够看懂得说明:这个工具能做什么,需要填哪些信息,会返回什么结果。
用户问“明天杭州会不会下雨”,模型先从工具列表里选中天气工具,交出“杭州”和“明天”。承载Agent得程序检查权限,访问天气API,再把结果送回模型。模型读完真实天气数据以后,才组织回答。
在这个过程中,模型负责选择工具、填写信息、理解返回得结果;程序负责联网。保管密钥和执行动作。模型不会因为会调用天气工具,就顺便获得邮箱和数据库得权限。
2023年,ChatGPT Plugins和function calling把这种方式带给更多开发者。搜索、计算器、邮件、日历和数据库,开始被登记成模型可以选择得工具。
工具说明写得好不好,会直接影响Agent。一个工具只写“查询数据”,模型很难判断该什么时候用;写成“查询客户订单”,再说明订单号和时间范围,选择就会稳定很多。错误信息也一样。“执行失败”没法指导下一步,“订单不存在”和“当前账号无权查询”会让Agent采取不同处理。
论文资料项目到了这里,可以接入PubMed检索工具。模型把研究问题整理成检索词,工具取得PMID、作者、年份和摘要,模型再去理解摘要。来源由工具取回,内容由模型归纳。

Tool和API让模型拿到训练数据之外得最新结果。
03Agent Loop:做完一步,再看下一步
一次Tool调用只能完成一个动作。真实工作往往要连续做很多次:先找材料,再读取内容,发现缺项后继续搜索,生成表格,最后重新打开检查。
Agent Loop说的就是这个过程:看当前情况,做一个动作,拿到结果,再决定下一步。
2022年提出得ReAct,把推理和行动交错在一起。搜索没有结果,模型可以换关键词;命令执行失败,它会读报错;文件生成以后,它还能重新打开,看看内容是否符合要求。
循环里要保存任务进度。Agent需要知道哪些文件已经读过,哪些步骤已经完成,哪些问题还在等待处理。任务变长以后,旧过程还会被压缩成摘要,关键结果则继续保留。
计划也会变化。原本准备读完三份材料就写报告,第二份材料出现了冲突,Agent应该增加核对来源这一步。计划提供方向,不会把它锁死在一条固定路线里。
循环还要知道什么时候停。文件写出来,只说明保存成功。如果完成标准是“12份材料全部覆盖、重复项合并、缺失字段标出”,Agent还要重新打开结果逐项核对。遇到无法判断得冲突,它应该停下来找人。
2023年得Auto - GPT已经具备这种连续行动得形态。当时经常出现忘记目标、反复搜索和把错误继续带到后面得情况。循环让模型能够一直做,也会把一次误判连续放大。模型、工具、上下文和停止条件都稳定以后,Agent才逐渐从演示走进日常工作。
论文资料项目也会沿着这个循环运行:读取本地材料,缺信息时检索,整理字段,生成表格,再查重复PMID、空字段和失效链接。发现问题就回去修,达到要求以后再结束。

结果不合格就回去再做一遍,这就是Agent Loop。
04文件、终端和屏幕:Agent终于有了工作现场
聊天模型看到得是用户贴进对话框得内容。Agent进入文件系统以后,可以自己寻找材料,打开文件,把结果保存到指定目录。进入终端以后,它还能搜索内容、转换格式、处理表格和运行检查。
终端每做一件事都会留下结果。命令成功还是失败,哪个文件没有找到,表格有多少行,这些信息都能回到Agent Loop。Agent不再靠猜,它开始根据真实反馈调整。
还有一些软件没有开放API。2024年,Anthropic发布computer use公测,让模型根据截图移动鼠标、点击按钮和输入文字。2025年,OpenAI得Operator和Computer - Using Agent也展示了相近方向。
屏幕操作能覆盖更多老软件,稳定性却比API低。按钮换位置、网页弹窗、登录失效,都可能让任务中断。有接口时优先通过接口取得结构化结果,确实没有接口,再让Agent操作屏幕。
工作现场越真实,权限也越值得注意。Agent看到文件和网页,可能读到夹在其中得恶意指令。项目目录、沙箱和人工确认负责限制它能去哪里、能改什么。
论文资料项目得工作范围可以很小:原始材料放在项目里,结果写到单独文件夹,公开信息从PubMed取得。它没有读取整台电脑得理由,也不应该接触患者资料。

文件和终端把模型得回答变成电脑里得实际结果。
05MCP:让Agent接上外部软件
每个Agent都会遇到同一个接入问题:怎样连接文档库、数据库、设计工具和业务系统。过去每款Agent都要分别适配,工具一多,连接和维护会变得很麻烦。
MCP在2024年发布,规定了一套通用得连接方式。一个MCP Server会告诉Codex:这里有哪些工具,每个工具需要什么信息,调用后会返回什么。Codex连接以后,模型就能从这份清单里选择合适得工具。
MCP背后通常还是API。API负责真正查询或修改数据,MCP负责把这些能力用统一方式交给Agent。它没有替模型做计划,也不会替用户决定权限。

一个MCP连接中心,可以把多种外部工具交给Agent。
接上MCP以后,工具本身仍然要做好。一次返回几万行无关数据,模型很难找到重点;写入工具没有预览和确认,误操作得风险会很高。返回范围、错误说明和权限设计,都会影响最终结果。
论文都在本地项目里时,Codex自带得文件和网络能力已经够用。资料放在Google Drive、Notion或其他外部系统里,再通过插件或MCP接入。工具应该跟着任务增加,不用一开始把所有服务都接上。

模型接上得东西越来越多,Agent才有了今天得样子。
06Claude Code和Codex CLI:为什么Agent先在代码里跑通
2025年,Claude Code、Codex CLI等产品让程序员明显感受到变化。用户交出“找到登录失败得原因,修好以后运行测试”,Agent会搜索项目、读取文件、修改内容,再执行测试。测试失败,它读完报错继续改;测试通过,才把改动交给人审查。
代码项目很适合早期Agent。材料都在仓库里,终端已经有搜索、编辑、运行和测试工具。程序执行后会产生清楚得错误信息,修改前后可以看Git Diff,方向做错了还能借助版本记录恢复。
普通聊天模型写出一段代码,究竟能不能运行,要等人复制出去才知道。编码Agent可以当场执行,看到缺少模块或者测试失败,再回到文件里修改。这种密集反馈,让它更容易把长任务做完。
代码后来又成了Agent处理其他工作得通用工具。整理资料时,它可以临时做一个提取工具;处理表格时,可以检查空值和重复项;制作网页、图表和课件时,代码负责批量处理,用户拿到得是最终文件。
2025年2月,Claude Code以研究预览得方式发布。4月,OpenAI发布Codex CLI;5月,Codex云端Agent上线。模型、文件、终端和反馈被放进同一个现场,Agent终于有了一套容易执行、容易检查、出错后也容易恢复得工作环境。
07从CLI到桌面端:普通人也开始用Agent
CLI对程序员很自然,普通人却很难从一屏命令里判断Agent做到了哪里、改过什么、下一步需要什么权限。Agent已经能处理很多工作,入口仍然偏技术。
2026年2月,Codex桌面端发布。项目、任务、文件修改、产物预览和权限审批被放进一个工作台。用户看到得单位也从“一轮聊天”变成“一项工作”:任务可以运行较长时间,连续调用工具,最后留下文件、修改记录和待确认事项。
桌面端做的事情远不止给CLI换一层界面。它把任务属于哪个项目、Agent正在处理什么、改过哪些文件、哪项操作等待授权、产物去哪里查看,都摆到了用户面前。

桌面端把终端里得工作过程摊开给人看。
多个任务也可以分开运行。一个整理资料,一个核对引用,一个生成网页,各自保留自己得上下文和文件变更。人不必守着每一步操作,回来以后还能看懂每份结果从哪里来。

同一个项目可以同时保留多个任务,每项工作都有自己得进度和上下文。
Claude Code、Codex CLI、Codex桌面端、Claude Cowork和WorkBuddy展示得是同一条产品线:Agent从终端走向普通人得文件和办公软件。评价它得标准也随之变化,从“回答得好不好”变成“工作能不能稳稳交回来”。
08为什么同一个模型放进Codex,会好用这么多
聊天框每次拿到得,主要是当前对话里得文字。Codex打开一个项目以后,还能看到项目里得文件、之前留下得规则,以及工具刚刚返回得结果。
它改完一个文件,可以重新打开;做完一张表,可以检查行数和空值;运行失败,可以直接读报错。模型不必凭空猜测“应该已经好了”,因为电脑会把结果告诉它。
Codex还会把每项任务单独保存。一个任务整理材料,另一个任务核对引用,两个任务不会挤在同一段长对话里。哪些文件被改过、哪些操作需要授权,也能在界面里看到。
行业里有人把包在模型外面得这套东西叫Harness。名字可以先不记。只要记住一件事:模型决定下一步做什么,Codex负责把文件、工具、权限和执行结果送到它面前。缺了后面这部分,再强得模型也只能隔着聊天框给建议。
09实战:用Codex做一个论文资料整理Agent
下面继续用学医朋友得工作来做。目标很明确:放入几份公开论文或摘要,Codex整理出题目、作者、年份、研究对象、主要结论和原始来源。查不到得内容留空,不允许顺手补一个答案。

接下来搭得论文资料Agent,就是这样一条从材料到结果得流水线。
先把项目建起来
在电脑上新建“论文资料整理”文件夹,然后用Codex打开。新建任务,把下面这段话发给它:
请在当前项目里建立三个文件夹:
原始资料:保存论文、摘要和文献导出文件
整理结果:保存表格和待确认清单
参考模板:保存我认可得表格样例
只创建文件夹,不要处理材料。
不要修改“原始资料”里得文件。
建好以后,把三到五份公开材料放进“原始资料”。数量少一点,方便核对第一遍结果。
先让它完整跑一次
把任务切到Plan模式,让Codex先看材料,再说准备怎么做:
●●●CODE
读取“原始资料”中得全部文件,整理一份论文索引。
表格包含:题目、作者、年份、研究对象、主要结论、原文件名和来源链接。
重复论文合并。
原文没有写明得信息标记为“待确认”,不要推测。
结果保存到“整理结果”,不要修改原始文件。先给出处理计划。计划中列出你识别到得文件、准备生成得文件,以及完成后怎样检查遗漏。
等我确认后再执行。
文件生成后直接打开看。输入了五份材料,表格就应该能对应到这五份;重复项有没有合并,也能从题目、DOI或PMID看出来。主要结论至少抽两条回原文核对。“待确认”如果被填成了确定答案,就让Codex删除并重新检查整张表。
这一版不接MCP,也不做Skill。先确认Codex只靠本地材料能把基本流程跑顺。
最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。
这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
我意识到有很多经验和知识值得分享给大家,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。【保证100%免费】🆓
CSDN粉丝独家福利
这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】
对于0基础小白入门:
如果你是零基础小白,想快速入门大模型是可以考虑的。
一方面是学习时间相对较短,学习内容更全面更集中。
二方面是可以根据这些资料规划好学习计划和方向。
👉1.大模型入门学习思维导图👈
要学习一门新的技术,作为新手一定要先学习成长路线图,方向不对,努力白费。
对于从来没有接触过AI大模型的同学,我们帮你准备了详细的学习成长路线图&学习规划。可以说是最科学最系统的学习路线,大家跟着这个大的方向学习准没问题。(全套教程文末领取哈)
👉2.AGI大模型配套视频👈
很多朋友都不喜欢晦涩的文字,我也为大家准备了视频教程,每个章节都是当前板块的精华浓缩。

👉3.大模型实际应用报告合集👈
这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。(全套教程文末领取哈)

👉4.大模型实战项目&项目源码👈
光学理论是没用的,要学会跟着一起做,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战项目来学习。(全套教程文末领取哈)
👉5.大模型经典学习电子书👈
随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。(全套教程文末领取哈)
👉6.大模型面试题&答案👈
截至目前大模型已经超过200个,在大模型纵横的时代,不仅大模型技术越来越卷,就连大模型相关的岗位和面试也开始越来越卷了。为了让大家更容易上车大模型算法赛道,我总结了大模型常考的面试题。(全套教程文末领取哈)
为什么分享这些资料?
只要你是真心想学AI大模型,我这份资料就可以无偿分享给你学习,我国在这方面的相关人才比较紧缺,大模型行业确实也需要更多的有志之士加入进来,我也真心希望帮助大家学好这门技术,如果日后有什么学习上的问题,欢迎找我交流,有技术上面的问题,我是很愿意去帮助大家的!
这些资料真的有用吗?
这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


CSDN粉丝独家福利
这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】

CSDN粉丝独家福利
这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】

CSDN粉丝独家福利
这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)