5239 篇论文里的 AI 研究全景年报:我用 Open Science + CanguoAI 把四大热门领域画在了同一张地图上
这不是一篇"我觉得"的趋势分析,而是一份可复现的年报。文中每一个数字都来自 OpenAlex 公开数据,CanguoAI 用于模型访问和结构化阅读,不负责生成论文数量、DOI 或研究结论。
目录
- 一张地图看懂四大 AI 领域
- 为什么"趋势文"大多不可信
- 全景数据:5239 篇论文的四条增长曲线
- 横向矩阵:谁最大、谁最"年轻"、谁在领跑
- 增长节奏对比:爆发式 vs 渐进式
- 地理格局:中国与美国的分野
- 主题差异:四个领域各自的重心
- 从年报到选题:数据怎么变成研究问题
- 方法与复现
- 总结与边界
1. 一张地图看懂四大 AI 领域
先把这份年报的骨架放在最前面。过去我用同一套可复现方法,分别为四个热门领域建立了文献地图:AI for Science、RAG(检索增强生成)、LLM Agent(大模型智能体)、具身智能(Embodied Intelligence)。这篇文章把它们汇总到同一张地图上。
- 4 个领域,同一套方法论,可复现文献地图;
- 累计 5239 篇 标题匹配论文(2019–2025 公开数据);
- 最大单领域是 RAG,3464 篇,2025 一年就占 72%;
- 中国机构在 3 个领域领跑(RAG、LLM Agent、具身智能)。
这四个数字背后,是
四条形态完全不同的增长曲线。下面逐一拆开。
2. 为什么"趋势文"大多不可信
打开任何一篇"AI 年度趋势盘点",你几乎都会看到这样的句子:"大模型智能体正在爆发""具身智能是下一个风口"。但很少有人回答:
- 这个判断基于多少篇论文?
- 检索式和时间范围是什么?
- "爆发"具体是多少倍的增长?
- 换个人重新统计,能不能得到同一批数字?
没有这些,趋势就只是感觉。这份年报的目标,就是把每一句判断都落到可复现的公开数据上。方法很简单:对每个领域,用 OpenAlex 的标题检索式抓取 2019–2025 的年度数量、主题、国家和高被引论文,全部归档原始响应,再用脚本统一重算。
需要先声明边界:这里搜索的是标题,不是全文。 所以测量的是"某术语在标题中的显式采用",不等于领域全貌;不同术语(如 embodied AI vs embodied intelligence)会覆盖不同集合。
3. 全景数据:5239 篇论文的四条增长曲线
先看最核心的一张图——四个领域的年度增长放在同一对数刻度上:

四条曲线的形态差异非常明显:
| 领域 | 累计论文 | 曲线特征 |
|---|---|---|
| AI for Science | 302 | 最平缓,2019 年起稳定爬升 |
| RAG | 3464 | 最陡峭,2023 年后近乎垂直爆发 |
| LLM Agent | 1181 | 2023 年才出现,两年冲到近千 |
| 具身智能 | 292 | 有 2020 年起的长尾,2025 年跳升 |
一个有意思的观察:RAG 和 LLM Agent 是典型的"从零爆发"——2022 年之前几乎没有标题匹配,随后被大模型直接点燃;而 AI for Science 和具身智能有更长的历史尾巴,它们不是凭空出现,而是已有根基被二次放大。
这条区别对做综述很重要:爆发式领域的首要问题是"分类和评测标准来不及统一",而渐进式领域的问题是"新旧范式如何衔接"。
4. 横向矩阵:谁最大、谁最"年轻"、谁在领跑
把四个领域的关键指标排成一张对照矩阵:

| 领域 | 累计论文 | 2025 占比 | 2024-25 占比 | 领头国家 |
|---|---|---|---|---|
| AI for Science | 302 | 54.0% | 73.8% | 美国 |
| RAG | 3464 | 71.7% | 98.2% | 中国 |
| LLM Agent | 1181 | 77.5% | 98.7% | 中国 |
| 具身智能 | 292 | 66.4% | 83.2% | 中国 |
从这张矩阵能读出三条结论:
- RAG 是规模之王:3464 篇,远超其他三者之和的一半以上。
- LLM Agent 最"年轻":77.5% 的论文集中在 2025 一年,98.7% 集中在近两年——几乎没有历史积累。
- AI for Science 最"成熟":2024-25 占比仅 73.8%,是四者中历史沉淀最厚的,也是唯一由美国领跑的领域。
5. 增长节奏对比:爆发式 vs 渐进式
把"发表时间集中度"单独画出来,更能看清各领域有多"年轻":

深色是 2025 年、中色是 2024 年、浅色是更早。可以直观看到:
- RAG 和 LLM Agent 几乎是纯深色 + 中色,历史积累(浅色)薄得可以忽略;
- AI for Science 的浅色最厚,说明它有大量 2024 年以前的工作;
- 具身智能介于两者之间,既有明显的 2025 跳升,也保留了可观的历史尾巴。
对研究者的启示:如果你进入 RAG / LLM Agent,面对的是"文献两年内暴涨、缺乏统一基准"的局面;如果进入 AI for Science / 具身智能,则更需要读懂它们各自的历史脉络。
6. 地理格局:中国与美国的分野
四个领域的领头机构国家,呈现出清晰的分野:
- AI for Science 由美国领跑(73 篇),这与它更早、更偏基础科学的属性一致;
- RAG(454 篇)、LLM Agent(127 篇)、具身智能(106 篇)均由中国领跑,这三个都是应用驱动、爆发更晚的方向。
需要提醒:国际合作论文会被同时计入多个国家,这些数字之间存在重叠,不能简单相加。但"越偏应用、越晚爆发的方向,中国机构参与度越高"这一趋势是清晰的。

7. 主题差异:四个领域各自的重心
四个领域的 OpenAlex 第一大主题,恰好勾勒出它们各自的性格:
| 领域 | 第一大主题 | 记录数 |
|---|---|---|
| AI for Science | Artificial Intelligence in Healthcare and Education | 46 |
| RAG | Topic Modeling | 946 |
| LLM Agent | Multi-Agent Systems and Negotiation | 143 |
| 具身智能 | Multimodal Machine Learning Applications | 14 |
有两点值得展开:
RAG 的主题高度集中——946 篇被归入 Topic Modeling,说明它的学术身份相对统一(尽管这个算法标签并不完全准确)。
具身智能的主题最分散——第一大主题也只有 14 篇,它横跨多模态、软体机器人、群体智能、强化学习和认知科学。所以"具身智能 = 大模型 + 机器人"这个流行说法,其实大大简化了它的真实构成。
8. 从年报到选题:数据怎么变成研究问题
这份年报最终要落到"怎么选题"。核心纪律只有一条:不能把"低频"直接写成"空白"。
以四个领域的对比为例,可以提出几个真正可检验的问题:
问题一(跨领域评测迁移):RAG 已经积累了成熟的自动评测(如 RAGAs),这些评测思路能否迁移到 LLM Agent 和具身智能这两个更"年轻"、评测更不统一的领域?
问题二(术语分裂):具身智能在标题层面高度分散,且与 embodied AI / VLA 等术语并存。不同术语社区的方法和评测是否已经割裂,需要一次跨术语的统一综述?
问题三(可复现性洼地):四个领域里,越晚爆发的方向可复现性讨论越少。能否为爆发式领域建立统一的配置披露清单和跨平台基准?
这些问题的共同点是:它们都由年报里的真实数字直接支撑,而不是凭感觉编出来的方向。
9. 方法与复现
这份年报的可信度,建立在"每个数字都能重跑"之上。四个底层研究各自独立可复现,本年报再做一层汇总:
# report.py 的核心校验
totals = {d["label"]: d["total"] for d in domains}
assert totals["AI for Science"] == 302
assert totals["RAG"] == 3464
assert totals["LLM Agent"] == 1181
assert totals["具身智能"] == 292
assert grand_total == 302 + 3464 + 1181 + 292 # 5239
运行方式:
cd output/articles/ai-research-annual-report
python -m pip install -r requirements.txt
python report.py
脚本会读取四份 data.json、重算所有跨领域指标、渲染五张矢量图,任何一项对不上就直接报错。年报数字对不上,脚本先失败。 OpenAlex 持续更新,未来重跑数字可能变化,因此各领域都保留了本次 raw/ 快照。
10. 总结与边界
把四个领域画在同一张地图上,我们得到了一份有据可查的 AI 研究全景:
累计 5239 篇论文里,RAG 以 3464 篇领跑规模,LLM Agent 以 77.5% 的 2025 占比领跑"年轻度",AI for Science 沉淀最厚且由美国主导,具身智能主题最分散、远非"大模型+机器人"一句话能概括——而这四条曲线,全部可由脚本重跑。
它的边界必须说清楚:
本文测量的是标题术语的采用情况,不代表领域全貌;不同术语覆盖不同集合;国家计数因国际合作而重叠;主题标签由算法生成,不等于人工分类。Open Science 管证据和复现,CanguoAI 管语言理解与模型访问,研究者对检索边界、实验设计和最终结论负责。本文不做任何模型效果对照跑分。
这正是 Open Science + CanguoAI 组合最适合科研的地方:它不替你下判断,但保证你的每一个判断都留下了可复现的证据。
CanguoAI:https://canguoai.com/
利益关系说明:本文作者与 CanguoAI 项目有关联。文中的论文数量、主题、国家和 DOI 来自 OpenAlex 公开数据,不是产品内部统计;本文也没有进行 CanguoAI 与其他模型服务的效果对照实验,未声称任何未经验证的自动化能力。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)