本文演示一套可复现的"文献地图 -> 代表论文 -> 候选空白 -> 研究问题"流程。CanguoAI 用于模型访问和结构化阅读,不负责生成论文数量、DOI 或研究结论。

1. 具身智能很火,但"火在哪"很少有人说清

2024 年以来,"具身智能"(Embodied Intelligence)几乎成了 AI 圈最热的词之一。很多介绍会告诉你:具身智能 = 大模型 + 机器人本体,让 AI 从"会说"走向"会做"。

这个说法没错,但太粗。如果你打算写一篇具身智能的综述或开题报告,光有这句话是不够的。你需要回答:

  • 这个领域到底有多少论文?增长有多快?
  • 它主要发表在哪些子方向——是强化学习、软体机器人,还是人机交互?
  • 哪些国家和机构在主导?
  • 操作、导航、仿真、多模态、泛化这些关键能力,在标题里被讨论得多不多?
  • 这些数字能不能重跑?

这次我用 具身智能 作为案例,用公开学术数据把这些问题一个个量化出来。方法沿用我之前对 AI for Science、RAG、LLM Agent 的同一套流程。

2. 研究问题与数据边界

本文回答三个问题:

  1. 2020-2025 年,标题采用 "embodied intelligence" 表述的研究增长有多快?
  2. 这些记录主要分布在哪些 OpenAlex 主题和作者机构国家?
  3. 操作、导航、仿真、基准、强化学习、多模态、语言、泛化、安全、可复现性等维度,在标题中被明确讨论的比例有多高?

主检索式为:

display_name.search:"embodied intelligence"
from_publication_date:2020-01-01
to_publication_date:2025-12-31

这里搜索的是标题,不是全文。因此这项研究测量的是"embodied intelligence"这一术语在标题中的显式采用情况,不能声称覆盖全部具身智能研究——很多相关工作会用 "embodied AI"、"embodied agent"、"vision-language-action" 等其他表述。

"标题没有写 navigation"也不代表论文正文不涉及导航。低频词只能用于筛选值得进一步系统综述的方向,不能直接证明研究空白存在。

3. 用 OpenAlex API 建立文献地图

获取年度数量的核心代码如下:

import json, urllib.parse, urllib.request

params = {
    "filter": 'display_name.search:"embodied intelligence",'
              "from_publication_date:2020-01-01,to_publication_date:2025-12-31",
    "group_by": "publication_year",
    "per-page": 200,
}
url = "https://api.openalex.org/works?" + urllib.parse.urlencode(params)
req = urllib.request.Request(url, headers={"User-Agent": "OpenScience-CSDN-embodied-review/1.0"})
with urllib.request.urlopen(req, timeout=60) as resp:
    result = json.load(resp)
for row in sorted(result["group_by"], key=lambda x: int(x["key"])):
    print(row["key"], row["count"])

本次快照得到 292 条标题匹配记录:

年份 匹配记录数
2020 7
2021 13
2022 13
2023 16
2024 49
2025 194

这组数据有三个明显特征:

  1. 2025 年的 194 条占全部记录的 66.44%
  2. 2024 与 2025 两年合计占 83.22%
  3. 2025 年比 2024 年增加 295.92%,是 2023 年的 12.1 倍

和 RAG、LLM Agent 那种"几乎从零爆发"不同,具身智能有一条更长的历史尾巴——早在 2020 年就有稳定的一批论文(每年 7-16 篇)。这说明它不是纯粹由大模型带火的新词,而是一个有机器人学根基、又被大模型二次点燃的领域。

4. 主题分布:具身智能远不止"大模型 + 机器人"

OpenAlex primary topic 的前几项,恰好回应了开头的疑问:

主题 记录数
Multimodal Machine Learning Applications 14
Modular Robots and Swarm Intelligence 14
Embodied and Extended Cognition 12
Reinforcement Learning in Robotics 11
Robot Manipulation and Learning 11
Social Robot Interaction and HRI 11
Soft Robotics and Applications 9
Digital Transformation in Industry 8
Robotics and Automated Systems 8
Psychiatry, Mental Health, Neuroscience 8

这张图给出了一个很有价值的信号:具身智能的主题分布非常分散,没有任何单一主题占主导。 排第一的多模态机器学习也只有 14 篇。它横跨了:

  • 多模态学习(感知-语言-动作);
  • 模块化机器人与群体智能;
  • 具身与延展认知(认知科学根基);
  • 强化学习、机器人操作;
  • 社交机器人与人机交互;
  • 软体机器人(这是很多"大模型 + 机器人"叙事忽略的方向)。

所以,如果你写综述时只按"VLA 模型 + 仿真环境"组织章节,会漏掉软体机器人、群体智能和认知科学这几条重要脉络。

作者机构国家方面,中国以 106 篇遥遥领先,其后是英国(30)、美国(29)、中国香港(13)、德国(10)等。注意国际合作论文会被同时计入多个国家,数字之间存在重叠。

5. 代表论文告诉我们:主线已经发展到哪一步?

为了避免只看数量,我同时提取了匹配记录中被引次数较高的论文。以下引用和 DOI 来自本次 OpenAlex 快照:

  1. A concise guide to modelling the physics of embodied intelligence in soft robotics,Nature Reviews Physics 2022,DOI:10.1038/s42254-022-00481-z
  2. Embodied intelligence in manufacturing: leveraging large language models for autonomous ...,2024,DOI:10.1007/s10845-023-02294-y
  3. Magnetic Printing of Liquid Metal for Perceptive Soft Actuators with Embodied Intelligence,ACS AMI 2021,DOI:10.1021/acsami.0c20418
  4. Human-in-the-Loop Embodied Intelligence With Interactive Simulation Environment for Surgical ...,RA-L 2023,DOI:10.1109/lra.2023.3284380
  5. Embodied Intelligence: A Synergy of Morphology, Action, Perception and Learning,2025,DOI:10.1145/3717059
  6. Embodied Intelligence Toward Future Smart Manufacturing in the Era of AI Foundation Models,T-MECH 2024,DOI:10.1109/tmech.2024.3456250
  7. Exploring Embodied Intelligence in Soft Robotics: A Review,Biomimetics 2024,DOI:10.3390/biomimetics9040248

从这些代表工作可以看出,具身智能的主线覆盖了:

  • 软体机器人的物理建模;
  • 智能制造与大模型结合;
  • 感知型软体驱动器;
  • 手术等高风险场景的人在回路;
  • 形态-动作-感知-学习的统一框架。

值得注意:被引最高的几篇里,软体机器人和智能制造占了很大比重,而不是大家默认的"VLA 大模型"。这再次说明,具身智能的学术重心和媒体叙事之间存在明显差异。

6. 用同一检索口径筛选候选研究方向

我对主检索集合叠加第二个标题词,量化每个方向在标题中的显式覆盖率:

terms = ["manipulation", "navigation", "simulation", "benchmark",
         "reinforcement", "multimodal", "language", "generalization",
         "safety", "reproducibility"]
for term in terms:
    filters = ('display_name.search:"embodied intelligence",'
               f"display_name.search:{term},"
               "from_publication_date:2020-01-01,to_publication_date:2025-12-31")
    # 请求 OpenAlex,读取 meta.count

实测结果:

标题维度 记录数 占 292 条比例
language 15 5.14%
multimodal 14 4.79%
manipulation 5 1.71%
simulation 3 1.03%
reinforcement 3 1.03%
safety 3 1.03%
navigation 2 0.68%
benchmark 1 0.34%
generalization 0 0.00%
reproducibility 0 0.00%

再次强调:这些比例不是"领域真实研究占比",因为论文可能在正文讨论相关问题但标题没有对应词。它们只用于决定下一轮应该精读和人工标注什么。

7. 从低覆盖词到 4 个可检验选题

方向一:泛化能力在标题层面几乎缺席

generalization 的标题匹配为 0。这不代表没人研究泛化——恰恰相反,泛化几乎是所有具身智能论文的隐含目标,只是很少写进标题。更准确的解读是:"泛化"作为一个被显式命名、可对比的评测维度,尚未在这个术语社区形成统一表述。 可检验问题:

现有具身智能工作在"跨物体、跨场景、跨本体"三类泛化上,是否使用了可比的定义和指标?能否建立一个统一的泛化评测协议?

方向二:基准与可复现性双双偏低

benchmark 仅 1 条,reproducibility 为 0。具身智能的结果高度依赖仿真环境、机器人本体、传感器和随机种子,复现难度远高于纯软件任务。可检验问题:

当只更换仿真器或只更换机器人本体时,具身智能任务的成功率排名是否稳定?论文是否披露了足够的硬件与环境配置?

这类研究不一定要提新模型,也可以建立具身智能配置披露清单和跨平台基准。

方向三:操作与导航的标题覆盖低于预期

manipulation(5 条)和 navigation(2 条)是具身智能的两大经典任务,但标题显式覆盖偏低。这更可能是"术语分裂"——很多操作/导航工作用的是 "embodied AI" 或 "VLA" 而非 "embodied intelligence"。可检验问题:

不同术语社区(embodied intelligence vs embodied AI vs VLA)在操作与导航任务上的方法和评测是否已经割裂?能否做一次跨术语的统一综述?

方向四:软体机器人这条被低估的主线

从代表作看,软体机器人在高被引论文里占比很高,但在媒体叙事里几乎缺席。可检验问题:

软体机器人的"形态即计算"思路,与大模型驱动的具身智能,在可控性、可复现性和任务泛化上各有什么优劣?

这是一个天然适合交叉综述的空白。

8. CanguoAI 在文献综述里怎么用才稳妥

在这套流程中,Open Science 负责保存检索式、原始响应、统计代码、图表和研究记录;CanguoAI 作为模型访问层,用于执行需要语言理解的任务:

  • 把论文按"感知、操作、导航、本体、评测"制作结构化卡片;
  • 从摘要中抽取仿真环境、机器人平台、指标和限制;
  • 对多篇论文的实验设置做横向比较;
  • 将候选方向改写成可证伪假设;
  • 生成综述初稿并检查数字是否与 results.json 一致。

建议把真实元数据随提示词一起发送,并禁止模型补造:

prompt = f"""
下面是来自 OpenAlex 的真实论文元数据。
只能引用输入中存在的标题、年份和 DOI,不得补造文献。

任务:
1. 按感知、操作、导航、本体形态和评测分类;
2. 每个候选方向必须给出支持证据和反证;
3. 将"研究较少"写成待验证假设,不得写成确定事实;
4. 输出适合人工复核的 Markdown 表格。

DATA:
{json.dumps(openalex_records, ensure_ascii=False)}
"""

如果使用 CanguoAI 提供的兼容接口,应从控制台读取实际 API 根地址、密钥和模型名,不要在公开代码中写入密钥。

9. 完整复现

项目文件包括:

data_contract.md   数据来源与解释边界
study.py           抓取、统计、验证和绘图
raw/*.json         每次 OpenAlex 原始响应
data.json          结构化文献地图
results.json       带时间戳的实测结果
figures/           PNG、PDF、SVG 图表

运行:

cd output/experiment-suite/embodied-intelligence-landscape/latest
python -m pip install -r requirements.txt
python study.py

脚本会验证年度数量之和是否等于 292,并保存全部候选维度查询结果。OpenAlex 是持续更新的数据库,未来重跑时数字可能变化,因此发布文章时应保留本次 raw/ 快照。

10. 总结

本次真实数据分析显示,标题采用 "embodied intelligence" 表述的 292 条 OpenAlex 记录中,83.22% 集中在 2024-2025 年,但它有一条可追溯到 2020 年的历史尾巴。领域主题高度分散——多模态学习、模块化机器人、软体机器人、强化学习、人机交互和认知科学并存,远不是"大模型 + 机器人"一句话能概括的

更重要的是,我们没有把 generalization、reproducibility 的"0 匹配"直接写成"研究空白",而是把它转换成"术语是否分裂""评测能否统一"等待验证的候选问题。

这正是 Open Science + CanguoAI 组合更适合科研的使用方式:

Open Science 管证据和复现,CanguoAI 管语言理解与模型访问,研究者对检索边界、实验设计和最终结论负责。

CanguoAI:https://canguoai.com/

利益关系说明:本文作者与 CanguoAI 项目有关联。文中的论文数量、主题、国家和 DOI 来自 OpenAlex 公开数据,不是产品内部统计;本文也没有进行 CanguoAI 与其他模型服务的效果对照实验。

参考文献

[1] Pfeifer R, et al. A concise guide to modelling the physics of embodied intelligence in soft robotics. Nature Reviews Physics, 2022. DOI: 10.1038/s42254-022-00481-z.
[2] Li X, et al. Embodied intelligence in manufacturing: leveraging large language models for autonomous manufacturing. Journal of Intelligent Manufacturing, 2024. DOI: 10.1007/s10845-023-02294-y.
[3] Embodied Intelligence: A Synergy of Morphology, Action, Perception and Learning. ACM Computing Surveys, 2025. DOI: 10.1145/3717059.
[4] Embodied Intelligence Toward Future Smart Manufacturing in the Era of AI Foundation Models. IEEE/ASME T-MECH, 2024. DOI: 10.1109/tmech.2024.3456250.
[5] Exploring Embodied Intelligence in Soft Robotics: A Review. Biomimetics, 2024. DOI: 10.3390/biomimetics9040248.

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐