具身智能真的是“大模型 + 机器人“吗?我用 Open Science + CanguoAI 给 292 篇 Embodied Intelligence 研究画了一张文献地图
本文演示一套可复现的"文献地图 -> 代表论文 -> 候选空白 -> 研究问题"流程。CanguoAI 用于模型访问和结构化阅读,不负责生成论文数量、DOI 或研究结论。
1. 具身智能很火,但"火在哪"很少有人说清
2024 年以来,"具身智能"(Embodied Intelligence)几乎成了 AI 圈最热的词之一。很多介绍会告诉你:具身智能 = 大模型 + 机器人本体,让 AI 从"会说"走向"会做"。
这个说法没错,但太粗。如果你打算写一篇具身智能的综述或开题报告,光有这句话是不够的。你需要回答:
- 这个领域到底有多少论文?增长有多快?
- 它主要发表在哪些子方向——是强化学习、软体机器人,还是人机交互?
- 哪些国家和机构在主导?
- 操作、导航、仿真、多模态、泛化这些关键能力,在标题里被讨论得多不多?
- 这些数字能不能重跑?
这次我用 具身智能 作为案例,用公开学术数据把这些问题一个个量化出来。方法沿用我之前对 AI for Science、RAG、LLM Agent 的同一套流程。
2. 研究问题与数据边界
本文回答三个问题:
- 2020-2025 年,标题采用 "embodied intelligence" 表述的研究增长有多快?
- 这些记录主要分布在哪些 OpenAlex 主题和作者机构国家?
- 操作、导航、仿真、基准、强化学习、多模态、语言、泛化、安全、可复现性等维度,在标题中被明确讨论的比例有多高?
主检索式为:
display_name.search:"embodied intelligence"
from_publication_date:2020-01-01
to_publication_date:2025-12-31
这里搜索的是标题,不是全文。因此这项研究测量的是"embodied intelligence"这一术语在标题中的显式采用情况,不能声称覆盖全部具身智能研究——很多相关工作会用 "embodied AI"、"embodied agent"、"vision-language-action" 等其他表述。
"标题没有写 navigation"也不代表论文正文不涉及导航。低频词只能用于筛选值得进一步系统综述的方向,不能直接证明研究空白存在。
3. 用 OpenAlex API 建立文献地图
获取年度数量的核心代码如下:
import json, urllib.parse, urllib.request
params = {
"filter": 'display_name.search:"embodied intelligence",'
"from_publication_date:2020-01-01,to_publication_date:2025-12-31",
"group_by": "publication_year",
"per-page": 200,
}
url = "https://api.openalex.org/works?" + urllib.parse.urlencode(params)
req = urllib.request.Request(url, headers={"User-Agent": "OpenScience-CSDN-embodied-review/1.0"})
with urllib.request.urlopen(req, timeout=60) as resp:
result = json.load(resp)
for row in sorted(result["group_by"], key=lambda x: int(x["key"])):
print(row["key"], row["count"])
本次快照得到 292 条标题匹配记录:
| 年份 | 匹配记录数 |
|---|---|
| 2020 | 7 |
| 2021 | 13 |
| 2022 | 13 |
| 2023 | 16 |
| 2024 | 49 |
| 2025 | 194 |

这组数据有三个明显特征:
- 2025 年的 194 条占全部记录的 66.44%。
- 2024 与 2025 两年合计占 83.22%。
- 2025 年比 2024 年增加 295.92%,是 2023 年的 12.1 倍。
和 RAG、LLM Agent 那种"几乎从零爆发"不同,具身智能有一条更长的历史尾巴——早在 2020 年就有稳定的一批论文(每年 7-16 篇)。这说明它不是纯粹由大模型带火的新词,而是一个有机器人学根基、又被大模型二次点燃的领域。
4. 主题分布:具身智能远不止"大模型 + 机器人"
OpenAlex primary topic 的前几项,恰好回应了开头的疑问:
| 主题 | 记录数 |
|---|---|
| Multimodal Machine Learning Applications | 14 |
| Modular Robots and Swarm Intelligence | 14 |
| Embodied and Extended Cognition | 12 |
| Reinforcement Learning in Robotics | 11 |
| Robot Manipulation and Learning | 11 |
| Social Robot Interaction and HRI | 11 |
| Soft Robotics and Applications | 9 |
| Digital Transformation in Industry | 8 |
| Robotics and Automated Systems | 8 |
| Psychiatry, Mental Health, Neuroscience | 8 |

这张图给出了一个很有价值的信号:具身智能的主题分布非常分散,没有任何单一主题占主导。 排第一的多模态机器学习也只有 14 篇。它横跨了:
- 多模态学习(感知-语言-动作);
- 模块化机器人与群体智能;
- 具身与延展认知(认知科学根基);
- 强化学习、机器人操作;
- 社交机器人与人机交互;
- 软体机器人(这是很多"大模型 + 机器人"叙事忽略的方向)。
所以,如果你写综述时只按"VLA 模型 + 仿真环境"组织章节,会漏掉软体机器人、群体智能和认知科学这几条重要脉络。
作者机构国家方面,中国以 106 篇遥遥领先,其后是英国(30)、美国(29)、中国香港(13)、德国(10)等。注意国际合作论文会被同时计入多个国家,数字之间存在重叠。
5. 代表论文告诉我们:主线已经发展到哪一步?

为了避免只看数量,我同时提取了匹配记录中被引次数较高的论文。以下引用和 DOI 来自本次 OpenAlex 快照:
- A concise guide to modelling the physics of embodied intelligence in soft robotics,Nature Reviews Physics 2022,DOI:
10.1038/s42254-022-00481-z。 - Embodied intelligence in manufacturing: leveraging large language models for autonomous ...,2024,DOI:
10.1007/s10845-023-02294-y。 - Magnetic Printing of Liquid Metal for Perceptive Soft Actuators with Embodied Intelligence,ACS AMI 2021,DOI:
10.1021/acsami.0c20418。 - Human-in-the-Loop Embodied Intelligence With Interactive Simulation Environment for Surgical ...,RA-L 2023,DOI:
10.1109/lra.2023.3284380。 - Embodied Intelligence: A Synergy of Morphology, Action, Perception and Learning,2025,DOI:
10.1145/3717059。 - Embodied Intelligence Toward Future Smart Manufacturing in the Era of AI Foundation Models,T-MECH 2024,DOI:
10.1109/tmech.2024.3456250。 - Exploring Embodied Intelligence in Soft Robotics: A Review,Biomimetics 2024,DOI:
10.3390/biomimetics9040248。
从这些代表工作可以看出,具身智能的主线覆盖了:
- 软体机器人的物理建模;
- 智能制造与大模型结合;
- 感知型软体驱动器;
- 手术等高风险场景的人在回路;
- 形态-动作-感知-学习的统一框架。
值得注意:被引最高的几篇里,软体机器人和智能制造占了很大比重,而不是大家默认的"VLA 大模型"。这再次说明,具身智能的学术重心和媒体叙事之间存在明显差异。
6. 用同一检索口径筛选候选研究方向
我对主检索集合叠加第二个标题词,量化每个方向在标题中的显式覆盖率:
terms = ["manipulation", "navigation", "simulation", "benchmark",
"reinforcement", "multimodal", "language", "generalization",
"safety", "reproducibility"]
for term in terms:
filters = ('display_name.search:"embodied intelligence",'
f"display_name.search:{term},"
"from_publication_date:2020-01-01,to_publication_date:2025-12-31")
# 请求 OpenAlex,读取 meta.count
实测结果:
| 标题维度 | 记录数 | 占 292 条比例 |
|---|---|---|
| language | 15 | 5.14% |
| multimodal | 14 | 4.79% |
| manipulation | 5 | 1.71% |
| simulation | 3 | 1.03% |
| reinforcement | 3 | 1.03% |
| safety | 3 | 1.03% |
| navigation | 2 | 0.68% |
| benchmark | 1 | 0.34% |
| generalization | 0 | 0.00% |
| reproducibility | 0 | 0.00% |

再次强调:这些比例不是"领域真实研究占比",因为论文可能在正文讨论相关问题但标题没有对应词。它们只用于决定下一轮应该精读和人工标注什么。
7. 从低覆盖词到 4 个可检验选题
方向一:泛化能力在标题层面几乎缺席
generalization 的标题匹配为 0。这不代表没人研究泛化——恰恰相反,泛化几乎是所有具身智能论文的隐含目标,只是很少写进标题。更准确的解读是:"泛化"作为一个被显式命名、可对比的评测维度,尚未在这个术语社区形成统一表述。 可检验问题:
现有具身智能工作在"跨物体、跨场景、跨本体"三类泛化上,是否使用了可比的定义和指标?能否建立一个统一的泛化评测协议?
方向二:基准与可复现性双双偏低
benchmark 仅 1 条,reproducibility 为 0。具身智能的结果高度依赖仿真环境、机器人本体、传感器和随机种子,复现难度远高于纯软件任务。可检验问题:
当只更换仿真器或只更换机器人本体时,具身智能任务的成功率排名是否稳定?论文是否披露了足够的硬件与环境配置?
这类研究不一定要提新模型,也可以建立具身智能配置披露清单和跨平台基准。
方向三:操作与导航的标题覆盖低于预期
manipulation(5 条)和 navigation(2 条)是具身智能的两大经典任务,但标题显式覆盖偏低。这更可能是"术语分裂"——很多操作/导航工作用的是 "embodied AI" 或 "VLA" 而非 "embodied intelligence"。可检验问题:
不同术语社区(embodied intelligence vs embodied AI vs VLA)在操作与导航任务上的方法和评测是否已经割裂?能否做一次跨术语的统一综述?
方向四:软体机器人这条被低估的主线
从代表作看,软体机器人在高被引论文里占比很高,但在媒体叙事里几乎缺席。可检验问题:
软体机器人的"形态即计算"思路,与大模型驱动的具身智能,在可控性、可复现性和任务泛化上各有什么优劣?
这是一个天然适合交叉综述的空白。

8. CanguoAI 在文献综述里怎么用才稳妥
在这套流程中,Open Science 负责保存检索式、原始响应、统计代码、图表和研究记录;CanguoAI 作为模型访问层,用于执行需要语言理解的任务:
- 把论文按"感知、操作、导航、本体、评测"制作结构化卡片;
- 从摘要中抽取仿真环境、机器人平台、指标和限制;
- 对多篇论文的实验设置做横向比较;
- 将候选方向改写成可证伪假设;
- 生成综述初稿并检查数字是否与
results.json一致。
建议把真实元数据随提示词一起发送,并禁止模型补造:
prompt = f"""
下面是来自 OpenAlex 的真实论文元数据。
只能引用输入中存在的标题、年份和 DOI,不得补造文献。
任务:
1. 按感知、操作、导航、本体形态和评测分类;
2. 每个候选方向必须给出支持证据和反证;
3. 将"研究较少"写成待验证假设,不得写成确定事实;
4. 输出适合人工复核的 Markdown 表格。
DATA:
{json.dumps(openalex_records, ensure_ascii=False)}
"""
如果使用 CanguoAI 提供的兼容接口,应从控制台读取实际 API 根地址、密钥和模型名,不要在公开代码中写入密钥。
9. 完整复现
项目文件包括:
data_contract.md 数据来源与解释边界
study.py 抓取、统计、验证和绘图
raw/*.json 每次 OpenAlex 原始响应
data.json 结构化文献地图
results.json 带时间戳的实测结果
figures/ PNG、PDF、SVG 图表
运行:
cd output/experiment-suite/embodied-intelligence-landscape/latest
python -m pip install -r requirements.txt
python study.py
脚本会验证年度数量之和是否等于 292,并保存全部候选维度查询结果。OpenAlex 是持续更新的数据库,未来重跑时数字可能变化,因此发布文章时应保留本次 raw/ 快照。
10. 总结
本次真实数据分析显示,标题采用 "embodied intelligence" 表述的 292 条 OpenAlex 记录中,83.22% 集中在 2024-2025 年,但它有一条可追溯到 2020 年的历史尾巴。领域主题高度分散——多模态学习、模块化机器人、软体机器人、强化学习、人机交互和认知科学并存,远不是"大模型 + 机器人"一句话能概括的。
更重要的是,我们没有把 generalization、reproducibility 的"0 匹配"直接写成"研究空白",而是把它转换成"术语是否分裂""评测能否统一"等待验证的候选问题。
这正是 Open Science + CanguoAI 组合更适合科研的使用方式:
Open Science 管证据和复现,CanguoAI 管语言理解与模型访问,研究者对检索边界、实验设计和最终结论负责。
CanguoAI:https://canguoai.com/

利益关系说明:本文作者与 CanguoAI 项目有关联。文中的论文数量、主题、国家和 DOI 来自 OpenAlex 公开数据,不是产品内部统计;本文也没有进行 CanguoAI 与其他模型服务的效果对照实验。
参考文献
[1] Pfeifer R, et al. A concise guide to modelling the physics of embodied intelligence in soft robotics. Nature Reviews Physics, 2022. DOI: 10.1038/s42254-022-00481-z.
[2] Li X, et al. Embodied intelligence in manufacturing: leveraging large language models for autonomous manufacturing. Journal of Intelligent Manufacturing, 2024. DOI: 10.1007/s10845-023-02294-y.
[3] Embodied Intelligence: A Synergy of Morphology, Action, Perception and Learning. ACM Computing Surveys, 2025. DOI: 10.1145/3717059.
[4] Embodied Intelligence Toward Future Smart Manufacturing in the Era of AI Foundation Models. IEEE/ASME T-MECH, 2024. DOI: 10.1109/tmech.2024.3456250.
[5] Exploring Embodied Intelligence in Soft Robotics: A Review. Biomimetics, 2024. DOI: 10.3390/biomimetics9040248.
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)