具身智能的真正瓶颈不是模型,是知识组织:Entropy Box 开源解读
Entropy Box(箱熵)是一个面向具身智能的"知识编译器":一次性摄入论文、开源仓库、ROS 包、模型库等非结构化知识,输出一份持久的、带类型的、去重过的、机器可消费的知识图——相当于给 AI 画一张"总工程师的图纸"。项目已开源,包含论文、开放数据、可复现的测量脚本和在线演示系统。
一、引言:瓶颈不是模型能力,而是知识组织
过去几年,具身智能(Embodied Intelligence)最大的进步发生在模型端:更强的视觉模型、更强的策略学习、更大的数据集。但当我们真正想把一个机器人派去干一件实事时,卡住的往往不是"它会不会写控制器",而是它知不知道整件事该怎么组织。
机器人需要的知识其实已经存在——散落在数万篇论文、GitHub 仓库、ROS 包、模型中心、Benchmark 套件和工程博客里。问题是:它以"散文"(prose)的形式存在,而不是"结构"(structure)的形式。
一个语言模型可以检索到一段关于逆运动学的论文段落;但如果你问它"逆运动学有哪几种不同的工程范式、各自的输入输出和失效模式是什么、分别有哪些开源实现、哪个问题必须最先解决",它无法给出另一个程序可以直接消费的结构化答案。每次查询,模型都要从头推导一遍这个结构;对话一结束,推导就随之丢弃。
这就是 Entropy Box 想解决的问题。
二、核心洞察:一个任务背后,藏着十几个技术步骤
README 里有个很形象的比喻:
模型是一个掌握了所有零件的工匠,但从未拿到过总工程师的图纸。
当你说"让机器人抓取这个杯子"时,背后是感知、标定、逆运动学、轨迹规划、碰撞检测、力控、抓取规划……一长串技术步骤,以及它们之间纠缠的依赖关系。模型可以按指令写出其中某一个模块(检测器、控制器),但它无法编排整条工作流——因为它从来没有一份描述"先后顺序和依赖关系"的图纸。
Entropy Box 的定位就是这份图纸:把非结构化来源一次性编译成持久、带类型、去重、机器可消费的知识产物,让它能持续改进、无限复用。
| 对比维度 | 查询时推导(Query-time Derivation) | 知识编译(Knowledge Compilation) |
|---|---|---|
| 分析发生的地点 | 请求内部 | 请求之前 |
| 产出 | 散文 | 带类型的图 |
| 回答之后 | 结构被丢弃 | 结构持久化 |
| 全局身份 | 无 | 注册表、去重 |
| 谁能消费 | 一个读者 | 一个程序 |
可度量的直接后果是摊还(amortization):每个编译单元被消费的平均次数目前约为 1.6,而且随着覆盖率上升仍在上升、并未饱和——为一个主题铸造的能力,可供之后编译的所有主题复用。覆盖越广,这份图纸越划算。
三、架构:三级分类法 × 三阶段多智能体 × 五阶段三闸门
Entropy Box 的编译过程有一个精心设计的骨架:
- 三级分类法:15 个顶层领域(top-level domains)→ 416 个子领域(sub-domains)→ 2,511 个叶子主题(leaf topics)。
- 每个叶子主题在单笔事务中编译成三类产物:带类型的任务链(task chains)、能力(capabilities)和资产(assets)。
- 三阶段多智能体架构负责执行编译,外部由**准入门控(admission gates)**把关。
- 构建流程划分为五个阶段、三道闸门,详见仓库的
how-it-works/目录——里面还公开了某个主题真实的研究文档、检索台账(retrieval ledgers)和负结果表(negative-results tables)。
为什么要公开"负结果表"?因为一份只报告检索成功的记录,和一份伪造的记录是无法区分的。记录"什么被找到又被拒绝了"的部分,才是整个证据链里承重的那块砖。
当前编译规模(持续增长中,以仓库 data/measurements.json 为准):
- 能力约 25,000 个,资产约 6,000 个;
- 由约 100,000 条带类型边(typed edges)连接;
- 能力网络已编译出 24,915 个节点、50,407 条边。
两个读数的注意点:
- 能力数量取决于你怎么数:注册表实体数和按主题的记录条目数是两个不同的量,它们的比值就是"去重"的效果——两者都会如实报告。
- 覆盖率是进度读数,不是天花板:目前分类树大约还有三分之一尚未编译。
四、关键设计:依赖网络是"推导"出来的,不是手写的
这是整个项目最值得停下来想一秒的地方:
50,407 条能力依赖边,不是人手工写的,也不是模型推断的。
每条任务链的步骤本身已经携带了"下一个步骤"指针,以及它们所需的能力。遍历这些链、穿透那些不声明能力的纯路由步骤,潜在的排序关系就被显式地"走"出来了。这一遍历还自然产生了 7,089 个跨主题的枢纽能力(hub capabilities)——而这些恰恰是编排器(orchestrator)最需要拿捏准的东西。
这就是整个项目的一般性主张的缩影:把结构编译一次,那些本来需要多步推导才能回答的问题,就变成了图遍历(graph traversal)。
五、两个值得记住的实验结论(包括一个负结果)
开放数据不只是"给你看看",而是给出了可以复核的实验结论。
5.1 负结果:嵌入相似度判不了"重复"
在 1,155 个经过人工裁决的近重复对(near-duplicate pairs)上:
| 路径 | 对数量 | 真重复 | Precision | AUC(95% CI) |
|---|---|---|---|---|
| 嵌入相似度(主路径) | 508 | 35 | 0.069 | 0.629 [0.531, 0.722] |
| 词法相似度(回退路径) | 647 | 4 | 0.006 | 0.454 [0.271, 0.764] |
一旦闸门标记出一对候选,相似度分数根本不足以决定"是否合并"——而单纯提高阈值也救不回来(精度几乎不动,却会丢掉一半真重复)。
结论很硬核:保守的裁决阶段是必需项,不是安全边际。 在当前操作点上,一个"超过相似度阈值就自动合并"的系统,十次里有九次以上是错的。
作者也诚实说明了该数据集的边界:这些配对都是"被标记过"的,因此不能估计闸门整体的判别力;闸门的召回率在此处无法测量。词法那一行只有 4 个正例,不构成一个"发现"。
5.2 正结果:把"来源可解析性"当作一个度量
每个编译主题都引用了它据以组装的研究文档——因为那些文档是文件,引用是机械可查的。当前实测:98.3% 的证据引用可以被解析。
为什么这个度量值得推广?因为它便宜、难以作弊,且直接诊断"证据层"到底是真实的还是装饰性的。生成式知识图谱通常会例行检查结构有效性,但几乎没有人检查来源可解析性。一个报不出这个数字的系统,等于没有证据层。
六、开放数据:可复核,而不是可参观
项目数据以 CC BY 4.0 开源,代码以 MIT 协议开源。核心开放资产:
| 文件 | 内容 |
|---|---|
data/retrieval_golden.json |
126 条查询的机器人工程知识检索评测集,8 类意图,三种断言强度 + 否定断言 |
data/dedup_adjudication_ledger.json |
裁决过的近重复对(含相似度、度量、裁决智能体与书面理由)——同时也是去重检测 benchmark |
data/capability_names.json |
每个能力的中英文规范名与抽象层级 |
data/asset_index.json |
仓库、框架、包、模型、数据集、模拟器、Benchmark、机器人平台索引,含上游来源与别名 |
data/taxonomy.json |
三级编译骨干,双语 |
data/measurements.json |
所有对外报告数字的结构化输出 |
case-study/ |
九个主题完整版:37 条任务链、565 个步骤、283 个带完整描述的能力、143 个资产(每个都带真实仓库 URL)+ 每主题一张任务链图 |
复现测量只需一行命令,无需 GPU、无网络、无运行服务:
python analysis/measure.py --repo /path/to/ontology --json measurements.json
之所以不把全部能力描述按批次分发,作者在文档里说得很直白:包含输入、输出、约束、性能包络的字段,是整个项目的"实体",也是最值得被整段抄走的东西。 九大案例主题里可以完整读到它们——足够你判断这套结构是不是真的。
七、怎么体验和接入
项目"编译产物不是一个静态转储,而是一个运行中的系统,而且它开着":
- 在线演示系统:https://xiangshang.ngrok.app —— 用自然语言输入一个机器人目标,看它被分解为带归属仓库、带明确能力缺口标注的可执行能力链;复杂查询检索(覆盖 24,929 个能力)、一键方案组装、交互式依赖网络都在这里运行。无需注册、无需安装。
- 只读检索接口(对证据语料开放):
curl -X POST "$ENTROPY_BOX_API/api/evidence/search" \
-H "Content-Type: application/json" \
-d '{"query": "obstacle inflation collision check", "top_k": 5, "mode": "hybrid", "rerank": true}'
- 同一接口还封装成了 Agent Skill 声明 和 MCP stdio server,可以直接接入你自己的 Agent。
- 技术笔记有两篇值得单独读:《Embedding similarity cannot decide duplication》(含数据集与脚本)和 《Merge on reasoning, split on artifacts》(从两个失败架构中提炼出的多智能体系统设计规则)。
八、诚实的边界:它不是什么,以及还没做什么
这个项目最难得的,是作者主动交代的"没有做什么":
它不是什么:
- 不是搜索引擎——输出的是带声明接口的带类型实体和它们之间的边,面向程序;
- 不是 RAG 系统——RAG 在查询时推导结构并丢弃;
- 不是向量数据库——向量给你"邻居",不给你"先于"(precedes);
- 不是执行本体——它建模的是工程决策,而非动作语义(与 KnowRob、IEEE 1872 互补);
- 也不是经典知识编译(OBDD / d-DNNF 那套可判定性结论一概不主张,论文里写得很清楚)。
还没做什么(Honest Status):
- 编译仍在进行中,分类树约三分之一未编译;
- 核心对比实验尚未运行:论证了编译的价值并量化了摊还,但还没证明它比强 RAG / GraphRAG 基线给出更好的答案;
- 检索数字尚未发布——评测集和金标集已就绪,但有效运行结果还没有;他们选择"发布套件,而不是发布一个声称";
- 构建成本(单主题耗时、token 消耗)尚未核算;
- 74.1% 的任务链是纯线性的——虽然 schema 支持分支,编译器当前只输出能通过闸门的最简结构。
九、结语:编译一次,复用无数次
Entropy Box 的公开版本是有意部分开源的:把最能承重的材料暂时保留,把能让你判断"结构是否真实"的部分全部开放。 完整能力描述、依赖网络结构、检索金标集、裁决台账、九大案例、测量脚本——这些足以让你复现、验证、甚至反驳。
引用方式(Zotero / BibTeX):
@software{wang_entropy_box_2026,
author = {Wang, Yuqi},
title = {Entropy Box: A Knowledge Compiler for Embodied AI},
year = {2026},
publisher = {Zenodo},
doi = {10.5281/zenodo.21712178},
url = {https://doi.org/10.5281/zenodo.21712178}
}
仓库地址:https://github.com/chenli-yy/entropy-box-public
在线系统:https://xiangshang.ngrok.app
文档镜像:https://chenli-yy.github.io/entropy-box-public/
如果你在做研究、跑 Benchmark 或做集成,缺什么可以直接联系作者(Yuqi Wang)——“我们拒绝的可能性,远低于答应的可能性。” 对一份知识层来说,能被检查,才是基础设施。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)