Entropy Box(箱熵)是一个面向具身智能的"知识编译器":一次性摄入论文、开源仓库、ROS 包、模型库等非结构化知识,输出一份持久的、带类型的、去重过的、机器可消费的知识图——相当于给 AI 画一张"总工程师的图纸"。项目已开源,包含论文、开放数据、可复现的测量脚本和在线演示系统。


一、引言:瓶颈不是模型能力,而是知识组织

过去几年,具身智能(Embodied Intelligence)最大的进步发生在模型端:更强的视觉模型、更强的策略学习、更大的数据集。但当我们真正想把一个机器人派去干一件实事时,卡住的往往不是"它会不会写控制器",而是它知不知道整件事该怎么组织

机器人需要的知识其实已经存在——散落在数万篇论文、GitHub 仓库、ROS 包、模型中心、Benchmark 套件和工程博客里。问题是:它以"散文"(prose)的形式存在,而不是"结构"(structure)的形式。

一个语言模型可以检索到一段关于逆运动学的论文段落;但如果你问它"逆运动学有哪几种不同的工程范式、各自的输入输出和失效模式是什么、分别有哪些开源实现、哪个问题必须最先解决",它无法给出另一个程序可以直接消费的结构化答案。每次查询,模型都要从头推导一遍这个结构;对话一结束,推导就随之丢弃。

这就是 Entropy Box 想解决的问题。


二、核心洞察:一个任务背后,藏着十几个技术步骤

README 里有个很形象的比喻:

模型是一个掌握了所有零件的工匠,但从未拿到过总工程师的图纸。

当你说"让机器人抓取这个杯子"时,背后是感知、标定、逆运动学、轨迹规划、碰撞检测、力控、抓取规划……一长串技术步骤,以及它们之间纠缠的依赖关系。模型可以按指令写出其中某一个模块(检测器、控制器),但它无法编排整条工作流——因为它从来没有一份描述"先后顺序和依赖关系"的图纸。

Entropy Box 的定位就是这份图纸:把非结构化来源一次性编译成持久、带类型、去重、机器可消费的知识产物,让它能持续改进、无限复用。

对比维度 查询时推导(Query-time Derivation) 知识编译(Knowledge Compilation)
分析发生的地点 请求内部 请求之前
产出 散文 带类型的图
回答之后 结构被丢弃 结构持久化
全局身份 注册表、去重
谁能消费 一个读者 一个程序

可度量的直接后果是摊还(amortization):每个编译单元被消费的平均次数目前约为 1.6,而且随着覆盖率上升仍在上升、并未饱和——为一个主题铸造的能力,可供之后编译的所有主题复用。覆盖越广,这份图纸越划算。


三、架构:三级分类法 × 三阶段多智能体 × 五阶段三闸门

Entropy Box 的编译过程有一个精心设计的骨架:

  • 三级分类法:15 个顶层领域(top-level domains)→ 416 个子领域(sub-domains)→ 2,511 个叶子主题(leaf topics)。
  • 每个叶子主题在单笔事务中编译成三类产物:带类型的任务链(task chains)能力(capabilities)资产(assets)
  • 三阶段多智能体架构负责执行编译,外部由**准入门控(admission gates)**把关。
  • 构建流程划分为五个阶段、三道闸门,详见仓库的 how-it-works/ 目录——里面还公开了某个主题真实的研究文档、检索台账(retrieval ledgers)和负结果表(negative-results tables)。

为什么要公开"负结果表"?因为一份只报告检索成功的记录,和一份伪造的记录是无法区分的。记录"什么被找到又被拒绝了"的部分,才是整个证据链里承重的那块砖。

当前编译规模(持续增长中,以仓库 data/measurements.json 为准):

  • 能力约 25,000 个,资产约 6,000 个;
  • 由约 100,000 条带类型边(typed edges)连接;
  • 能力网络已编译出 24,915 个节点、50,407 条边

两个读数的注意点:

  1. 能力数量取决于你怎么数:注册表实体数和按主题的记录条目数是两个不同的量,它们的比值就是"去重"的效果——两者都会如实报告。
  2. 覆盖率是进度读数,不是天花板:目前分类树大约还有三分之一尚未编译。

四、关键设计:依赖网络是"推导"出来的,不是手写的

这是整个项目最值得停下来想一秒的地方:

50,407 条能力依赖边,不是人手工写的,也不是模型推断的

每条任务链的步骤本身已经携带了"下一个步骤"指针,以及它们所需的能力。遍历这些链、穿透那些不声明能力的纯路由步骤,潜在的排序关系就被显式地"走"出来了。这一遍历还自然产生了 7,089 个跨主题的枢纽能力(hub capabilities)——而这些恰恰是编排器(orchestrator)最需要拿捏准的东西。

这就是整个项目的一般性主张的缩影:把结构编译一次,那些本来需要多步推导才能回答的问题,就变成了图遍历(graph traversal)。


五、两个值得记住的实验结论(包括一个负结果)

开放数据不只是"给你看看",而是给出了可以复核的实验结论。

5.1 负结果:嵌入相似度判不了"重复"

在 1,155 个经过人工裁决的近重复对(near-duplicate pairs)上:

路径 对数量 真重复 Precision AUC(95% CI)
嵌入相似度(主路径) 508 35 0.069 0.629 [0.531, 0.722]
词法相似度(回退路径) 647 4 0.006 0.454 [0.271, 0.764]

一旦闸门标记出一对候选,相似度分数根本不足以决定"是否合并"——而单纯提高阈值也救不回来(精度几乎不动,却会丢掉一半真重复)。

结论很硬核:保守的裁决阶段是必需项,不是安全边际。 在当前操作点上,一个"超过相似度阈值就自动合并"的系统,十次里有九次以上是错的。

作者也诚实说明了该数据集的边界:这些配对都是"被标记过"的,因此不能估计闸门整体的判别力;闸门的召回率在此处无法测量。词法那一行只有 4 个正例,不构成一个"发现"。

5.2 正结果:把"来源可解析性"当作一个度量

每个编译主题都引用了它据以组装的研究文档——因为那些文档是文件,引用是机械可查的。当前实测:98.3% 的证据引用可以被解析。

为什么这个度量值得推广?因为它便宜、难以作弊,且直接诊断"证据层"到底是真实的还是装饰性的。生成式知识图谱通常会例行检查结构有效性,但几乎没有人检查来源可解析性。一个报不出这个数字的系统,等于没有证据层。


六、开放数据:可复核,而不是可参观

项目数据以 CC BY 4.0 开源,代码以 MIT 协议开源。核心开放资产:

文件 内容
data/retrieval_golden.json 126 条查询的机器人工程知识检索评测集,8 类意图,三种断言强度 + 否定断言
data/dedup_adjudication_ledger.json 裁决过的近重复对(含相似度、度量、裁决智能体与书面理由)——同时也是去重检测 benchmark
data/capability_names.json 每个能力的中英文规范名与抽象层级
data/asset_index.json 仓库、框架、包、模型、数据集、模拟器、Benchmark、机器人平台索引,含上游来源与别名
data/taxonomy.json 三级编译骨干,双语
data/measurements.json 所有对外报告数字的结构化输出
case-study/ 九个主题完整版:37 条任务链、565 个步骤、283 个带完整描述的能力、143 个资产(每个都带真实仓库 URL)+ 每主题一张任务链图

复现测量只需一行命令,无需 GPU、无网络、无运行服务:

python analysis/measure.py --repo /path/to/ontology --json measurements.json

之所以不把全部能力描述按批次分发,作者在文档里说得很直白:包含输入、输出、约束、性能包络的字段,是整个项目的"实体",也是最值得被整段抄走的东西。 九大案例主题里可以完整读到它们——足够你判断这套结构是不是真的。


七、怎么体验和接入

项目"编译产物不是一个静态转储,而是一个运行中的系统,而且它开着":

  • 在线演示系统:https://xiangshang.ngrok.app —— 用自然语言输入一个机器人目标,看它被分解为带归属仓库、带明确能力缺口标注的可执行能力链;复杂查询检索(覆盖 24,929 个能力)、一键方案组装、交互式依赖网络都在这里运行。无需注册、无需安装。
  • 只读检索接口(对证据语料开放):
curl -X POST "$ENTROPY_BOX_API/api/evidence/search" \
  -H "Content-Type: application/json" \
  -d '{"query": "obstacle inflation collision check", "top_k": 5, "mode": "hybrid", "rerank": true}'
  • 同一接口还封装成了 Agent Skill 声明MCP stdio server,可以直接接入你自己的 Agent。
  • 技术笔记有两篇值得单独读:《Embedding similarity cannot decide duplication》(含数据集与脚本)和 《Merge on reasoning, split on artifacts》(从两个失败架构中提炼出的多智能体系统设计规则)。

八、诚实的边界:它不是什么,以及还没做什么

这个项目最难得的,是作者主动交代的"没有做什么":

它不是什么:

  • 不是搜索引擎——输出的是带声明接口的带类型实体和它们之间的边,面向程序;
  • 不是 RAG 系统——RAG 在查询时推导结构并丢弃;
  • 不是向量数据库——向量给你"邻居",不给你"先于"(precedes);
  • 不是执行本体——它建模的是工程决策,而非动作语义(与 KnowRob、IEEE 1872 互补);
  • 也不是经典知识编译(OBDD / d-DNNF 那套可判定性结论一概不主张,论文里写得很清楚)。

还没做什么(Honest Status):

  • 编译仍在进行中,分类树约三分之一未编译;
  • 核心对比实验尚未运行:论证了编译的价值并量化了摊还,但还没证明它比强 RAG / GraphRAG 基线给出更好的答案;
  • 检索数字尚未发布——评测集和金标集已就绪,但有效运行结果还没有;他们选择"发布套件,而不是发布一个声称";
  • 构建成本(单主题耗时、token 消耗)尚未核算;
  • 74.1% 的任务链是纯线性的——虽然 schema 支持分支,编译器当前只输出能通过闸门的最简结构。

九、结语:编译一次,复用无数次

Entropy Box 的公开版本是有意部分开源的:把最能承重的材料暂时保留,把能让你判断"结构是否真实"的部分全部开放。 完整能力描述、依赖网络结构、检索金标集、裁决台账、九大案例、测量脚本——这些足以让你复现、验证、甚至反驳。

引用方式(Zotero / BibTeX):

@software{wang_entropy_box_2026,
  author    = {Wang, Yuqi},
  title     = {Entropy Box: A Knowledge Compiler for Embodied AI},
  year      = {2026},
  publisher = {Zenodo},
  doi       = {10.5281/zenodo.21712178},
  url       = {https://doi.org/10.5281/zenodo.21712178}
}

仓库地址:https://github.com/chenli-yy/entropy-box-public
在线系统:https://xiangshang.ngrok.app
文档镜像:https://chenli-yy.github.io/entropy-box-public/

如果你在做研究、跑 Benchmark 或做集成,缺什么可以直接联系作者(Yuqi Wang)——“我们拒绝的可能性,远低于答应的可能性。” 对一份知识层来说,能被检查,才是基础设施。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐