知识图谱存在 Scaling Law 吗?箱熵启动 120 天自主进化实验
从 Agent 规模化构建走向持续演化,探索结构化知识能否成为大模型的“长期决策基础设施”
一、引言:从构建到演化
在箱熵(Entropy Box)的英文 Skill 被合并进 Agentic Awesome Skills、中文 Skill 被合并进 Trae 社区技能库之后,项目团队正式启动第二阶段工作:让一个由 Agent 构建的具身智能知识图谱,进入连续 120 天的自主演化实验。
这次实验想回答的并不只是“图谱还能增加多少节点”,而是一个更基础的问题:
知识图谱是否也存在某种 Scaling Law?当结构化知识的规模、连接密度、证据质量和新鲜度持续增长时,大模型解决复杂工程问题的能力与成本,是否会出现可预测的变化?
二、从模型的 Scaling Law,到知识基础设施的 Scaling Law
Scaling Law 已经深刻影响大模型的发展。已有研究观察到,语言模型的损失会随模型规模、数据规模和计算量呈现相对稳定的幂律变化;随后,计算最优研究进一步说明,参数规模与训练数据必须协调增长。图学习领域也开始探索类似规律:一项面向图神经网络与图 Transformer 的研究发现,图数据规模不能只用“图的数量”衡量,节点数、边数和结构本身同样重要。
但箱熵提出的问题与“把图模型做得更大”并不相同。
箱熵不是在训练一个更大的 GNN,而是在构建一种供大模型调用的、持续更新的结构化知识基础设施。它把论文、开源代码、模型、数据集、仿真器、技术文档和工程经验,编译成主题、任务链、能力、资产、依赖关系与证据。大模型不必在每次任务中从零搜索并重新推导全部技术结构,而可以查询已经积累的工程拓扑,再结合当前需求完成判断。
因此,我们真正要检验的不是“节点越多是否越聪明”,而是:
- 在固定大模型和固定任务集下,经过验证的主题、能力和资产增加后,技术问题覆盖率是否稳定提高;
- 依赖关系更加完整后,方案遗漏前置条件的比例是否下降;
- 相同能力在不同任务中被复用后,是否能减少重复检索、重复推导和上下文消耗;
- 当知识持续更新时,方案对过期 API、失效仓库和陈旧基准的依赖是否下降;
- 当图谱跨越某个连接密度或跨领域桥接阈值时,是否会出现非线性的能力增益;
- 图谱变大之后,噪声、冲突和错误关系会不会反过来损害检索与决策。
这里的规模不是单一的节点数量,而是一个由有效节点、有效边、证据密度、去重质量、知识新鲜度和任务覆盖率共同构成的变量。
三、v1:证明 Agent 可以构建大规模具身智能知识拓扑
箱熵第一阶段是一项由多 Agent 驱动的知识编译工程。系统将具身智能领域拆解为 15 个核心方向,并持续编译出 2,511 个垂直主题、约 37,700 项能力、7,900 余条工程任务链,以及能力、资产和任务之间的大规模依赖关系。
v1 证明了一件事:Agent 不仅可以回答问题,也可以在确定性门禁、类型约束、去重规则和拓扑校验的约束下,长期生产可复用的结构化知识。
但 v1 仍然更接近一次大规模的“冷启动构建”。当新的论文、算法和代码仓库出现时,图谱不会天然知道哪里需要更新;当旧资产失效时,它也不会自动完成诊断、替换和回归验证。
四、v2:从建筑工,变成图谱的代谢与免疫系统
在第二阶段,Agent 的角色将从一次性“建筑工”转变为图谱的持续代谢与免疫系统。
1. 前沿感知
系统持续发现新的论文、代码库、模型、基准和工程变化,并判断它们是否代表新的主题、能力、资产或已有技术路线的版本演进。
2. 知识衰减诊断
系统定期检查失效链接、归档仓库、过期接口、陈旧性能结论、缺失证据和长期未维护的主题。需要更新的内容进入候选队列,而不是直接覆盖现有知识。
3. 受门禁保护的自愈
Agent 可以提出新增、替换、拆分、合并和关系修复建议,但所有写入仍需经过类型约束、标识符一致性、依赖闭合、DAG 无环性、证据完整性和回归检查。所谓“自主进化”不是让模型任意改写图谱,而是在可审计、可回滚的边界内持续生成并验证补丁。
4. 按需挂载
社区提交一篇论文、一个开源库或一项工程能力后,系统尝试判断它应该进入哪个主题、属于哪条任务链、实现哪些能力、与哪些资产和依赖发生关系。无法可靠判断的内容会被标记为待审计候选,而不是被强行接入。
五、120 天实验:我们准备测量什么?
箱熵不会预设“图谱必然存在 Scaling Law”这一结论。接下来的 120 天将保留连续快照,并在固定模型、固定提示和固定评测任务下重复测试。
实验重点包括:
- 覆盖增长:不同规模快照能够回答多少此前无法覆盖的具身智能问题;
- 结构闭合:生成方案对前置能力、接口和依赖的覆盖程度;
- 证据质量:关键技术判断能否追溯到论文、文档、仓库或基准;
- 知识新鲜度:过期资产和失效接口在结果中的出现率;
- 复用与摊销:同一能力被多少主题和任务链复用,新增知识是否减少重复编译;
- 决策成本:完成同一任务所需的检索次数、模型上下文、生成 Token、时间与计算资源;
- 边际收益:图谱继续增长时,效果是持续改善、逐渐饱和,还是在跨领域连接形成后出现阶段性跃迁;
- 负向扩展:低质量节点、错误边和重复实体是否导致性能退化。
图谱检索与 RAG 也不是非此即彼。RAG 擅长从文档中召回相关片段;图谱则尝试保留任务顺序、能力依赖、资产绑定和证据关系。二者如何组合、在什么问题上值得付出额外结构化成本,也属于这次实验要回答的内容。
如果结构化知识确实能够减少大模型反复搜索和重复推导,它可能进一步降低推理成本与能源消耗。但在完成可重复测量之前,箱熵不会把“节能”或“减碳”写成已经实现的结果。
六、为什么这件事值得做?
人类拥有 Google、学术搜索和专业数据库。大模型同样需要搜索,但它需要的不只是网页列表和文本片段,还需要知道:一个目标应被拆成哪些步骤,每一步需要什么能力,能力由什么资产实现,前置依赖是什么,哪些结论已有证据,哪些部分仍然是空白。
如果这种结构能够持续积累、校验和复用,它可能成为大模型面对复杂专业世界时的一种长期外部记忆和决策底座。
箱熵所探索的不是“10 亿节点自动产生超级智能”,而是一个更克制的问题:
当知识的规模与结构质量共同增长时,机器解决专业问题的能力是否会呈现可预测、可复现、可优化的增长规律?
七、邀请社区共同定义实验
箱熵向机器人、具身智能、图学习、知识图谱和 Agent 研究者开放四类参与方式:
- 提交希望补齐的技术盲区或真实工程问题;
- 推荐新的论文、开源代码、模型、数据集和基准;
- 指出存量任务链中的错误依赖、过期结论和缺失约束;
- 提交可重复的测试问题,帮助我们判断图谱增长究竟带来了真实能力,还是只增加了规模。

项目入口
GitHub
https://github.com/chenli-yy/entropy-box-public
Skill 合并记录
- English Skill merged into Agentic Awesome Skills:https://github.com/sickn33/agentic-awesome-skills/pull/1331
- 中文 Skill merged into Trae 社区技能库:https://github.com/trae-community/trae-skills/pull/25
八、研究背景
- Kaplan et al., Scaling Laws for Neural Language Models:[2001.08361] Scaling Laws for Neural Language Models
- Hoffmann et al., Training Compute-Optimal Large Language Models:[2203.15556] Training Compute-Optimal Large Language Models
- Liu et al., Towards Neural Scaling Laws on Graphs:[2402.02054] Towards Neural Scaling Laws on Graphs
Compile Once, Evolve Continuously.
让知识不是被一次性生成,而是在证据、结构和现实世界的约束下持续生长。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)