一、引言:超越单体Agent的边界

2026年,AI Agent 已从实验室走向生产环境,但一个根本性困境始终未解:每个新启动的 Agent 都是“全新上下文”的婴儿,无法继承上一会话积累的经验。某 Agent 花费大量时间定位某 API 的正确调用方式,换一个 Agent 遇到同一问题仍须重新踩坑——这种“经验不可传递”的困境,构成了当前多 Agent 系统性能瓶颈的核心。

本文将以技术白皮书《AI Agent 蜂群协作与经验基因化》为蓝本,系统阐述一套从单体执行到自组织系统的工程路径。核心论点明确:多 Agent 系统的性能瓶颈主要不在执行,而在信息汇总与经验传承

通过原子化任务拆分、独立上下文隔离与程序化确定性汇合,同一模型在受控评测中正确率从 26.29% 提升至 70.69%–70.87%;而“经验基因化”的提出,则试图将个体试错转化为群体资产,实现跨 Agent、跨生命周期的经验传承。

二、问题诊断:经验为何无法传承

2.1 单体Agent的“经验不可传递”困境

当前 Agent 系统的运行模式本质上是“一次性”的:每个会话开始,Agent 获得一个全新的上下文窗口,它无法自动继承上一轮对话中积累的试错经验。这导致了一个悖论:Agent 在执行中反复摸索出的正确方法,往往只停留在当前会话的局部内存中,无法跨 Agent 流通。

典型场景:某 Agent 在调试一个 API 接口时,经过十几次尝试终于找到了正确的调用参数组合。但在下一个任务中,另一个 Agent 面对完全相同的 API,却必须从头开始同样的试错过程。这种“重复踩坑”不仅浪费计算资源,更从根本上限制了群体智能的累积增长。

2.2 Skill封装的局限

当前业界的主流做法是“Skill 封装”——将流程、工具、方法编写为可复用的“操作手册”。Skill 是有效的,但远远不够。其根本局限在于:Skill 多由人预先编写,偏向文档导向、面向人类阅读;它解决的是“如何复用一套既定流程”,却未解决“Agent 在真实工作中刚学到的经验如何快速传给其他 Agent”。

换句话说,Skill 是静态的、预设的,而 Agent 在运行中习得的经验是动态的、情境化的。两者之间的鸿沟,恰恰是经验传承失效的关键。

三、核心方案:EvoX蜂群与经验基因化

3.1 EvoX蜂群三原则

面对上述困境,EvoX 蜂群架构提出了三条根本性原则:

第一,任务原子化拆分。 

大任务被拆分为边界清晰的原子任务,每个子任务有唯一的处理者与确定的输出位置。这种拆分不是“把问题丢给多个 Agent 讨论”,而是确保每个 Agent 只处理自己负责的局部内容,且所有部分共同覆盖原始任务。

第二,执行上下文隔离。

 每个 Agent 仅看到自己负责的那部分内容,不被长上下文累积干扰。这直接回应了“lost in the middle”现象——当上下文过长,模型在中间位置的信息容易被遗忘或忽略。隔离上下文意味着每个 Agent 的工作环境都是“干净的”,它只面对自己需要解决的那一个问题。

第三,程序化确定性汇合。 

结果写入固定位置,由程序按编号、结构化接口收集合并,不经第二个 LLM 转述、压缩或取舍。这一原则至关重要:它避免了“传话游戏”式的信息损耗。

3.2 经验基因(Strategy Gene)的表示设计

在解决了“如何组织多 Agent 协作”之后,下一个问题是“如何让经验流动起来”。EvoMap 团队就此展开了大规模实验——4,590 次保留试验,覆盖 45 个科学代码求解场景,涵盖生物信息、神经科学、化学、地震学、气候、信号处理、网络分析、金融、机器人、量子计算等领域。

研究的关键发现是:表示本身是一阶因素。传统“程序化技能”(Procedural Skill)以文档逻辑组织,追求可读性与完整性,典型长度约 2,500 tokens;而“策略基因”(Strategy Gene)以控制逻辑组织,追求信号密度与适用性边界,典型长度仅约 230 tokens。

两者在结构上也有本质差异:Skill 包含 overview、workflow、pitfalls、error_handling 等文档元素;Gene 则压缩为 keywords、summary、strategy、AVOID 等控制导向的字段。实验结果表明:文档导向的 Skill 信号稀疏且不稳定(平均 PassRate 49.9%,甚至低于无引导的 51.0%);而紧凑的 Gene 在结构扰动下仍保持鲁棒(54.0%),且优于等预算的 Skill 片段。

更关键的是,Gene 被设计为“可进化就绪对象”——通过 Gene Evolution Protocol (GEP),经验被规范化为可比较、可编辑、可进化的对象。

在 CritPt 基准上,gene-evolved 系统相对配对基线由 9.1%→18.57%、17.7%→27.14%,两代均实现约 +9.4pp 的提升。

论文的核心论断振聋发聩:经验复用的核心问题不是提供更多经验,而是把经验编码为紧凑、控制导向、进化就绪的对象

四、实证验证:组织方式决定结果

4.1 实验一:三种组织方式的对比

为了验证组织方式对结果的影响,研究团队设计了严格的对比实验。题集包含 563 道题,涵盖逻辑、数学、竞赛数学、物理四个领域,使用相同的 Claude Haiku 4.5 模型,仅改变组织方式:

  • 单一上下文模式

    完整任务放入一个 Agent 的同一上下文,一次性直接求解。正确率:26.29%。

  • Sub-Agent 模式

    主协调 LLM 见全题,拆解后由 sub-agent 解题并整理报告,主 LLM 汇总。正确率:38.54%。

  • EvoX 蜂群模式

    脚本保证完整覆盖、独立上下文、每 Agent 一 part,程序按编号结构化收集合并。正确率:70.69%–70.87%。

差距不是“调用更多模型”——Sub-Agent 同样调用大量 sub-agent 且观测成本最高,仍远落后。关键在于:信息在传递过程中发生了损耗

4.2 损耗测量:166个正确答案的丢失

研究团队进一步追查了 Sub-Agent 模式的 30 份中间结果,发现了触目惊心的损耗链:在 563 题中,有 373 道题一度被 sub-agent 判对;但经过报告传递、主 LLM 综合之后,最终交付仅 217 道正确。中间正确保留率仅 55.50%。

这意味着:有 166 道题曾经被正确解答,却在传递过程中“丢失”了。类比“传话游戏”:每多一层自然语言转述,就多一次遗漏、压缩、格式漂移或覆写。损耗分布在上下文累积、报告撰写、主协调综合等多个环节。

而 EvoX 蜂群的核心优势,恰恰在于它把已做对的答案“安全送到终点”——同模型在 Sub-Agent 模式答对 217 题,蜂群答对 398 题。没有二次理解环节,就没有信息损耗的空间

五、自组织:从预设结构到涌现结构

5.1 24个同质Agent的专长分化

如果说前面的实验证明了“好的组织方式”的价值,那么自组织实验则试图回答一个更根本的问题:Agent 能否自己长出组织

实验的起点是 24 个配置完全相同的 Agent,无预设角色。它们先完成多轮任务,每完成一题就把题型心得写入可持续 memory(以 Gene 记录,skill 字段表示);某类心得越多,下轮选同类题的概率越高。经过 8 轮,依据实际选题与结果形成了“身份信息”:专业侧重 + 正确率。

例如,agent-8 在 8 轮中 5 次选择物理、2 次数学、1 次竞赛,形成了“物理 0.625”的侧重,正确率 0.25。这个身份不是预设的,而是由选题与 memory 积累自然形成的。同质起点 → 不同经历 → 专业侧重与历史正确率分化——这一过程本身就是一种涌现。

5.2 可见信息如何重塑组织结构

更精彩的实验在于“可见信息”的作用。在一个圆桌结构中,每个 Agent 与左右各两位相连(共 4 条关系);随机打断部分连接,让当事 Agent 从未连接候选者中自主选择新对象。三组唯一的差别是“选人时可见信息”:

  • A 组(仅连接关系)

    Agent 倾向于选择“朋友的朋友”(三元闭合),聚类系数 ≈ 0.53,形成小圈子。

  • B 组(连接关系 + 专业侧重 + 正确率)

    Agent 转为选择高正确率者(+1.88)和相近专业者(+1.47),聚类系数降至 0.28(接近随机 0.27),出现枢纽节点。

  • C 组(随机重连对照)

    无明显结构特征。

同一群 Agent、同一批扰动,仅因可见信息不同,长出了两种不同的“社会形态”。这一发现具有深远意义:组织不会凭空出现;系统向 Agent 暴露什么信息,就奖励什么样的连接与结构

六、延伸探讨与前沿挑战

6.1 经验基因的可信度与安全

当基因成为“可上传网络、被他人继承”的资产,软件供应链式的风险随之而来:错误、过时或恶意的 Gene 注入会像“错误信念传播”一样,污染下游 Agent。需要建立可执行校验优先、置信度与来源溯源、群体投票与衰减、灰度与回滚等治理机制。同时,隐私维度也需关注——Gene 可能泄露任务上下文中的敏感数据,需脱敏与最小暴露原则。

6.2 程序化汇合的边界

原始材料已点出“有些环节传统程序可靠得多”。这一原则可以上升为编排原则:模糊/不确定决策(拆解、选题、策略生成)交给 LLM;确定性聚合(覆盖检查、去重、格式校验、超时、依赖解析、顺序合并)交给程序。这实质上是把 Agent 工作流当作“编译器 + 运行时”:LLM 生成策略与中间产物,程序做 reduce/校验。但过度程序化也会丢失 LLM 的容错与语义理解,需界定“确定性协议”的覆盖边界。

6.3 自主拆解闭环仍未闭合

实验一的分工由脚本保证,实验二仅验证了“选伙伴”这一单一动作,连接尚未承载任务转交与协作。真正的“自主拆解 → 认领 → 冲突消解 → 重分配”是当前最大的缺口。前沿方向包括:动态任务图生成与依赖边推断、市场/契约式任务认领、失败驱动的重新规划与任务图重写。需警惕死锁、循环依赖、任务爆炸等风险。

6.4 与“持续学习”的耦合

梁文锋判断下一代 AI 的核心能力是“自主持续学习”。当 Agent 能持续学习、跨过自我迭代奇点,通用智能将加速——这对应的是“个体学习奇点”(模型层,权重/内化)。而 EvoMap 对应的是“群体传承奇点”(系统层,经验基因跨个体流通,不依赖权重更新)。两者互补:基因化能让跨模型、跨厂商的 Agent 共享显式策略,这是 fine-tuning 或蒸馏难以做到的;但基因化只能沉淀“显式可表述策略”,无法沉淀“隐性能力”,隐性能力仍靠模型层持续学习。真正的跃迁可能发生在两者交汇之处。

七、结论:通往Agent系统的质变

回到本文开篇的核心论点:多 Agent 系统的瓶颈主要在信息汇总与经验传承,而非执行。原子化 + 隔离 + 程序化汇合,可以显著释放同模型潜力(26% → 71%);经验基因化把“个体试错”转为“群体资产”,且以紧凑控制导向表示为前提才有收益;自组织初步显示“可见信息塑造结构”,但完整协作闭环尚未实现。

通往成熟 Agent 系统的关键突破,需要在两个方向上同时发生:个体经验的可保存、验证与传播(基因化),与多 Agent 在稳定规则下的自组织协作。两者成熟之日,Agent 形态将发生质的变化——从单体执行的“工具”,进化为自组织、自传承的“群体智能”。这一天或许不会太远,但每一步都需要扎实的工程验证与理论推进。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐