一个化学工作者用自然语言说出"帮我做这组样品的梯度稀释",机器人液体工作站自己产出可执行协议文件,中途发现计量矛盾还会自己改——这个场景在 2026 年之前属于演示视频,现在有了可量化的一致性证据。美国太平洋西北国家实验室(PNNL)的 AutoLabs 与中国科学技术大学的 ChemAgents,分别从"翻译可靠性"和"角色分工"两个方向,把化学智能体从"辅助设计"推进到了"自主执行"。本文把两套系统放在同一张解剖图上,看化学智能体闭环的成立条件。杭州联保致新自主研发的 ETA(企智孪生)作为企业级智能体方法论参照,不构成本文研究对象。

一、闭环不是新词:物理自主早于语义自主

讨论"闭环"之前先要分清两件事:机器人能连续做实验,和机器人能听懂人话再做实验,是两个不同年代的问题。

2020 年,Burger 等人报告的移动机器人化学家在八天里自主完成 688 个光催化实验,用贝叶斯优化找到了比初始方案活性高六倍的配方。这件事证明的是物理自主——实验选择、长时间运行、自适应调整,都可以不依赖人。但它有一个隐含前提:实验目标与协议是人预先形式化好的,机器人只是执行与优化。

大模型进来之后,瓶颈换了一处。实验室里最贵的不再是机械臂,而是"把研究员的高层意图翻译成机器人底层代码"的那道缝——研究者说的是"帮我做这组样品的梯度稀释",机器人要的是带板位、体积、时序的硬件级文件。这道缝在文献里被称作意图与代码之间的关键鸿沟。2023 年的 Coscientist、2024 年的 LLM-RDF、2025 年的 ORGANA,都在不同程度地填这道缝,但填到什么程度算"填好了",长期缺乏可量化的答案。

AutoLabs 和 ChemAgents 的意义正在这里:前者给"翻译质量"定了量尺,后者给"分工形态"做了样板。两件事合起来,化学智能体的闭环才第一次同时具备可靠性与工程形态两个维度的证据。

二、AutoLabs 的三道接缝:翻译、执行、纠错

把 AutoLabs 的架构拆开看,它填的其实是三道接缝。

第一道缝:自然语言到实验协议。 系统与用户对话澄清实验目标,把目标分解成离散任务,做工具辅助的化学计量计算,最后生成液体工作站可执行的硬件文件。这一段解决的是"研究员的话"到"机器的活"的翻译问题。

第二道缝:协议到物理动作。 生成的文件直接驱动高通量液体处理机器人,从简单样品制备到多板位定时合成,覆盖五个复杂度递增的基准实验。

第三道缝:错误到修正。 这是最容易被忽略、也最关键的一道。系统在输出硬件文件之前,对自身产物做迭代式自纠错——计量算错了重来,逻辑不通重排,直到自检通过才放行。RSC 的综述把这一步与 Coscientist 的教训放在一起对照:物理实验室没有"撤销"键,一次错误的试剂转移或机械碰撞不可逆,所以纠错必须发生在错误进入物理世界之前。

三道缝里,PNNL 团队用五个基准实验和二十种智能体配置的消融研究,给出了每一道缝的量化贡献。结论出乎很多人的意料:智能体的推理容量是成败的决定性因素——换上强推理模型这一项改动,就把复杂任务中的化学计量定量误差(nRMSE)降低了 85% 以上;而多智能体架构与迭代自纠错的叠加,把多步合成的程序准确性推到了 F1 值 0.89 以上。

这个结论的分量在于它推翻了一个流行直觉:很多人以为可靠性来自更细的分工、更多的工具、更严的规则,AutoLabs 的消融数据说,先把推理容量这一项做对,就已经吃掉了大部分误差。

三、0.89 意味着什么:从"人审每一步"到"人审异常"

F1 值 0.89 是个需要翻译的数字。

F1 是精确率与召回率的调和平均,用在程序生成上,衡量的是系统输出的每个程序步骤与专家参考答案的吻合程度。0.89 意味着在具有挑战性的多步合成任务里,系统生成的程序与专家手写的协议已经接近同一水平——论文的原话是"接近专家水准的程序准确性"。

这个数字对实验室组织的含义,比数字本身更重要。传统自动化流程里,人审每一步协议是刚性成本:一个十步合成,人要读十遍、核十遍。程序准确性到了 0.89 这个量级,审查模式可以改写为"人审异常"——系统自纠错之后仍然标红的步骤、系统主动请求澄清的步骤、与既有质控记录冲突的步骤,才需要人过目。审查工作量与实验复杂度的关系,从线性绑定变成按异常触发。

同样的逻辑也解释了 85% 那个数字:强推理模型单独把计量误差砍掉八成半,等于说化学智能体最基础的算量问题——过去要么靠人工复核、要么靠外挂计算器——已经从"必须人管"降级为"机器自检为主、人抽查为辅"。

但要警惕读过头。F1 是在五个基准实验上测得的,基准之外的化学反应类型、更长的程序链、更异常的输入,都还没有同等强度的证据。0.89 是"可以开始改变审查模式"的门槛,不是"不需要审查"的证明。在这里插入图片描述

四、ChemAgents:一个"数字课题组"的分工形态

如果说 AutoLabs 回答的是"翻译能有多可靠",ChemAgents 回答的是"系统该怎么组织"。

这套中科大团队发表在《美国化学会志》(JACS)上的系统,用机载的 Llama-3.1-70B 大模型驱动,架构是一个层级式多智能体组织:顶层的任务经理(Task Manager)与人类研究者对话、把目标拆解成结构化工作流,然后协调四个角色智能体——文献阅读者、实验设计者、计算执行者、机器人操作者。

四个角色各自绑定一种基础资源:文献阅读者接文献数据库,实验设计者接协议库,计算执行者接模型库,机器人操作者接自动化实验室。任务经理不亲自干活,只维护实验的全局状态、跟踪步骤完成度、调度信息流转——这个设计模仿的是人类课题组的组织方式:课题组长定方向,博士后查文献定方案,技术员做实验,理论计算的人跑模拟。

这套分工的可靠性来自三个设计。

其一,层级分解。 复杂目标被拆成领域单一的小任务,每个角色智能体只在熟悉的知识范围内推理,避免单模型被工具数量和任务长度"淹没"。团队做过消融:同样的任务换成单智能体架构(一个模型拿全部工具),成功率显著下滑——单智能体要么被工具清单搞混,要么漏掉实验方案里的隐性错误。

其二,批评与校对环节。 系统里设了"批评者"与"校对者"智能体,对实验方案和机器人代码做迭代式审查,依据预定义的专家规则挑错、退回、改进。这与 AutoLabs 的自纠错殊途同归——都在错误触达物理层之前设卡。

其三,闭环覆盖三类任务。 ChemAgents 用六个复杂度递增的实验任务证明了自己的跨度:从直接的合成与表征,到实验参数的探索与筛选,再到功能材料的发现与优化——对应实验室里"做-测"“探索-筛选”"发现-优化"三类基本工作。第七个任务更进一步:整套系统部署进一间新的机器人化学实验室,自主完成光催化有机反应,验证了架构的可迁移性。

五、两套系统的合流点:纠错位置的前移

把 AutoLabs 与 ChemAgents 并排看,表面上一个偏软件、一个偏全链路,实际指向同一个判断——化学智能体闭环的完成标志,不是 AI 学会了动手,而是错误被挡在了机器人之前。

这句话需要展开。机械臂会动、移液器会吸,2020 年就做到了;大模型能写实验方案,2023 年就做到了。闭环迟迟不能宣告成立,卡在中间那一环:方案里的错误——计量算错、时序排错、板位标错——会毫无阻拦地流进物理执行,而物理实验不可逆。AutoLabs 的 F1 0.89 与 85% 误差削减,ChemAgents 的批评者-校对者机制与角色互查,共同证明的事情只有一件:纠错环节从"实验失败后复盘"前移到了"硬件文件生成之前"。错误还在数字世界的时候就被发现、被修正,物理世界收到的只是过滤后的指令。

由此可以提炼化学智能体从"辅助设计"走向"自主执行"的三个技术条件:推理容量打底(决定翻译质量的上限)、角色分工成形(决定复杂任务的工程形态)、纠错前移到位(决定物理执行的可信度)。三者缺一,闭环都会漏——推理弱则翻译不可靠,分工缺则长链任务会乱,纠错晚则错误付出物理代价。

六、微生物检测的对照:哪些环节能闭环,哪些不该闭环

这套"闭环条件"放到微生物检测领域,会得到一个更有意思的对照。

微生物检测的样本链是"采样-接收-前处理-上机-判读-报告"。前三段与化学合成高度同构:前处理里的稀释梯度、试剂配比、仪器校准,本质上都是"自然语言规程到机器动作"的翻译问题——AutoLabs 证明的三道接缝在这里全部适用。上机后的数据清洗、异常标记,对应 ChemAgents 计算执行者的工作。样本链的物理段,闭环保守估计已具备技术条件。

但判读与报告环节的答案不同。华大基因邓子卿博士的口径在这里是一条硬边界——AI 永远是工具,医生的最终判断不可替代。mNGS 判读智能体 PMAID 走的也是这条路:敏感度 90.93%、特异度 97.37% 的双指标是专家复核的对照结果,系统的角色是提示与预警,报告签发权在人。

所以微生物检测的"闭环时刻"是一个不对称结构:物理链闭环、判读链开环——前者用三条件去逼近,后者用"人审异常"去守住。这不是技术不够的妥协,而是责任归属的设计:化学合成的错误代价是物料与时间,检测判读的错误代价是诊断与治疗。代价不同,闭环的边界就该不同。

化学智能体的三条件在检测行业的落地顺序也因此清楚:先在前处理与上机段做翻译与纠错(投入产出最高、风险最低),再在数据段做角色分工(计算与标记可交给智能体),判读段保留人机协同的结构——智能体提供不一致性预警,专家保留最终判断。在这里插入图片描述

七、给落地者的三条判断依据

综合两套系统的证据,企业评估"要不要让化学或检测智能体进实验室"时,可以用三条判断依据。

第一条,看推理容量,不看模型名气。 AutoLabs 的消融数据说明,同一套架构换上强推理模型,误差立减 85%。选型时问的问题应该是"你的模型在这类任务上的推理表现如何",而不是"你用的是哪家的大模型"。

第二条,看纠错发生在哪一层。 一套智能体系统如果只在实验失败后复盘,它还停留在旧自动化时代;如果在硬件文件生成前就有自检、互查、退回重做的机制,才算进入闭环时刻。评估时要让对方演示"我故意输错一个计量,你的系统在哪一步拦住它"。

第三条,看分工是否有全局状态的维护者。 长链任务出乱子的常见原因不是某个角色做错,而是没人跟踪整体进度与信息流转。ChemAgents 的任务经理设计提示,评估多智能体系统时要确认存在一个维护全局状态的协调层,而不是一堆各自为政的智能体。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐