AI Agent 已经能调用数据库、搜索服务和代码工具,但一旦动作对象从“数字系统”变成机械臂、液体工作站或激光器,接口错误就可能造成真实世界损失。Anthropic 在 2026 年 8 月开放 Model Hardware Standard(MHS)研究预览,尝试用标准驱动、设备描述和安全限制连接 Agent 与可编程设备。本文面向 Agent、机器人和实验室自动化开发者,拆解 MHS 的架构,并给出不依赖具体厂商的安全设计清单。

为什么硬件 Agent 需要新的接口层

传统实验室或工厂集成的难点,不只是每台设备有不同 API。设备能力、单位、校准方式、可达范围、碰撞风险和故障恢复往往散落在纸质手册、工程师电脑和口头经验中。同样一个“设置温度”动作,不同设备可能使用摄氏度、内部刻度或带上下限的控制器;同样一个“移动机械臂”命令,也需要知道负载、坐标系和安全区域。

如果直接让模型阅读每个厂商 SDK 并自由调用,会出现三个问题:

  1. 发现困难:Agent 不知道现场有哪些设备、它们当前是否可用。
  2. 语义不一致:相同意图在不同设备上对应不同接口和单位。
  3. 安全规则分散:速度、温度、压力和空间限制容易只存在于提示词中。

MHS 的目标,是在设备与 Agent 之间放入标准化驱动。驱动把设备操作抽象为少量通用原语,例如读取状态和写入参数;同时提供机器可发现的设备描述,使 Agent 能知道可测量项、可调整项和必须执行的安全限制。

MHS 的四层架构

根据研究预览说明,可以把 MHS 理解为四层:

人类目标与审批

Agent 规划与监督

MCP / CLI / 代码 API

MHS 驱动与设备描述

显微镜

液体工作站

机械臂

传感器/激光器

第一层是人类设定的实验目标、允许动作和审批点。第二层是 Agent,它负责拆解任务、监控状态和在异常时重新规划。第三层提供三种控制方式:Model Context Protocol(MCP)、命令行和代码文件。第四层是 MHS 驱动,它把标准命令翻译为具体设备协议,并把状态统一回传。

这三种控制方式各有角色。MCP 适合让 Agent 发现并调用工具;CLI 便于工程师调试单个动作;代码文件适合执行高频、长时间或需要确定性的步骤。官方案例中,Agent 会先探索调整激光并观察结果,再把学到的过程封装成确定性脚本,以单个命令执行。这个“先推理、后固化”模式比让模型在每个控制周期都临场决策更稳健。

设备描述为什么比 API 更重要

软件 API 通常只告诉调用者参数类型,却不一定表达物理语义。一个安全的硬件描述至少应包含:

  • 设备身份、固件和驱动版本;
  • 可读取的传感量、单位、精度与刷新频率;
  • 可执行动作、参数范围、速度与持续时间;
  • 机械尺寸、负载、坐标系和禁入区域;
  • 前置条件、互锁条件和冲突资源;
  • 错误码、可重试错误与必须人工处理的错误;
  • 紧急停止、复位和安全状态定义。

MHS 预览提到,可用自然语言标签补充重量等无法从代码推断的机器特征,并生成参考文件。实际工程中,自然语言适合承载说明,但硬限制必须落到驱动或独立安全控制器中。比如“温度不要太高”应转化为明确单位和上限,并由设备侧拒绝越界值,而不是期待模型每次都记住。

可以采用“双层描述”:面向 Agent 的自然语言解释负责帮助规划,面向执行器的结构化模式负责验证类型、单位、范围和状态机。两层不一致时,以更严格的机器约束为准并触发告警。

从液体工作站案例看闭环控制

Genentech 的概念验证把液体工作站、机械臂和酶标仪连接起来,用于 BCA 蛋白测定。案例显示,通用模型一开始对水和黏稠蛋白样品使用相同流速,产生气泡并降低转移精度;在得到物理原因提示后,Agent 改变流速和操作方式,并把经验沉淀为可复用技能。

这说明闭环硬件 Agent 的基本流程不是“一次生成完整脚本”,而是:

  1. 读取设备状态和实验约束;
  2. 选择安全范围内的小步动作;
  3. 执行动作并采集传感结果;
  4. 与专家基准或目标函数比较;
  5. 在允许范围内调整参数;
  6. 达到收敛、预算或安全阈值后停止;
  7. 将稳定过程固化成经过审核的确定性脚本。

案例也揭示模型的局限:错误码背后可能是气泡、摩擦、热惯性等现实因素。模型擅长语言和一般推理,却未必拥有现场物理直觉。系统应该把“连续相同错误”“传感器矛盾”“无法解释的状态变化”设为人工接管条件,而不是无限重试。

与 MCP 的关系:连接协议不是安全认证

MHS 表示任何 Agent 框架可以通过 MCP 等标准协议访问设备。MCP 解决的是主机、客户端与服务器之间如何发现能力、协商功能和交换上下文;MHS 进一步描述设备和动作。两者组合能降低集成成本,但协议可连接不代表动作天然安全。

在远程 MCP 场景中,仍要做资源级授权、Token 受众校验、最小权限和用户同意。设备工具的权限最好按风险拆分:读取状态与执行运动不应共享同一范围;低速点动与全速运行应使用不同能力;紧急停止可以高优先级开放,但复位必须检查现场。

不要把上游第三方 Token 原样透传给设备服务。每个 MHS 驱动应验证调用者、设备身份和授权范围,并记录不可抵赖的审计事件。网络中断时,设备应进入预先定义的安全状态,而不是等待 Agent 恢复连接。

一套最小安全控制面

准备试验 MHS 类架构时,可以把安全控制分成六层:

层次核心控制失败时行为
目标层明确任务范围、样品和最大预算拒绝范围外目标
权限层人、Agent、设备最小权限令牌失效即停止新动作
驱动层类型、单位、范围、互锁校验返回结构化错误
设备层独立急停、限位和安全 PLC进入硬件安全态
监控层传感器、视频、心跳与异常检测暂停并通知人工
审计层计划、命令、状态、版本和审批记录支持回放与复盘

高风险动作还需要“双通道确认”:Agent 给出计划和参数,人类确认后,独立安全控制器再次验证当前状态。任何一层都不应依赖模型的自然语言承诺作为唯一保护。

当前阶段适合做什么

MHS 目前是受限研究预览,官方页面明确表示正在邀请科学和工业伙伴测试,并计划在形成安全评测和最佳实践后再开源。因此,开发者不应把预览案例理解为可直接采购部署的成熟通用标准。

现在最有价值的准备工作是整理设备清单、单位和状态机,统一错误语义,划分只读与写权限,建立数字孪生或模拟器,并把审批、急停和审计要求写成验收测试。这样即使最终采用不同标准,核心安全资产仍可复用。

建议从低风险、可回放任务开始,例如读取传感器、生成维护建议或在仿真环境中调度。通过影子模式验证 Agent 的计划与现场工程师是否一致,再进入隔离实验台的小范围写操作。实体世界的自动化收益很大,但安全边界必须比数字工具更硬、更靠近设备。

参考资料

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐