AI News字数 3110阅读时长8 分钟

Anthropic 预览用于 AI 控制实验室与工厂设备的模型硬件标准

Anthropic 的模型硬件标准为 AI 智能体提供了一个通用、注重安全的接口,用于操作科研和制造设备。

Anthropic 已启动模型硬件标准(Model Hardware Standard,简称 MHS)的首个研究预览阶段。这是一项共享规范,旨在让 AI 智能体通过通用、注重安全的接口操作物理设备。

该预览涵盖显微镜、液体处理器、机械臂和量子计算硬件等实验室及先进制造系统。目前访问权限仅限于部分合作伙伴和申请者。Anthropic 表示,计划在利用预览阶段开发安全评估和部署指南后,将 MHS 作为开源项目发布,但尚未公布发布日期或许可证。

这一区别很重要:MHS 尚不是一个普遍可用的开源标准。它是一项由公司主导的研究预览,其技术设计和安全控制措施正在与科研机构、自动化公司和硬件制造商共同测试。

一、MHS 面向智能体与机器之间的集成层

现代实验室和工厂通常包含来自多家供应商的设备,每种设备都有自己的编程接口、数据格式和运行假设。连接这些设备可能需要专家为每台仪器和每个工作流程分别编写集成方案。

Anthropic 表示,这一过程通常需要数周或数月。MHS 试图用标准化驱动程序取代大量此类定制“胶水代码”,该驱动程序负责在软件与各物理设备之间进行转换。

该驱动程序提供一组小型原语,包括读取温度或写入新的温度设置等操作。它还以标准格式描述每台设备,使仪器和智能体能够在网络中相互发现,而无需为每一种配对定制转换器。

MHS 旨在捕捉传统 API 可能遗漏的信息。驱动程序可以包含自然语言标签,描述机械臂重量、可用测量项、可调参数和强制执行的运行限制等属性。MHS 会根据这些标签生成参考文件,供智能体理解机器。

操作人员可以直接提供这些信息,也可以让智能体就硬件设置对其进行访谈。这一机制将原本可能仅存在于纸质手册、本地文件或经验丰富技术人员记忆中的知识,转换为机器可读的描述。

完成连接后,智能体可通过三种机制控制 MHS 设备:模型上下文协议、命令行界面,或代码文件和 API。代码文件对长时间运行或时间敏感的操作尤为重要,因为它们可让设备执行确定性序列,而无需在每个单独动作之前等待模型推理。

Anthropic 将 MHS 描述为与模型无关。已发布的演示使用了 Claude,但该规范旨在让其他智能体运行框架也能通过标准协议访问已连接硬件。

二、早期实验展示了闭环硬件控制

该预览中最有力的证据来自若干合作伙伴实验。这些是早期、针对特定系统的演示,而非经过独立审计的基准测试,但它们展示了通用接口如何支持监控、协调和错误恢复。

在 Genentech,研究人员连接了液体处理器、机械臂和微孔板读板机,以进行双缩脲酸蛋白质测定。Claude 最初对水和黏稠的牛血清白蛋白溶液使用了相同的通用液体转移设置,造成气泡和不准确的转移。

随后,研究人员要求系统通过重复转移和读板机测量来优化流速。Claude 为水选择了约每秒 140 微升,产生 0.016 的均方根误差;为黏稠蛋白质溶液选择了每秒 10 微升,误差为 0.181。Genentech 的自动化专家认为这两项设置对于该配置而言均属合理。

该实验还暴露出一个重要限制。当气泡导致运行时错误时,Claude 最初在同一孔中重试操作,使物理问题进一步恶化。人类专家必须说明,系统应使用干净的孔,并减少混合循环次数。由此产生的指导随后被编码为可复用的液体处理说明。

在卡内基梅隆大学的一项演示中,研究人员利用 MHS 连接液体处理器、读板机、机械臂和摄像头,以开展自动化系列稀释实验。他们报告称,构建设备驱动程序和编排层约用了八小时,而典型的供应商构建集成方案需要数周时间。

该团队刻意引入了六种不安全或无效状况:缺失微孔板、微孔板旋转、读板机忙碌、摄像头断开连接、设备无法访问以及紧急停止处于激活状态。系统在任何设备移动前阻止了全部六种情况。

在随后的实验中,智能体拒绝了 R² 低于 0.9 的初始剂量反应曲线,将最高浓度从每毫升 200 微克降至每毫升 100 微克,并运行了第二块板。该次运行在无人干预的情况下产生了高于 0.98 的 R²。

QuEra Computing 的一项试点将 MHS 应用于中性原子量子计算机的激光系统。四个新启动的 Claude 实例反复提出、实施、测试和审查对激光恢复脚本的修改。该开发循环将恢复时间从约 150 秒、成功率 58%,提升至约 6 秒、成功率 96%。

随后,QuEra 在没有智能体控制激光的情况下测试了完成后的确定性脚本。在 700 次随机试验中,它成功恢复锁定 695 次,成功率为 99.3%。最终产物是一个可检查的程序,而非在生产运行期间进行每一次调整的 AI 模型。

这些案例说明了两种不同的运行模式。当条件需要持续解释时,智能体可以保持在闭环中;或者,它可以利用实时实验生成经过审查并在无在线模型情况下部署的确定性流程。

三、安全限制是接口的一部分,而非安全自主运行的证明

让 AI 智能体访问物理设备会带来在智能体仅限于文档或软件时不存在的风险。错误指令可能损坏样本、导致机器人碰撞、使人员暴露于危险机械,或改变敏感仪器的运行状态。

MHS 通过将运行约束置于设备描述中来解决这一问题的一部分。例如,显微镜驱动程序可以独立于智能体所请求的动作,强制执行激光功率上限。该标准还可以公开另一台设备移动前必须满足的设备状态。

这比要求模型在提示词中记住安全说明更具具体的控制层。不过,这并不能证明完整系统是安全的。

Anthropic 承认,Claude 的物理和空间推理能力仍然有限,因为该模型主要通过文本和图像学习物理世界。Genentech 的起泡失败表明,模型可能将物理问题解释为软件错误,并选择无效的恢复策略。

QuEra 团队同样发现,Claude 无法可靠地诊断涉及物理装置而非其程序控制的故障。它有时还会在等待人类确认其认为有风险的操作时暂停至隔夜。

MHS 目前要求设备具备可编程接口和适当的驱动程序。它不会自动使旧设备兼容智能体,不会消除领域专业知识的需求,也不会取代紧急停止、访问控制和物理隔离等传统保障措施。

Anthropic 表示,预览阶段将用于构建额外的评估、最佳实践和物理安全路线图。它计划在 MHS 开源时发布相关发现和部署指南。在这些材料及规范本身公开之前,外部开发者无法充分评估其设计、强制执行边界或互操作性声明。

四、硬件与自动化合作伙伴将决定 MHS 能否实现可移植性

MHS 源于 Anthropic 的 Beneficial Deployments 团队与 HHMI Janelia Research Campus 的合作。Janelia 科学家 Arco Bast 曾构建一个共享内存字典,用于连接脑成像装置上的激光器、摄像头和电动调焦器;Anthropic 研究员 Alek Kemeny 与他合作,加入了 AI 模型访问能力。

该预览此后已扩展至硬件和自动化提供商。AWS 计划通过其 Strands Robots 库提供预览支持。Automata 正在为其 LINQ 实验室自动化平台加入 MHS 支持,而斗山机器人正在测试该标准用于质量保证和多机器人协调。

MBF Bioscience 正在为 ScanImage 显微镜软件开发驱动程序。QIAGEN 正在利用其 QIAsymphony Connect 核酸纯化平台测试概念验证,Tecan 正在为其 Fluent 液体处理器加入支持。Universal Robots 也已获得早期访问权限。

Hugging Face 正在为其 LeRobot 机器人库加入 MHS 支持,而 Raspberry Pi 在测试摄像头驱动程序后,计划在多个产品中进行集成。

对于设备供应商,拟议的优势是可通过 MHS 驱动程序一次描述机器,而无需为每种智能体框架支持单独的集成方案。对于实验室和制造商,潜在收益是在此前需要独立编程的设备之间获得可复用的控制层。

实际价值将取决于不同供应商的驱动程序是否表现一致、安全约束是否在模型层以下得到强制执行,以及 Anthropic 初始合作伙伴群体之外的组织是否采用该规范。在访问权限仍仅限申请、且标准本身尚未开源的情况下,这些问题无法得到解决。

常见问题

模型硬件标准是否向所有人开放?

不是。MHS 目前处于有限研究预览阶段,有意参与者必须申请访问权限。

MHS 是否已经开源?

不是。Anthropic 表示计划在研究预览后将 MHS 开源,但尚未提供发布日期或许可证。

MHS 是否只能与 Claude 配合使用?

Anthropic 将该标准描述为与模型无关。Claude 为已发布的演示提供了支持,但其他智能体运行框架也可通过 MCP 等协议连接。

MHS 能控制任何物理机器吗?

不能自动实现。设备需要具备可编程接口或其他合适的控制层,还需要一个描述其操作、状态和安全限制的 MHS 驱动程序。

MHS 是否消除了人工监督的必要性?

没有。Anthropic 自己的演示发现,涉及物理直觉和故障排除的失败需要专家指导。

参考来源

Share

分享这篇文章