Anthropic 預覽用於 AI 控制實驗室及工廠設備的模型硬件標準
Anthropic 的模型硬件標準為 AI 代理提供一個具安全意識的通用介面,以操作科學及製造設備。
Anthropic 已開放模型硬件標準(Model Hardware Standard,MHS)的首個研究預覽階段。這是一套共享規格,旨在讓 AI 代理透過一個具安全意識的通用介面操作實體設備。
此預覽涵蓋顯微鏡、液體處理器、機械臂及量子運算硬件等實驗室與先進製造系統。目前僅限獲選合作夥伴及申請者使用。Anthropic 表示,計劃在利用預覽開發安全評估及部署指引後,將 MHS 以開源形式發布,但尚未公布發布日期或授權條款。
這個區別很重要:MHS 尚非普遍可用的開源標準。它是一項由公司主導的研究預覽,其技術設計及安全控制措施正與科研機構、自動化公司及硬件製造商一同測試。
一、MHS 針對代理與機器之間的整合層
現代實驗室及工廠往往有來自多個供應商的設備,每一種都有自己的程式介面、資料格式及操作假設。要連接這些裝置,可能需要專家為每一部儀器及每個工作流程分別編寫整合方案。
Anthropic 表示,這個過程通常需時數星期或數月。MHS 嘗試以標準化驅動程式取代大部分這類客製化的「膠水程式碼」,在軟件與每部實體裝置之間進行轉換。
該驅動程式提供一小組原語操作,包括讀取溫度或寫入新的溫度設定等操作。它亦會以標準格式描述每部裝置,讓儀器及代理可透過網絡互相發現,無須為每個配對另設客製化轉譯器。
MHS 的用意是記錄傳統 API 可能忽略的資訊。驅動程式可包含以自然語言撰寫的標籤,描述機械臂重量、可用量度、可調整參數及強制執行的操作限制等屬性。MHS 會根據這些標籤產生參考檔案,供代理用來理解機器。
操作人員可直接提供這些資訊,或由代理訪問他們有關硬件設定的資料。這個機制會把原本可能只存在於紙本手冊、本機檔案或資深技術員記憶中的知識,轉換為機器可讀的描述。
連接後,代理可透過三種機制控制 MHS 設備:模型上下文協議(Model Context Protocol)、命令列介面,或程式碼檔案及 API。程式碼檔案對長時間運行或時間敏感的操作尤其重要,因為它們讓裝置執行確定性的步驟序列,毋須在每個個別動作前等待模型推理。
Anthropic 將 MHS 描述為與模型無關。已發布的示範使用 Claude,但此規格的設計讓其他代理框架亦可透過標準協議存取已連接的硬件。
二、早期實驗展示閉環硬件控制
預覽所展示的最有力證據來自數項合作夥伴實驗。這些是早期、特定系統的示範,而非經獨立審核的基準測試,但它們展示了通用介面如何支援監察、協調及錯誤復原。
在 Genentech,研究人員為雙縮脲酸蛋白質測定連接了液體處理器、機械臂及微孔板讀取器。Claude 起初對水及黏稠的牛血清白蛋白溶液使用相同的通用液體轉移設定,造成氣泡及不準確的轉移。
研究人員其後要求系統透過重複轉移及微孔板讀取器量度來優化流速。Claude 為水選擇每秒約 140 微升,得出的均方根誤差為 0.016;而為黏稠蛋白質溶液選擇每秒 10 微升,誤差為 0.181。Genentech 的自動化專家認為,兩個設定均適合該配置。
實驗亦揭示一項重要限制。當氣泡引發執行時錯誤時,Claude 起初在同一個孔位重試操作,令實體問題惡化。人類專家必須解釋,系統應使用乾淨的孔位並減少混合循環次數。相關指引其後被編碼成可重用的液體處理指令。
在卡內基美隆大學的一項示範中,研究人員使用 MHS 連接液體處理器、板讀取器、機械臂及攝影機,以進行自動化系列稀釋實驗。他們表示,建立裝置驅動程式及編排層約需八小時,相比之下,一般由供應商建立的整合方案需時數星期。
團隊刻意引入六種不安全或無效狀況:缺少微孔板、微孔板旋轉、讀取器正忙、攝影機斷線、裝置無法連接,以及緊急停止處於啟動狀態。系統在任何設備移動前已攔截全部六種情況。
在其後的實驗中,代理拒絕接受 R² 低於 0.9 的初始劑量反應曲線,將最高濃度由每毫升 200 微克降至 100 微克,並運行第二塊微孔板。該次運行在無人干預下產生高於 0.98 的 R²。
QuEra Computing 的試點計劃將 MHS 應用於一部中性原子量子電腦的雷射系統。四個全新的 Claude 實例反覆提出、實施、測試及審閱對雷射復原腳本的修改。這個開發循環把復原時間由約 150 秒、成功率 58%,改善至約六秒、成功率 96%。
QuEra 隨後在沒有代理控制雷射的情況下測試完成的確定性腳本。在 700 次隨機試驗中,它成功恢復鎖定 695 次,成功率為 99.3%。最終成品是一個可檢查的程式,而非由 AI 模型在每次生產時調整。
這些案例展示兩種不同的操作模式。當情況需要持續判讀時,代理可留在迴路中;或者,它可利用即時實驗產生確定性程序,經審閱後部署,毋須在線模型。
三、安全限制是介面的一部分,而非安全自主運作的證明
讓 AI 代理存取實體設備,會帶來代理僅限於文件或軟件時不存在的風險。錯誤指令可能損壞樣本、令機械人碰撞、使人員暴露於危險機械,或改變敏感儀器的操作狀態。
MHS 透過將操作限制置於裝置描述中,處理了這個問題的一部分。例如,顯微鏡驅動程式可獨立於代理要求的動作,強制執行雷射功率上限。該標準亦可公開其他裝置移動前必須符合的設備狀態。
這比要求模型在提示中記住安全指示,是更具體的控制層。然而,這並不證明整個系統安全。
Anthropic 承認,Claude 的實體及空間推理能力仍然有限,因為模型主要透過文字及圖像學習實體世界。Genentech 的起泡失敗顯示,模型可能會把實體問題理解為軟件錯誤,並選擇無效的復原策略。
QuEra 團隊同樣發現,Claude 無法可靠地診斷涉及實體裝置而非其程式控制的故障。它有時亦會在等待人類確認其認為有風險的行動時暫停過夜。
MHS 目前要求設備具備可程式化介面及適當驅動程式。它不會自動令舊式機械與代理相容、消除領域專業知識的需要,或取代緊急停止、存取控制及實體隔離等傳統保障措施。
Anthropic 表示,該預覽將用於建立額外評估、最佳實務及實體安全路線圖。當 MHS 成為開源項目時,它計劃發布研究結果及部署指引。在這些材料及規格本身公開之前,外部開發者無法全面評估其設計、強制執行界線或互通性主張。
四、硬件及自動化合作夥伴將決定 MHS 能否成為可移植標準
MHS 源於 Anthropic 的 Beneficial Deployments 團隊與 HHMI Janelia Research Campus 的合作。Janelia 科學家 Arco Bast 曾建立一個共享記憶體字典,用以連接腦部成像裝置上的雷射、攝影機及電動調焦器;Anthropic 研究員 Alek Kemeny 與他合作加入 AI 模型存取功能。
預覽其後擴展至硬件及自動化供應商。AWS 計劃透過其 Strands Robots 函式庫提供預覽支援。Automata 正為其 LINQ 實驗室自動化平台加入 MHS 支援,而 Doosan Robotics 正測試該標準用於品質保證及多機械人協調。
MBF Bioscience 正為 ScanImage 顯微鏡軟件開發驅動程式。QIAGEN 正以其 QIAsymphony Connect 核酸純化平台測試概念驗證,而 Tecan 正為其 Fluent 液體處理器加入支援。Universal Robots 亦已獲得早期存取權。
Hugging Face 正為其 LeRobot 機械人函式庫加入 MHS 支援,而 Raspberry Pi 在測試攝影機驅動程式後,計劃在多項產品中進行整合。
對設備供應商而言,建議中的優勢是可透過 MHS 驅動程式描述機器一次,而毋須為每個代理框架支援獨立整合。對實驗室及製造商而言,潛在好處是在過往需要獨立編程的裝置之間,建立可重用的控制層。
實際價值將取決於不同供應商的驅動程式是否表現一致、安全限制是否在模型層以下強制執行,以及 Anthropic 初始合作夥伴群組以外的機構會否採用此規格。在存取仍然只限申請,而且標準本身尚未開源的情況下,這些問題無法解決。
常見問題
模型硬件標準是否所有人都可使用?
不是。MHS 正處於有限研究預覽階段,有意參與者必須申請存取權。
MHS 是否已經開源?
不是。Anthropic 表示計劃在研究預覽後將 MHS 開源,但尚未提供發布日期或授權條款。
MHS 是否只能與 Claude 一起使用?
Anthropic 將此標準描述為與模型無關。已發布的示範由 Claude 驅動,但其他代理框架亦預計可透過 MCP 等協議連接。
MHS 能否控制任何實體機器?
不能自動做到。設備需要可程式化介面或另一個合適控制層,另加一個描述其操作、狀態及安全限制的 MHS 驅動程式。
MHS 是否毋須人類監督?
不是。Anthropic 自己的示範發現,涉及實體直覺及故障排除的失敗仍需要專家指引。
參考來源
Share