AI News글자 수 3934읽는 시간10

Anthropic, AI 제어 실험실 및 공장 장비를 위한 모델 하드웨어 표준 사전 공개

Anthropic의 모델 하드웨어 표준은 AI 에이전트가 과학 및 제조 장비를 운용할 수 있도록 공통의 안전 인식 인터페이스를 제공한다.

Anthropic은 AI 에이전트가 공통의 안전 인식 인터페이스를 통해 물리적 장비를 운용할 수 있도록 설계된 공유 사양인 모델 하드웨어 표준(Model Hardware Standard, MHS)의 첫 연구 프리뷰 단계를 시작했다.

이 프리뷰는 현미경, 액체 핸들러, 로봇 팔, 양자 컴퓨팅 하드웨어를 포함한 실험실 및 첨단 제조 시스템을 다룬다. 현재 접근은 선정된 파트너와 신청자로 제한된다. Anthropic은 프리뷰를 통해 안전성 평가와 배포 가이드를 개발한 뒤 MHS를 오픈 소스로 공개할 계획이라고 밝혔지만, 공개 날짜나 라이선스는 발표하지 않았다.

이 구분은 중요하다. MHS는 아직 일반적으로 이용 가능한 오픈 소스 표준이 아니다. 이는 과학 기관, 자동화 기업, 하드웨어 제조업체와 함께 기술 설계와 안전 통제를 시험하는 기업 주도 연구 프리뷰다.

1. MHS는 에이전트와 기계 사이의 통합 계층을 겨냥한다

현대의 실험실과 공장에는 여러 공급업체의 장비가 함께 있는 경우가 많으며, 각 장비에는 고유한 프로그래밍 인터페이스, 데이터 형식, 운영 전제가 있다. 이러한 장치를 연결하려면 장비와 워크플로마다 전문가가 별도의 통합을 작성해야 할 수 있다.

Anthropic에 따르면 이 과정은 통상 수주 또는 수개월이 걸린다. MHS는 소프트웨어와 각 물리 장치 사이를 변환하는 표준화된 드라이버로 이 맞춤형 “글루 코드”의 상당 부분을 대체하려 한다.

이 드라이버는 온도를 읽거나 새 온도 설정을 쓰는 작업 등을 포함한 소수의 기본 연산을 노출한다. 또한 각 장치를 표준 형식으로 설명하므로, 기기와 에이전트는 각각의 조합마다 맞춤형 변환기 없이 네트워크 전반에서 서로를 발견할 수 있다.

MHS는 기존 API가 생략할 수 있는 정보를 포착하도록 설계됐다. 드라이버에는 로봇 팔의 무게, 사용 가능한 측정값, 조정 가능한 매개변수, 강제되는 작동 한계 등의 속성을 설명하는 자연어 태그를 포함할 수 있다. MHS는 이 태그들로부터 에이전트가 기계를 이해하는 데 사용할 수 있는 참조 파일을 생성한다.

운영자는 이 정보를 직접 제공하거나, 에이전트가 하드웨어 구성에 관해 인터뷰하도록 할 수 있다. 이 메커니즘은 그렇지 않으면 종이 매뉴얼, 로컬 파일 또는 숙련된 기술자의 기억 속에만 존재할 수 있는 지식을 기계가 읽을 수 있는 설명으로 변환한다.

연결된 뒤 에이전트는 모델 컨텍스트 프로토콜(Model Context Protocol), 명령줄 인터페이스 또는 코드 파일과 API라는 세 가지 메커니즘을 통해 MHS 장비를 제어할 수 있다. 코드 파일은 모델이 각 개별 작업 전에 추론하기를 기다리지 않고 장치가 결정론적 순서를 실행할 수 있게 하므로, 장시간 실행되거나 시간에 민감한 작업에서 특히 중요하다.

Anthropic은 MHS를 모델 비종속적이라고 설명한다. 공개된 시연에서는 Claude가 사용됐지만, 이 사양은 다른 에이전트 하니스도 표준 프로토콜을 통해 연결된 하드웨어에 접근할 수 있도록 설계됐다.

2. 초기 실험은 폐루프 하드웨어 제어를 보여준다

프리뷰와 함께 제시된 가장 강력한 근거는 여러 파트너 실험에서 나온다. 이는 독립적으로 감사된 벤치마크가 아니라 초기의 시스템별 시연이지만, 공통 인터페이스가 모니터링, 조정, 오류 복구를 어떻게 지원할 수 있는지 보여준다.

Genentech에서 연구자들은 비신코닌산 단백질 분석을 위해 액체 핸들러, 로봇 팔, 마이크로플레이트 리더를 연결했다. Claude는 처음에 물과 점성이 높은 소 혈청 알부민 용액에 동일한 일반 액체 이송 설정을 사용했고, 이로 인해 기포와 부정확한 이송이 발생했다.

연구자들은 이후 반복 이송과 플레이트 리더 측정을 통해 유량을 최적화하도록 시스템에 요청했다. Claude는 물에 대해 초당 약 140마이크로리터를 선택해 0.016의 평균제곱근오차를 냈고, 점성이 높은 단백질 용액에는 초당 10마이크로리터를 선택해 0.181의 오차를 냈다. Genentech의 자동화 전문가는 두 설정 모두 해당 구성에 적절하다고 판단했다.

이 실험은 중요한 한계도 드러냈다. 기포로 런타임 오류가 발생하자 Claude는 처음에 동일한 웰에서 작업을 재시도해 물리적 문제를 악화시켰다. 인간 전문가는 시스템이 깨끗한 웰을 사용하고 혼합 사이클 수를 줄여야 한다고 설명해야 했다. 이후 이 가이드는 재사용 가능한 액체 처리 지침으로 인코딩됐다.

Carnegie Mellon University 시연에서 연구자들은 자동화된 연속 희석 실험을 위해 MHS로 액체 핸들러, 플레이트 리더, 로봇 팔, 카메라를 연결했다. 이들은 일반적인 공급업체 구축 통합에 수주가 걸리는 것과 비교해 약 8시간 만에 장치 드라이버와 오케스트레이션 계층을 구축했다고 보고했다.

팀은 플레이트 누락, 회전된 플레이트, 사용 중인 리더, 연결 해제된 카메라, 도달할 수 없는 장치, 활성화된 비상 정지라는 여섯 가지 안전하지 않거나 유효하지 않은 조건을 의도적으로 도입했다. 시스템은 장비가 움직이기 전에 여섯 가지를 모두 차단했다.

이후 실험에서 에이전트는 R²가 0.9 미만인 초기 농도-반응 곡선을 거부하고, 최대 농도를 밀리리터당 200마이크로그램에서 100마이크로그램으로 낮춘 뒤 두 번째 플레이트를 실행했다. 이 실행은 사람의 개입 없이 R² 0.98 이상을 냈다.

QuEra Computing 파일럿은 중성 원자 양자 컴퓨터의 레이저 시스템에 MHS를 적용했다. 새로 시작된 네 개의 Claude 인스턴스는 레이저 복구 스크립트의 변경을 반복적으로 제안, 구현, 테스트, 검토했다. 이 개발 루프는 약 150초와 58% 성공률 수준의 복구 성능을 약 6초와 96% 성공률로 개선했다.

이후 QuEra는 에이전트가 레이저를 제어하지 않는 상태에서 완성된 결정론적 스크립트를 테스트했다. 이 스크립트는 무작위화된 700회 시험 중 695회에서 잠금을 성공적으로 복원했으며, 성공률은 99.3%였다. 최종 산출물은 생산 시점의 모든 조정을 AI 모델이 수행하는 방식이 아니라 검사 가능한 프로그램이었다.

이 사례들은 두 가지 서로 다른 운영 패턴을 보여준다. 조건에 지속적인 해석이 필요할 때 에이전트가 루프에 계속 남을 수 있고, 라이브 실험을 통해 온라인 모델 없이 검토 및 배포되는 결정론적 절차를 만들 수도 있다.

3. 안전 한계는 인터페이스의 일부이지 안전한 자율성의 증거는 아니다

AI 에이전트에게 물리 장비 접근 권한을 부여하면 에이전트가 문서나 소프트웨어로 제한될 때는 존재하지 않는 위험이 생긴다. 잘못된 명령은 샘플을 손상시키고, 로봇을 충돌시키며, 인력을 위험한 기계에 노출시키거나 민감한 기기의 작동 상태를 바꿀 수 있다.

MHS는 장치 설명에 작동 제약을 배치함으로써 이 문제의 일부를 해결한다. 예를 들어 현미경 드라이버는 에이전트가 요청한 작업과 무관하게 레이저 출력 상한을 강제할 수 있다. 이 표준은 다른 장치가 움직이기 전에 충족해야 하는 장비 상태도 노출할 수 있다.

이는 모델에게 프롬프트에서 안전 지침을 기억하라고 요청하는 것보다 더 구체적인 제어 계층이다. 하지만 이것이 전체 시스템이 안전하다는 사실을 입증하지는 않는다.

Anthropic은 모델이 물리 세계를 주로 텍스트와 이미지로 학습하기 때문에 Claude의 물리적·공간적 추론은 여전히 제한적이라고 인정한다. Genentech의 거품 발생 실패는 모델이 물리적 문제를 소프트웨어 오류로 해석하고 효과 없는 복구 전략을 선택할 수 있음을 보여줬다.

QuEra 팀도 Claude가 프로그래밍 제어가 아닌 물리적 장비와 관련된 실패를 안정적으로 진단하지 못한다는 점을 발견했다. 또한 위험하다고 판단한 작업에 대해 인간의 확인을 기다리며 때때로 밤새 중단되기도 했다.

MHS는 현재 프로그래밍 가능한 인터페이스와 적절한 드라이버를 갖춘 장비를 요구한다. 이는 기존 장비를 자동으로 에이전트 호환 장비로 만들거나, 도메인 전문성의 필요성을 없애거나, 비상 정지, 접근 제어, 물리적 격리와 같은 기존 안전장치를 대체하지 않는다.

Anthropic은 프리뷰를 추가 평가, 모범 사례, 물리적 안전 로드맵을 구축하는 데 활용할 것이라고 밝혔다. MHS가 오픈 소스가 되면 조사 결과와 배포 가이드를 공개할 계획이다. 이러한 자료와 사양 자체가 공개되기 전까지 외부 개발자는 설계, 강제 적용의 경계, 상호운용성 주장을 완전히 평가할 수 없다.

4. MHS의 이식성은 하드웨어 및 자동화 파트너가 좌우할 것이다

MHS는 Anthropic의 Beneficial Deployments 팀과 HHMI Janelia Research Campus 간 협업에서 시작됐다. Janelia의 과학자 Arco Bast는 뇌 영상 장비에서 레이저, 카메라, 전동식 포커서를 연결하기 위한 공유 메모리 딕셔너리를 구축했으며, Anthropic 연구원 Alek Kemeny는 여기에 AI 모델 접근을 추가하기 위해 그와 협력했다.

이후 프리뷰는 하드웨어 및 자동화 제공업체로 확대됐다. AWS는 Strands Robots 라이브러리를 통한 프리뷰 지원을 계획하고 있다. Automata는 LINQ 실험실 자동화 플랫폼에 MHS 지원을 추가하고 있으며, Doosan Robotics는 품질 보증과 다중 로봇 조정을 위해 이 표준을 시험하고 있다.

MBF Bioscience는 ScanImage 현미경 소프트웨어용 드라이버를 개발하고 있다. QIAGEN은 QIAsymphony Connect 핵산 정제 플랫폼으로 개념 증명을 시험하고 있으며, Tecan은 Fluent 액체 핸들러에 대한 지원을 추가하고 있다. Universal Robots도 초기 접근 권한을 받았다.

Hugging Face는 LeRobot 로보틱스 라이브러리에 MHS 지원을 추가하고 있으며, Raspberry Pi는 카메라 드라이버 테스트 이후 여러 제품 전반의 통합을 계획하고 있다.

장비 공급업체에 제안되는 이점은 각 에이전트 프레임워크마다 별도의 통합을 지원하는 대신 MHS 드라이버를 통해 기계를 한 번 설명할 수 있다는 점이다. 실험실과 제조업체에는 이전에 독립적인 프로그래밍이 필요했던 장치 전반에서 재사용 가능한 제어 계층이 잠재적 이점이다.

실질적 가치는 서로 다른 공급업체의 드라이버가 일관되게 동작하는지, 안전 제약이 모델 계층 아래에서 강제되는지, Anthropic의 초기 파트너 그룹 외 조직이 이 사양을 채택하는지에 달려 있다. 접근이 신청자 전용으로 유지되고 표준 자체가 아직 오픈 소스가 아닌 동안에는 이러한 질문을 해결할 수 없다.

자주 묻는 질문

모델 하드웨어 표준은 누구나 이용할 수 있나요?

아니요. MHS는 제한된 연구 프리뷰 단계이며, 참여 희망자는 접근 권한을 신청해야 합니다.

MHS는 이미 오픈 소스인가요?

아니요. Anthropic은 연구 프리뷰 이후 MHS를 오픈 소스로 공개할 계획이라고 밝혔지만, 공개 날짜나 라이선스는 제공하지 않았습니다.

MHS는 Claude에서만 작동하나요?

Anthropic은 이 표준을 모델 비종속적으로 설명합니다. 공개된 시연은 Claude로 구동됐지만, 다른 에이전트 하니스도 MCP와 같은 프로토콜을 통해 연결하도록 설계됐습니다.

MHS는 모든 물리적 기계를 제어할 수 있나요?

자동으로는 아닙니다. 장비에는 프로그래밍 가능한 인터페이스 또는 다른 적절한 제어 계층이 필요하며, 그 작업, 상태, 안전 한계를 설명하는 MHS 드라이버도 필요합니다.

MHS는 인간 감독의 필요성을 없애나요?

아니요. Anthropic의 자체 시연에서도 전문가의 가이드가 필요한 물리적 직관 및 문제 해결과 관련된 실패가 발견됐습니다.

참고 자료

Share

이 글 공유