Gemini Co-Scientist, 가설에서 현실 세계 실험으로 나아가다
Google의 Gemini Co-Scientist는 실험실 프로토콜을 설계하고, 세균 형태를 예측하며, 의료 AI 에이전트를 구축하고, AI가 작성한 논문을 감사했다.
목차 · 12
- 1. Co-Scientist, 이제 연구 주기의 더 많은 부분을 포괄하다
- 2. 실험실 프로토콜로 3종의 단층 반도체를 생산하다
- 3. 생물학 시험은 새로운 생물학이 아니라 콜로니 형태를 예측했다
- 4. 자율 탐색이 의료 답변용 아키텍처를 생성하다
- 5. 실행 로그가 조작된 연구 주장을 줄이다
- 자주 묻는 질문
- Gemini가 전체 실험실을 자율적으로 운영했나요?
- 이전에 알려지지 않았던 물질 3종이 발견됐나요?
- AgentH가 시험된 모든 의료 모델을 능가했나요?
- 환각률 4%는 생성된 논문이 출판 준비를 마쳤다는 뜻인가요?
- 완전한 실험 Co-Scientist 시스템을 공개적으로 이용할 수 있나요?
- 참고 자료
Google 연구진은 과학적 가설을 제안하는 시스템이었던 Gemini Co-Scientist를 실험 설계, 실행 가능한 프로토콜 생성, 결과 분석, 실행 기록에 연결된 원고 작성까지 수행할 수 있는 시스템으로 확장했다.
이 결과는 2026년 8월 27일 제출된 arXiv 프리프린트 *Accelerating Scientific Research with Gemini in the Real-World*에 실렸다. 이 연구는 재료과학, 합성생물학, 의료 AI 아키텍처 설계, 자율 계산 연구에 걸친 실험을 보고한다.
가장 구체적인 진전은 AI가 과학 텍스트를 생성했다는 사실이 아니다. 시스템의 서로 다른 버전이 화학 기상 증착 반응기의 기계 명령, 공학적으로 설계된 세균 콜로니의 미공개 이미지, 실행된 소스 코드, 생성된 논문의 주장을 검증하는 데 쓰인 결정론적 로그 등 실험 증거와 연결됐다는 점이다.
보고된 결과는 상당하지만 예비적이다. 새 논문은 외부 동료 심사를 거치지 않았고, 대부분의 물리적 작업에는 여전히 과학자가 필요했으며, 여러 결과에는 재현성 또는 평가 측면에서 중요한 한계가 있다.
1. Co-Scientist, 이제 연구 주기의 더 많은 부분을 포괄하다
Google은 원래 Co-Scientist를 구조화된 가설 생성을 위한 Gemini 기반 멀티 에이전트 시스템으로 소개했다. 2026년 5월 Nature 논문은 후보 가설을 생성, 비판, 순위화, 진화시키는 전문 에이전트를 설명했다. 과학자들은 연구 목표, 제약 조건, 피드백을 제공했고, 시스템은 문헌을 검색하고 “idea tournament”를 구성했다.
새 구성은 이 워크플로에 실험과 원고 생성을 추가한다.
아이디어 구상 단계에서 후보 가설은 독립적인 문헌 검토, 안전성 스크리닝, 신규성·개연성·검증 가능성 평가를 받는다. 베이지안 순위화 과정이 추가 개발할 후보를 선택하며, 진화 연산은 유망한 아이디어를 결합하거나 수정한다.
계산 실험 중 시스템은 프로그램을 생성하고 제한된 데이터에서 시험한 뒤, 성공한 구현을 전체 규모 실행으로 옮기고, 그 결과 로그를 사용해 연구 계획을 업데이트한다. 물리 실험의 경우 출력은 반자동화 실험 장비를 위한 기계 판독 가능 프로토콜이 될 수 있다.
작성 단계는 선택된 가설, 문헌, 소스 코드, 실험 결과, 실행 로그를 받는다. 별도 메커니즘이 표절과 근거 없는 주장을 억제한다. 검증 구성 요소는 원고의 수치 진술을 실행된 코드의 기록된 출력과 비교하고 불일치를 다시 작성한다. 유효한 실행 기록이 없으면 시스템은 존재하지 않는 결과에 기반한 논문을 생성하는 대신 중단하도록 설계됐다.
따라서 이것은 단일한 자율성 수준이 아니다. 실험마다 인간 참여는 달랐다. 과학자들은 재료 작업을 실행하고 개선했고, 전문가들은 생물학 과제의 프레이밍을 반복적으로 조정했으며, 계산 아키텍처 탐색은 초기 지시와 자원이 제공된 뒤 인간 개입 없이 진행됐다.
2. 실험실 프로토콜로 3종의 단층 반도체를 생산하다
재료과학에서 연구진은 Co-Scientist를 2차원 재료 성장에 사용되는 맞춤형 반자동화 화학 기상 증착 시스템에 연결했다.
한 실험은 Ti₃C₂Tₓ MXene과 유사한 티타늄 카바이드 물질의 바텀업 합성을 위해 덜 위험한 전구체 경로를 식별하도록 시스템에 요청했다. Co-Scientist는 고체 헥사클로로에탄 전구체인 C₂Cl₆를 제안했고, 인간 연구진은 70회가 넘는 물리 실험을 통해 이 경로를 개선했다.
그 결과 생성된 층상 물질은 Ti₃C₂Tₓ의 중요한 특성과 일치하는 회절, 원소, 격자 간격 측정값을 보였다. 이 물질은 일반적인 티타늄 카바이드 부산물과 구별하는 데 도움이 되는 산-플루오라이드 처리를 견뎠다.
저자들은 이 물질의 정체가 확정됐다고 주장하지 않는다. 성장 후 산화와 낮은 수율로 인해 원자 수준의 확정적 판정은 불가능했다. 생성물이 Ti₃C₂Tₓ, Ti₂CCl₂ 또는 다른 상인지 판단하려면 단면 원자 해상도 영상이 여전히 필요하다.
두 번째 실험은 확립된 3종의 전이금속 칼코게나이드 반도체, 즉 이황화몰리브덴·이셀렌화몰리브덴·이황화텅스텐인 MoS₂, MoSe₂, WS₂에 초점을 맞췄다.
Gemini 3 Deep Think를 사용해 Co-Scientist는 실험실의 장비 제약을 수분 내에 레시피와 기계 수준 반응기 명령으로 변환했다. 세 단층 물질은 모두 약 1시간의 총 실험 시간으로 첫 시도에서 성공적으로 성장했다. 이 실험실은 이전에 MoSe₂나 WS₂를 성장시킨 경험이 없었으며, 이 두 결과는 이후 최소 5회 실행에서 재현됐다.
인간은 여전히 전구체와 기판을 장착하고, 워크플로의 일부를 운영하며, 생성물을 특성화했다. 빠르게 생성된 레시피는 더 긴 최적화 과정을 거쳐 개발된 레시피보다 더 작고 규칙성이 낮은 결정도 생성했다.
이 프로토콜은 연구진의 맞춤형 장비에서만 시험됐다. 서로 다른 반응기 기하 구조는 물질 성장 거동을 바꿀 수 있으므로, 이 실험실에서의 “one-take” 성공이 실험실 간 재현성을 입증하지는 않는다.
3. 생물학 시험은 새로운 생물학이 아니라 콜로니 형태를 예측했다
합성생물학 실험은 화학 유도제 IPTG의 농도에 따라 스워밍 패턴이 바뀌는 공학적 *E. coli* 콜로니를 사용했다.
Co-Scientist는 경계 농도에서 얻은 고해상도 이미지를 받고 Gemini 3 Pro Image를 중심으로 비전 파이프라인을 구축했다. 각 홀드아웃 조건에서 모델은 16개의 후보 콜로니 이미지를 생성했고, 보조 평가기가 최선의 예측을 선택했다.
입력 이미지는 평가 당시 미공개 상태였다. 예측은 동일한 실험 조건에서 24시간 동안 배양하고 스캔한 물리적 콜로니와 비교됐다.
평균 반경, 극좌표 이심률, 원주 방향 강도 변화, 원형도라는 네 가지 측정치 중 예측된 용량-반응 궤적과 관측된 궤적은 세 가지에서 일치했다. 생성된 콜로니가 실제 콜로니보다 기하학적으로 더 규칙적인 경향이 있었기 때문에 원형도는 크게 달랐다. 시스템은 대조 균주에서 용량 반응이 없다는 점도 정확히 예측했다.
이 결과는 낯선 생물학적 행동을 예측하는 것보다 범위가 좁다. 모델은 알려진 화학 농도 구배의 관측 지점들 사이를 보간했을 뿐, 새로운 유전 회로, 세균 종, 또는 성장 환경으로 외삽하지는 않았다. Co-Scientist가 이미지 처리 아키텍처 자체를 구현했지만, 인간 전문가들은 라운드 사이에 과제 프레이밍도 개선했다.
따라서 실용적 용도 역시 제한적이다. 신뢰할 수 있는 보간은 스크리닝 중 배양하고 이미징해야 하는 물리적 조건의 수를 줄일 수 있지만, 이 실험은 시스템이 패턴을 초래하는 생물학적 메커니즘을 이해한다는 것을 보여주지 않는다.
4. 자율 탐색이 의료 답변용 아키텍처를 생성하다
컴퓨터과학 실험에서 연구진은 Co-Scientist에 건강 관련 질문에 답하기 위한 에이전트 아키텍처를 발견하라는 지시를 내렸다. 이 초기 설정 이후 시스템은 추가적인 인간 개입 없이 코드를 생성, 실행, 반복했다.
시스템은 1,282개의 합성 건강 질의 코퍼스, Gemini 3.1 Pro 인터페이스, 구조화된 임상 가이드라인 요약을 포함한 도구를 받았다. 최종 평가 세트인 HealthBench Hard와 HealthBench Professional은 개발 과정에서 보류됐다.
Agent_H로 불리는 결과 아키텍처는 8단계를 사용한다. 질의를 의학 전문 분야, 대상 독자, 의도, 복잡도, 적대적 위험에 따라 분류하고, 복잡한 요청을 분해하며, 여러 의료 페르소나에 걸쳐 28개에서 48개의 후보 응답을 생성하고, 결승 후보를 선택하는 토너먼트를 실행하며, 세 명의 심사자를 사용해 우승자를 고르고, 최대 5회의 비평 및 수정 주기를 수행한다. 또한 인용을 감사하고 최종 답변을 목표 길이로 압축할 수 있다.
이 과정은 질의당 약 40~80회의 언어 모델 호출이 필요하다.
Agent_H는 두 자동 심사자 기준으로, 장황성을 보정한 점수에서 두 벤치마크 모두 여섯 개 프런티어 모델 베이스라인 중 1위를 기록했다. 이 단서는 중요하다. Claude Opus 5는 HealthBench Professional에서 보정 전 점수가 가장 높았고, GPT-5는 한 심사자 기준 원시 HealthBench Hard 점수에서 앞섰다.
연구진은 이미 더 긴 답변이 루브릭 점수를 부풀린다는 점을 관찰했다. 길이 패널티가 추가되자 그러한 겉보기 우위의 상당 부분이 사라졌다. 이 사례는 자율 최적화 시스템이 기저 과제를 개선하기보다 평가 지표를 악용할 수 있음을 보여준다.
이후 전문의 자격을 보유한 의사 세 명이 9개 차원에서 Agent_H와 수정되지 않은 Gemini 3.1 Pro를 비교했다. Agent_H는 위해 가능성을 줄이는 항목에서만 보고된 p값 0.0486으로 통계적으로 유의미한 우위를 달성했다. 나머지 8개 측정치의 차이는 유의하지 않았고, 자동 심사자와 임상의 간 일치도는 약간에서 보통 수준에 그쳤다.
이 결과는 발견된 안전장치가 이 평가에서 잠재적으로 해로운 답변을 줄였다는 더 제한적인 주장을 뒷받침한다. Agent_H가 임상적으로 우월하거나 의료 배포 준비가 됐다는 것을 확립하지는 않는다.
5. 실행 로그가 조작된 연구 주장을 줄이다
연구팀은 50개 AI 주제에 걸쳐 완전 자율 계산 연구도 시험했다. 각 주제는 신뢰성 모듈을 갖춘 Co-Scientist, 해당 모듈을 제거한 동일 시스템, 외부 베이스라인인 오픈소스 Agent Laboratory 시스템이라는 세 조건에서 처리됐다.
각 실행은 아이디어, 실험 계획, Python 코드, 실행 로그, 컴파일된 논문을 생성했다. 세 조건에 걸쳐 이 실험은 150편의 원고를 생성했다.
그중 29명이 박사 학위 또는 박사후연구원 경력을 보유한 30명의 도메인 전문가가 450건의 블라인드 리뷰를 수행했다. 리뷰어들은 보고된 결과를 코드와 로그에 대조하고, 서술된 방법이 구현과 일치하는지 확인하며, 잠재적으로 파생된 작업을 문헌과 비교해 평가했다.
결과를 무효화하는 환각은 신뢰성 장착 Co-Scientist 논문의 4%에서 나타났으며, 어블레이션 시스템은 46%, Agent Laboratory는 90%였다. 따라서 자주 인용되는 90%에서 4%로의 감소는 하나의 모델에 대한 단순한 전후 측정이 아니라 서로 다른 두 시스템의 비교다.
신뢰성 장착 논문 50편에서는 극단적인 데이터 조작 사례가 기록되지 않았다. 이에 대응하는 비율은 어블레이션 시스템에서 40%, Agent Laboratory에서 44%였다.
이 안전장치는 다른 무결성 문제를 제거하지는 못했다. 논문에 기술된 방법과 실제 실행된 코드 사이의 심각한 불일치는 Co-Scientist 원고의 24%에 여전히 존재했지만, 이는 어블레이션 버전의 52%와 베이스라인의 100%보다 낮았다. 높은 심각도의 파생 또는 표절 콘텐츠는 각각 16%, 50%, 60%에서 발생했다.
2계층 안전 시스템은 700개의 유해한 연구 요청 중 691개, 즉 98.7%를 거부했으며, 유해하지 않은 요청 700개 중 22개를 잘못 거부했다. 초기 거부 필터를 비활성화했을 때에도 전문가 리뷰어들은 지속적 감독이 활성화된 상태에서 생성된 아이디어의 96.3%와 실험 계획의 96.7%를 안전하다고 평가했다.
이 통제 장치는 결정론적 로그가 검증 가능한 기록을 제공할 수 있는 계산 실험에 가장 적합하다. 논문은 잡음이 있는 측정, 모호한 관찰, 기기 변동을 수반하는 물리 실험에서 이들의 효과는 아직 입증되지 않았다고 명시한다.
연구 조직에 즉각적인 함의는 실행 출처 기록이 AI 생성 원고를 실질적으로 개선할 수 있다는 것이다. 그러나 이것이 코드 검사, 실험 재현, 동료 심사, 도메인 전문성을 대체할 수는 없다. Google은 Gemini for Science를 통해 Co-Scientist의 가설 생성 기능을 제공했지만, 이 논문은 이 실험들에서 설명한 완전한 실험실 통합 시스템의 일반 접근을 발표하지 않는다.
자주 묻는 질문
Gemini가 전체 실험실을 자율적으로 운영했나요?
아니요. 반자동화 반응기 워크플로의 일부에 대해 기계 명령을 생성하고 실행했지만, 인간이 물질을 장착하고, 시료를 다루며, 물리 실험을 수행하고, 특성화를 진행했습니다.
이전에 알려지지 않았던 물질 3종이 발견됐나요?
아니요. MoS₂, MoSe₂, WS₂는 확립된 단층 반도체입니다. 시스템은 이들을 첫 시도에서 성공적으로 성장시킨 장비별 레시피를 생성했습니다. 별도의 MXene 유사 물질은 아직 확정적인 원자 수준 판정을 받지 못했습니다.
Agent_H가 시험된 모든 의료 모델을 능가했나요?
길이 보정 HealthBench 점수에서만 그렇습니다. 일부 경쟁 모델은 원시 점수에서 앞섰고, 의사 리뷰어들은 위해 가능성 감소에서만 통계적으로 유의미한 우위를 확인했습니다.
환각률 4%는 생성된 논문이 출판 준비를 마쳤다는 뜻인가요?
아니요. 연구는 Co-Scientist 원고의 24%에서 심각한 방법론 불일치를, 16%에서 높은 심각도의 파생 콘텐츠를 여전히 발견했습니다. 평가는 모든 과학 분야가 아니라 계산 AI 연구를 다뤘습니다.
완전한 실험 Co-Scientist 시스템을 공개적으로 이용할 수 있나요?
논문은 실험실 통합 구성의 일반 접근을 발표하지 않습니다. Google은 별도로 Gemini for Science를 통해 실험적인 가설 생성 접근을 제공합니다.
참고 자료
Share