AI News字數 3695閱讀時長10 分鐘

Gemini Co-Scientist 從假設走向現實世界實驗

Google 的 Gemini Co-Scientist 設計實驗室實驗方案、預測細菌形態、建立醫療 AI 代理,並審核由 AI 撰寫的論文。

文章目錄 · 12
  1. 一、Co-Scientist 現在涵蓋研究周期中更多環節
  2. 二、實驗室方案生成三種單層半導體
  3. 三、生物學測試預測菌落形態,而非新生物學
  4. 四、一項自主搜尋生成了醫療問答架構
  5. 五、執行日誌減少虛構的研究聲稱
  6. 常見問題
  7. Gemini 是否自主操作了整個實驗室?
  8. 是否發現了三種此前未知的材料?
  9. AgentH 是否勝過每個接受測試的醫療模型?
  10. 4% 的幻覺率是否代表生成的論文已可供發表?
  11. 完整的實驗型 Co-Scientist 系統是否公開可用?
  12. 參考來源

Google 研究人員已將 Gemini Co-Scientist 從一個提出科學假設的系統,擴展為可設計實驗、生成可執行的實驗方案、分析結果,以及撰寫與執行記錄相連的論文的系統。

這些結果刊於 *Accelerating Scientific Research with Gemini in the Real-World*,一篇於 2026 年 8 月 27 日提交至 arXiv 的預印本。研究報告涵蓋材料科學、合成生物學、醫療 AI 架構設計及自主計算研究的實驗。

最具體的進展,並不只是 AI 生成了科學文本,而是系統的不同版本與實驗證據建立了連繫:化學氣相沉積反應器的機器指令、未公開的工程化細菌菌落圖像、已執行的原始碼,以及用作核對生成論文中聲稱的確定性日誌。

所報告的結果相當重要,但仍屬初步。這篇新論文尚未經外部同行評審,大部分實體實驗工作仍需要科學家參與,而且多項發現具有重要的可重現性或評估限制。

一、Co-Scientist 現在涵蓋研究周期中更多環節

Google 最初將 Co-Scientist 介紹為一個以 Gemini 為基礎、用於結構化生成假設的多代理系統。其於 2026 年 5 月發表在 Nature 的論文描述了專門代理,負責生成、批評、排序及演化候選假設。科學家提供研究目標、限制條件和回饋,而系統則搜尋文獻並組織一場「構思競賽」。

新配置將實驗和論文生成加入該工作流程。

在構思期間,候選假設會接受獨立的文獻回顧、安全篩查,以及新穎性、合理性和可測試性的評估。貝葉斯排序程序會選出候選項目作進一步發展,而演化操作則會結合或修訂具潛力的想法。

在計算實驗期間,系統會生成程式、以有限數據測試程式、將成功的實作轉移至全面執行,並利用所得日誌更新其研究計劃。至於實體實驗,其輸出則可成為供半自動化實驗室設備使用的機器可讀實驗方案。

寫作階段會接收獲選假設、文獻、原始碼、實驗結果及執行日誌。獨立機制會對抄襲及缺乏支持的聲稱作出懲罰。驗證組件會將論文中的數值陳述與已執行程式碼的記錄輸出作比較,並重寫有出入之處。如不存在有效的執行記錄,系統設計上會停止,而非根據不存在的結果生成論文。

因此,這並非單一程度的自主性。人類參與程度因實驗而異:科學家執行並完善材料工作,專家多次調整生物學任務的框架,而計算架構搜尋在提供初始指令和資源後,則在沒有人為介入下進行。

二、實驗室方案生成三種單層半導體

在材料科學方面,研究人員將 Co-Scientist 連接至一套自訂的半自動化化學氣相沉積系統,用於生長二維材料。

其中一項實驗要求系統為一種類似 Ti₃C₂Tₓ MXene 的碳化鈦材料,找出一條較低危害性的自下而上合成前驅物路線。Co-Scientist 提出以固態六氯乙烷前驅物 C₂Cl₆,並由人類研究人員經過超過 70 次實體實驗完善該路線。

所得層狀材料的繞射、元素及晶格間距測量結果,與 Ti₃C₂Tₓ 的重要特徵一致。它經受住酸氟化物處理,這有助將其與常見的碳化鈦副產物區分。

作者並未聲稱該材料的身份已經確定。生長後氧化及低產率令無法作出確定的原子尺度鑑定。仍需要橫截面原子解析度成像,以判定產物是 Ti₃C₂Tₓ、Ti₂CCl₂,還是另一種相。

第二項實驗聚焦於三種成熟的過渡金屬二硫屬化物半導體:二硫化鉬、二硒化鉬及二硫化鎢——MoS₂、MoSe₂ 和 WS₂。

使用 Gemini 3 Deep Think,Co-Scientist 在數分鐘內將實驗室的設備限制轉化為配方及機器層級的反應器指令。三種單層材料均在首次嘗試成功生長,總實驗時間約一小時。實驗室此前沒有生長 MoSe₂ 或 WS₂ 的經驗,而這兩項結果其後均至少在五次運行中重現。

人員仍負責裝載前驅物和基板、操作部分工作流程,以及表徵產物。快速生成的配方所製得的晶體,亦較經過更長時間優化流程所開發的配方產生的晶體更小且較不規則。

這些方案僅在研究人員的自訂設備上測試。不同反應器幾何結構可改變材料生長行為,因此在此實驗室「一次成功」並不代表可跨實驗室重現。

三、生物學測試預測菌落形態,而非新生物學

合成生物學實驗採用了經工程化的 *E. coli* 菌落,其群游模式會隨化學誘導劑 IPTG 的濃度改變。

Co-Scientist 接收來自邊界濃度的高解析度圖像,並以 Gemini 3 Pro Image 建立視覺流程。對每個保留條件,模型生成 16 張候選菌落圖像,再由次級評估器選出最佳預測。

在進行評估時,輸入圖像尚未公開。預測與在相同實驗條件下生長 24 小時並掃描的實體菌落作比較。

在四項測量——平均半徑、極座標偏心率、圓周強度變化和圓度——中,預測與觀察到的劑量反應軌跡有三項一致。圓度出現顯著偏離,因為生成的菌落傾向看來比真實菌落更具幾何規則性。系統亦正確預測了對照菌株缺乏劑量反應。

這項結果的範圍較預測陌生的生物行為為窄。模型是在已知化學梯度上的觀察點之間作插值;它並沒有外推至新的基因迴路、細菌物種或生長環境。人類專家亦在各輪之間完善任務框架,儘管 Co-Scientist 自行實作了圖像處理架構。

因此,實際用途亦有所限制:可靠的插值可減少篩查期間需要培養和成像的實體條件數量,但此實驗未顯示系統理解導致這些模式的生物機制。

四、一項自主搜尋生成了醫療問答架構

就電腦科學實驗而言,研究人員向 Co-Scientist 下達指令,要求發現一種回答健康問題的代理架構。在該初始設定後,系統自行生成、執行及迭代程式碼,無需進一步人為介入。

它獲提供一個包含 1,282 條合成健康查詢的語料庫、Gemini 3.1 Pro 的介面,以及一個載有結構化臨床指引摘要的工具。最終評估資料集——HealthBench Hard 和 HealthBench Professional——在開發期間均被保留。

所得架構名為 Agent_H,採用八個階段。它按醫療專科、目標受眾、意圖、複雜程度及對抗性風險對查詢分類;分解複雜請求;以多個醫療角色生成 28 至 48 個候選回應;進行錦標賽選出入圍者;由三位評判選出勝者;並進行最多五輪批評與修訂。它亦可審核引文,並將最終答案壓縮至目標長度。

這個流程每條查詢約需要 40 至 80 次語言模型調用。

在兩名自動化評判下,經按篇幅調整分數後,Agent_H 在兩個基準測試中均於六個前沿模型基準之中排名第一。這項條件很重要:Claude Opus 5 在 HealthBench Professional 取得最高未調整分數,而在一位評判下,GPT-5 領先原始 HealthBench Hard 分數。

研究人員早已觀察到,較長的答案會推高評分準則分數。加入篇幅懲罰後,這種表面優勢大部分消失。這個事例顯示,自主優化系統可利用評估指標,而非改善底層任務。

其後,三名獲董事會認證的醫生在九個維度上,將 Agent_H 與未經修改的 Gemini 3.1 Pro 作比較。Agent_H 唯一取得具統計顯著優勢的項目,是降低傷害可能性,所報告的 p 值為 0.0486。其餘八項測量的差異並不顯著,而自動化評判與臨床醫生之間的一致性僅屬輕微至一般。

結果支持較狹義的聲稱,即所發現的保障措施在這項評估中減少了可能有害的答案。它並不證明 Agent_H 在臨床上更優越,或已準備好部署於醫療用途。

五、執行日誌減少虛構的研究聲稱

團隊亦在 50 個 AI 主題上測試完全自主的計算研究。每個主題在三個條件下處理:配備可靠性模組的 Co-Scientist、移除該等模組的同一系統,以及開源 Agent Laboratory 系統作為外部基準。

每次運行均生成一個構思、實驗計劃、Python 程式碼、執行日誌及一篇已編譯論文。三個條件合共生成 150 篇論文。

30 名領域專家——其中 29 人擁有博士學位或博士後職位——進行了 450 次盲審。審稿人將所報告結果與程式碼和日誌作比較,檢查所描述的方法是否與其實作相符,並根據文獻評估可能屬衍生的工作。

配備可靠性功能的 Co-Scientist 所生成論文中,出現足以令結果失效的結果幻覺佔 4%,相比之下,消融系統為 46%,Agent Laboratory 為 90%。因此,常被引用的由 90% 降至 4%,是兩個不同系統之間的比較,並非單一模型的前後測量。

在 50 篇配備可靠性功能的論文中,未錄得極端數據造假個案。消融系統和 Agent Laboratory 的相應比率分別為 40% 和 44%。

這些保障措施並未消除其他誠信問題。論文所描述的方法與實際運行程式碼之間的嚴重不一致,在 Co-Scientist 論文中仍佔 24%,儘管低於消融版本的 52% 和基準系統的 100%。高嚴重程度的衍生或抄襲內容佔 16%,相比分別為 50% 和 60%。

一個雙層安全系統亦拒絕了 700 個有害研究請求中的 691 個,即 98.7%,同時錯誤拒絕了 700 個非有害請求中的 22 個。當初始拒絕篩選器被停用時,在啟用持續監督下,專家審稿人仍將 96.3% 的生成構思和 96.7% 的實驗計劃評為安全。

這些控制措施最適合計算實驗,因為確定性日誌可提供可核查的記錄。論文明確表示,對涉及嘈雜測量、模糊觀察和儀器變異的實體實驗而言,其有效性仍未獲證實。

對研究機構而言,直接含意是執行來源記錄可實質改善 AI 生成的論文——但無法取代程式碼檢查、實驗複現、同行評審或領域專業知識。Google 已透過 Gemini for Science 提供 Co-Scientist 的假設生成功能,但論文未宣布向公眾開放這些實驗所述的完整實驗室整合系統。

常見問題

Gemini 是否自主操作了整個實驗室?

否。它為半自動化反應器工作流程的部分環節生成並執行機器指令,但人員仍負責裝載材料、處理樣本、進行實體實驗及完成表徵。

是否發現了三種此前未知的材料?

否。MoS₂、MoSe₂ 和 WS₂ 均為成熟的單層半導體。系統生成了針對特定設備的配方,並在首次嘗試成功生長它們。另一種 MXene 類材料則尚未獲得確定的原子鑑定。

Agent_H 是否勝過每個接受測試的醫療模型?

僅在經篇幅調整的 HealthBench 分數上如此。部分競爭模型在原始分數中領先,而醫生審稿人只發現降低傷害可能性具有統計顯著優勢。

4% 的幻覺率是否代表生成的論文已可供發表?

否。研究仍發現 Co-Scientist 論文中有 24% 存在嚴重的方法學不一致,而 16% 含有高嚴重程度的衍生內容。評估涵蓋的是計算 AI 研究,而非所有科學學科。

完整的實驗型 Co-Scientist 系統是否公開可用?

論文未宣布可普遍使用實驗室整合配置。Google 另行透過 Gemini for Science 提供實驗性的假設生成功能。

參考來源

Share

分享這篇文章