Gemini Co-Scientist 从假设走向现实世界实验
Google 的 Gemini Co-Scientist 设计了实验室方案,预测了细菌形态,构建了医疗 AI 智能体,并审查了由 AI 撰写的论文。
文章目录 · 12
Google 研究人员已将 Gemini Co-Scientist 从一个提出科学假设的系统,扩展为能够设计实验、生成可执行方案、分析结果,并撰写与执行记录关联的论文的系统。
相关结果发表于 *Accelerating Scientific Research with Gemini in the Real-World*,这是一篇于 2026 年 8 月 27 日提交至 arXiv 的预印本。该研究报告了涵盖材料科学、合成生物学、医疗 AI 架构设计和自主计算研究的实验。
最具体的进展并不只是 AI 生成了科学文本,而是该系统的不同版本与实验证据相连接:化学气相沉积反应器的机器指令、未公开的工程菌落图像、已执行的源代码,以及用于核查生成论文中论断的确定性日志。
报告的结果可观,但仍属初步。新论文尚未经过外部同行评审,大多数物理实验仍需要科学家参与,且多项发现存在重要的可重复性或评估局限。
一、Co-Scientist 现已覆盖更多研究周期环节
Google 最初将 Co-Scientist 介绍为一个基于 Gemini、用于结构化假设生成的多智能体系统。其 2026 年 5 月发表于 Nature 的论文描述了专门负责生成、批评、排序和演化候选假设的智能体。科学家提供研究目标、约束条件和反馈,而系统则搜索文献并组织一场“idea tournament”。
新配置在该工作流程中加入了实验和论文生成。
在构思阶段,候选假设会获得独立的文献综述、安全筛查,以及对新颖性、可信性和可测试性的评估。贝叶斯排序过程选择候选假设进行进一步发展,演化操作则组合或修订有前景的想法。
在计算实验阶段,系统生成程序,在有限数据上测试程序,将成功的实现转入全规模执行,并利用生成的日志更新研究计划。对于物理实验,其输出则可以成为供半自动化实验室设备使用的机器可读方案。
写作阶段接收所选假设、文献、源代码、实验结果和执行日志。独立机制会对抄袭和缺乏支持的论断施加惩罚。验证组件将论文中的数值表述与已执行代码的记录输出进行比对,并重写不一致之处。如果不存在有效的执行记录,系统被设计为停止,而不是基于不存在的结果生成论文。
因此,这并不是单一层级的自主性。不同实验中的人工参与程度各不相同:科学家执行并完善材料研究,专家反复调整生物学任务的设定,而计算架构搜索在获得初始指令和资源后无需人工干预即可进行。
二、实验室方案制备出三种单层半导体
在材料科学实验中,研究人员将 Co-Scientist 接入一套定制的半自动化化学气相沉积系统,该系统用于生长二维材料。
一项实验要求系统为一种类似 Ti₃C₂Tₓ MXene 的碳化钛材料的自下而上合成,识别一条危害较低的前体路线。Co-Scientist 提出了固体六氯乙烷前体 C₂Cl₆,随后人类研究人员通过 70 多次物理实验完善了该路线。
所得层状材料的衍射、元素和晶格间距测量结果,与 Ti₃C₂Tₓ 的重要特征一致。它经受住了酸-氟化物处理,这有助于将其与常见的碳化钛副产物区分开来。
作者并未声称该材料的身份已经确定。生长后的氧化和低产率阻碍了确定性的原子尺度判定。仍需进行横截面原子分辨率成像,以确定产物是 Ti₃C₂Tₓ、Ti₂CCl₂,还是另一种物相。
第二项实验聚焦于三种已知的过渡金属二硫属化物半导体:二硫化钼、二硒化钼和二硫化钨——MoS₂、MoSe₂ 和 WS₂。
借助 Gemini 3 Deep Think,Co-Scientist 在数分钟内将实验室的设备约束转化为配方和机器级反应器指令。三种单层材料均在首次尝试中成功生长,总实验时间约为一小时。该实验室此前没有生长 MoSe₂ 或 WS₂ 的经验,随后这两项结果均在至少五次运行中得到了复现。
人类仍负责装载前体和衬底、操作工作流程的部分环节,并对产物进行表征。快速生成的配方所得到的晶体,也比经过更长时间优化过程开发出的配方所得到的晶体更小、更不规则。
这些方案仅在研究人员的定制设备上接受过测试。不同的反应器几何结构可能改变材料生长行为,因此该实验室中的“一次成功”并不能证明跨实验室可重复性。
三、生物学测试预测的是菌落形态,而非新的生物学现象
合成生物学实验使用了经过工程改造的 *E. coli* 菌落,其群集扩散模式会随化学诱导剂 IPTG 的浓度而变化。
Co-Scientist 接收了来自边界浓度条件的高分辨率图像,并围绕 Gemini 3 Pro Image 构建了视觉处理管线。对于每个留出的条件,模型生成 16 张候选菌落图像,再由一个次级评估器选出最佳预测。
评估进行时,输入图像尚未公开。研究人员将预测结果与在相同实验条件下生长 24 小时并扫描得到的实体菌落进行比较。
在四项测量指标——平均半径、极坐标偏心率、周向强度变化和圆度——中,预测与观测到的剂量-反应轨迹在其中三项上一致。圆度出现显著偏离,因为生成的菌落往往比真实菌落看起来更具几何规则性。系统还正确预测了对照菌株不存在剂量反应。
这一结果的范围比预测陌生的生物学行为更窄。模型是在已知化学梯度上已观测点之间进行插值;它没有外推至新的遗传回路、细菌物种或生长环境。尽管 Co-Scientist 自行实现了图像处理架构,但人类专家也在各轮之间完善了任务设定。
相应地,其实际用途也受到限制:可靠的插值可减少筛选过程中需要培养和成像的物理条件数量,但该实验并未表明系统理解了导致这些模式的生物学机制。
四、一项自主搜索产生了医疗问答架构
在计算机科学实验中,研究人员向 Co-Scientist 下达了发现用于回答健康问题的智能体架构这一指令。在初始设置之后,系统无需进一步人工干预即可生成、执行和迭代代码。
系统获得了由 1,282 条合成健康查询组成的语料库、一个连接 Gemini 3.1 Pro 的接口,以及一个包含结构化临床指南摘要的工具。最终评估集——HealthBench Hard 和 HealthBench Professional——在开发期间被保留。
所得架构名为 Agent_H,共使用八个阶段。它按医学专科、目标受众、意图、复杂性和对抗性风险对查询进行分类;分解复杂请求;通过多个医学角色生成 28 至 48 个候选回答;运行锦标赛选出决赛候选;使用三名评审选出获胜者;并进行最多五轮批评与修订。它还可以审查引文,并将最终答案压缩至目标长度。
这一过程每个查询约需要 40 至 80 次语言模型调用。
在两名自动化评审的评估下,Agent_H 在根据冗长度调整分数后,于两个基准上均在六个前沿模型基线中排名第一。这一限定很重要:Claude Opus 5 在 HealthBench Professional 上拥有最高的未调整分数,而在一名评审的评估下,GPT-5 领跑原始 HealthBench Hard 分数。
研究人员此前已观察到,较长的答案会抬高量表分数。一旦加入长度惩罚,这种表面上的优势很大一部分便消失了。这一案例表明,自主优化系统可能利用评估指标,而非改进底层任务。
随后,三名经委员会认证的医生从九个维度比较了 Agent_H 与未经修改的 Gemini 3.1 Pro。Agent_H 仅在降低伤害发生可能性方面取得统计显著优势,报告的 p 值为 0.0486。其他八项指标的差异并不显著,自动化评审与临床医生之间的一致性也仅为轻微至一般。
该结果支持一项更狭义的论断:所发现的安全防护措施在此次评估中减少了潜在有害回答。它并不能证明 Agent_H 在临床上更优,或已准备好部署于医疗场景。
五、执行日志减少了捏造的研究论断
团队还在 50 个 AI 主题上测试了完全自主的计算研究。每个主题均在三种条件下处理:配备可靠性模块的 Co-Scientist、移除这些模块的同一系统,以及作为外部基线的开源 Agent Laboratory 系统。
每次运行都会产生一个想法、实验计划、Python 代码、执行日志和一篇编译完成的论文。三种条件合计生成了 150 篇论文。
30 名领域专家——其中 29 人拥有博士学位或博士后职位——进行了 450 次盲审。评审者将报告的结果与代码和日志进行比较,核查所描述的方法是否与其实现相符,并依据文献评估可能存在的衍生性工作。
配备可靠性模块的 Co-Scientist 所生成论文中,导致结果失效的幻觉出现在 4% 的论文中;而经消融的系统为 46%,Agent Laboratory 为 90%。因此,常被引用的从 90% 降至 4% 的幅度,是两个不同系统之间的比较,而非同一模型简单的前后测量。
在 50 篇配备可靠性模块的论文中,未记录到极端数据捏造的案例。经消融系统和 Agent Laboratory 的相应比例分别为 40% 和 44%。
这些安全防护措施并未消除其他诚信问题。论文所描述的方法与实际运行代码之间的严重不一致,在 Co-Scientist 论文中仍占 24%,尽管低于经消融版本的 52% 和基线系统的 100%。高严重度的衍生或抄袭内容分别出现在 16%、50% 和 60% 的论文中。
双层安全系统还拒绝了 700 个有害研究请求中的 691 个,即 98.7%,同时错误拒绝了 700 个无害请求中的 22 个。当初始拒绝过滤器被禁用时,在持续监督启用的情况下,专家评审者仍将生成想法的 96.3% 和实验计划的 96.7% 评为安全。
这些控制措施最适用于计算实验,因为确定性日志能够提供可核查的记录。论文明确指出,对于涉及噪声测量、模糊观测和仪器变化的物理实验,其有效性仍未得到证实。
对于研究机构而言,直接含义是,执行溯源可以实质性改善 AI 生成的论文——但它无法取代代码检查、实验复现、同行评审或领域专业知识。Google 已通过 Gemini for Science 提供 Co-Scientist 的假设生成功能,但该论文并未宣布向公众开放这些实验中所描述的完整实验室集成系统。
常见问题
Gemini 是否自主操作了整个实验室?
没有。它为半自动化反应器工作流程的部分环节生成并执行了机器指令,但人类负责装载材料、处理样品、运行物理实验和进行表征。
是否发现了三种此前未知的材料?
没有。MoS₂、MoSe₂ 和 WS₂ 是已知的单层半导体。系统生成了针对特定设备的配方,并在首次尝试中成功生长出它们。另一种类似 MXene 的材料尚未获得确定性的原子尺度判定。
Agent_H 是否优于测试中的所有医疗模型?
仅在经过长度调整的 HealthBench 分数上如此。一些竞争模型在原始分数上领先,而医生评审者仅在降低伤害发生可能性方面发现了统计显著优势。
4% 的幻觉率是否意味着生成的论文已可发表?
没有。该研究仍在 Co-Scientist 论文中发现了 24% 的严重方法学不一致,以及 16% 的高严重度衍生内容。该评估涵盖的是计算 AI 研究,而非所有科学学科。
完整的实验型 Co-Scientist 系统是否已向公众开放?
论文并未宣布向公众开放实验室集成配置。Google 则通过 Gemini for Science 单独提供实验性的假设生成访问权限。
参考来源
Share