Claude 为 15 个靶点中的 14 个设计了经湿实验验证的蛋白结合剂
Claude 针对 14 个靶点产出了 354 个经确认的蛋白结合剂,不过 Anthropic 的研究缺少匹配的人类对照组。
Anthropic 报告称,Claude 为 15 个靶点中的 14 个设计出了经实验确认的蛋白结合剂,并获得了可解读的实验室结果。在接受测试的 1,320 个设计中,354 个与其预期靶点结合,总命中率为 26.8%。
这一结果超出了让语言模型提出氨基酸序列的范畴。Claude 针对每个靶点开展研究、选择结合位点、安装专业的蛋白设计软件、生成并优化候选方案,并为每个靶点排序出 30 个设计。随后,合同研究机构制备了这些蛋白质,并通过实体实验测量其结合能力。
视模型和项目形式而定,单项命中率介于 22.6% 至 35.1% 之间。Anthropic 将其与根据近期从头蛋白设计项目计算得出的 10%–15% 比率进行比较。这一比较具有参考价值,但并非定论:实验中没有一支在相同软件和相同计算预算下运行的匹配人类团队,而且 Anthropic 的技术报告尚未经过独立同行评审。
一、Anthropic 测试了什么
蛋白结合剂是一种经工程化设计、可附着于另一种蛋白质特定表面的分子。结合可以阻断一种蛋白质、激活它,或提供递送另一种分子的途径。这使结合剂发现与疗法、诊断和生物学研究相关,但结合剂本身并不是药物。
Anthropic 选择了 16 个靶点,包括 EGFR、IL-7Rα、PD-L1、RBX1、TNFα、TREM2、TrkA、VEGF-A,以及两种形式的 GDF-8。成熟 GDF-8 在实验条件下发生聚集,并在两家检测机构均产生非特异性测量结果,因此其 120 个设计被排除。由此剩下 15 个靶点的 1,320 个设计,且结果可解读。
Claude Opus 4.8 和研究模型 Mythos Preview 分别以两种配置接受测试。在多靶点项目中,每个模型在一次 48 小时会话中处理 14 个靶点。在单靶点配置中,Mythos Preview 针对每个靶点获得一次独立的 24 小时会话。Opus 4.8 也针对三个选定靶点单独运行。
每个项目均以一段约 16,000 字的协议提示词开始——约 30,000 个 token——其中说明了蛋白结合剂设计的阶段、相关工具、筛选标准、操作规则及科学阅读清单。它没有规定 Claude 应为任何单个靶点使用的表位、骨架或序列。
人类研究人员选择靶点、准备协议、提供云账户和参考资料、批准访问请求、处理基础设施中断,并订购最终序列。Anthropic 表示,在项目开始后,他们没有干预 Claude 的科学设计决策。
二、Claude 产出了 354 个经确认的结合剂
Opus 4.8 在多靶点项目中从 390 个设计中生成了 88 个结合剂,命中率为 22.6%。Mythos Preview 在同一形式下从 390 个设计中产出了 104 个结合剂,达到 26.7%。
当 Mythos Preview 针对每个靶点获得独立项目时,450 个设计中有 158 个发生结合,即 35.1%。在与其多靶点项目共有的 13 个靶点上,单靶点形式产出了 143 个结合剂,而多靶点形式为 104 个。这一提升伴随着每个靶点显著更多的计算资源,因此该实验并未区分这一差异是源于更高的专注度、额外计算资源,还是两者兼有。
Claude 的排序也包含有用信息。在它为每个靶点和项目排在第一位的候选方案中,49% 发生了结合。技术报告发现,在能够进行该比较的 13 个靶点中,有 12 个靶点上,其排序区分结合剂与非结合剂的能力优于随机水平。
不同靶点的表现差异显著。Claude 在 90 个 TREM2 设计中发现了 72 个结合剂,在 90 个 VEGF-A 设计中发现了 54 个,在 90 个 IL-7Rα 设计中发现了 49 个。另一端,它在针对合成 β-桶 BBF-14 的 90 个设计中发现了 3 个弱结合剂,在针对 15-PGDH 的 30 个设计中发现了 1 个,而在针对麦芽糖结合蛋白的 90 个设计中一个也未发现。
在麦芽糖结合蛋白上的完全失败尤其具有信息价值。Claude 的计算置信度评分将这些候选方案评为与有效靶点设计几乎同样高的水平。因此,该流程在实验室测试前仍无法识别某些靶点层面的失败模式。
三、RBX1 和 TNFα 结果提供了最有力的比较
RBX1 提供了与此前通过 Adaptyv Bio 开展的一项开放竞赛的直接比较。245 个从头设计竞赛参赛作品中有 9 个与 RBX1 结合,而 Claude 的 90 个设计中有 28 个结合。
Anthropic 还让竞赛获胜作品复现,并与 Claude 的候选方案在同一块检测板上进行测试。Claude 的最佳设计在该测试中记录的解离常数,即 K_D,为 3.9 纳摩尔,而竞赛获胜作品测得为 45 纳摩尔。较低的 K_D 表示结合更紧密,因此在这些实验条件下,Claude 的结果约紧密 11 倍。
这比比较不同实验室的测量结果提供了更有力的证据,但仍不能证明 Claude 的表现优于一支受控的人类团队。竞赛参与者受到不同约束,拥有不同的计算预算、工具和提交数量。RBX1 竞赛的结果也被纳入 Claude 的阅读材料。
TNFα 提供了另一种测试。此前已有数种已发表的计算方法报告称,未能为该靶点找到结合剂。Claude 从 150 个候选方案中产出了 12 个结合剂,且全部由 Opus 4.8 而非 Mythos Preview 生成。
这 12 条序列仅来自 4 种不同的结构骨架,因此不应被视为 12 种完全独立的解决方案。不过,其中一些能够与人 TNFα、食蟹猴 TNFα 和小鼠 TNFα 结合。在更广泛的研究中,针对其靶点小鼠版本进行测试的 233 个结合剂中,有 130 个也与之结合,这可能减少动物实验前所需的重新设计工作。
四、Claude 编排专业模型,而非取代它们
Claude 并非仅凭自身语言模型权重生成这些蛋白质。它充当的是一个控制成熟、任务专用蛋白质软件的智能体。
这些项目使用了十个结构生成系统,包括 PXDesign、RFdiffusion3、Genie 3、FreeBindCraft、BoltzGen、RFdiffusion 和 Proteina-Complexa。大多数氨基酸序列由 SolubleMPNN 生成,它是 ProteinMPNN 的一个变体。ESMFold2、ESMFold2-Fast 和 Protenix v2 提供了用于筛选和排序候选方案的主要结构置信度评分。
Claude 选择并安装这些工具,选择靶点区域和表位,分配其计算预算,移除冗余或不可信的序列,并在其判断有价值时进行额外优化。最终交付的蛋白质代表了 24 种结构生成与序列设计方法的组合。
多靶点项目在 48 小时内最多可使用 12,500 个 Nvidia H100 GPU 小时。每个 Mythos 单靶点项目在 24 小时内最多获得 2,500 个 H100 小时。技术报告给出的相应云计算预算为:多靶点项目 50,000 美元,单靶点项目 10,000 美元。
在解读所声称的自动化程度时,这些资源水平很重要。Claude 将原本由人类完成的编排工作压缩至一两天内,但并未消除计算成本、协议中编码的专家知识,或外部合成和湿实验验证所需的数周时间。
五、实验室验证如何进行
Adaptyv Bio 收到了全部 1,320 个设计,通过无细胞合成逐个表达,并主要使用表面等离子体共振测试结合能力。它返回了 1,296 个设计的测量结果,其中包括 61 个表达失败的设计。
Twist Bioscience 收到了 1,260 个设计,不包括针对潜伏态 GDF-8 的设计。它将这些设计作为人 IgG1 Fc 融合蛋白在 HEK293 细胞中表达,并在一个独立的高通量表面等离子体共振平台上测量结合能力。
两家机构使用了不同的蛋白质形式和分类流程。Anthropic 在对响应曲线进行盲法审查后,依据一项已记录的规则合并其测量结果。在两家机构均测试的 1,235 个设计中,它们的初始分类在 1,099 个案例中一致,即 89%,报告的 Cohen's kappa 为 0.71。
这是真实的结合实体实验验证,而不只是计算预测。不过,它并未证实这些蛋白质的原子结构、生物学效应、针对广泛脱靶面板的特异性、在生物体内的稳定性、毒性、药代动力学或治疗疗效。任何设计或结合剂—靶点复合物均未确定实验结构。
六、这一结果改变了什么,又没有改变什么
实际进展在于编排层。蛋白质生成和结构预测模型早已存在,但要有效使用它们,仍需要专家选择靶点表面、安装和组合快速变化的软件、管理大型 GPU 任务、筛除失败方案,并决定哪些序列值得进行昂贵的实验室测试。
Anthropic 的实验表明,一种通用 AI 智能体可以跨多个靶点执行这一工作流程的大部分环节,并返回具有实验产出的排序结果。对于已具备蛋白质评估能力的实验室,这类智能体可以增加尝试的靶点数量,而无需计算专家监督每个软件步骤。
该研究并未表明 Claude 可以自主开发药物。高亲和力迷你结合剂只是早期候选物,并非安全性或疗效的证据。Anthropic 自身指出,迷你结合剂并不是标准治疗模式,后续工程改造、功能测试、毒理学、生产工作和临床试验仍然必要。
这一确切能力也尚未作为交钥匙式 Claude 功能广泛提供。Anthropic 表示,由于双重用途风险,一些高级生物任务仍受限制,并计划建立科学访问计划。不过,它已在 CC BY 4.0 许可下发布项目提示词、预测结构、来源记录和实验测量数据,使研究人员能够审计分析,并将这份包含 1,320 个设计的数据集用作基准。
常见问题
Claude 设计出药物了吗?
没有。Claude 设计的是能够与实验室靶点结合的小型蛋白质。结合是药物开发的早期步骤,但这些候选物并未作为安全或有效的药物进行测试。
Claude 的多少设计成功了?
实验室测试将 1,320 个设计中的 354 个归类为结合剂,总命中率为 26.8%。在 15 个具有可解读测量结果的靶点中,有 14 个至少发现了一个结合剂。
使用了哪些 Claude 模型?
结合剂项目使用了 Claude Opus 4.8 和 Mythos Preview。Mythos 在多靶点模式下达到 26.7%,在独立单靶点项目中达到 35.1%;Opus 在多靶点模式下达到 22.6%。
这些蛋白质是在真实实验室中测试的吗?
是的。Adaptyv Bio 和 Twist Bioscience 使用实体结合实验制备并测量了这些设计。该研究未确定实验性的三维结构或治疗效果。
该研究经过同行评审了吗?
没有。Anthropic 发布了技术报告和底层数据集,但在发布时独立同行评审仍在等待中。
参考来源
Share