AI News字數 3329閱讀時長9 分鐘

Claude 為 15 個目標中的 14 個設計出經濕實驗驗證的蛋白質結合體

Claude 在 14 個目標中產生了 354 個已確認的蛋白質結合體,但 Anthropic 的研究缺乏配對的人類對照組。

Anthropic 報告稱,Claude 為 15 個目標中的 14 個設計出經實驗確認的蛋白質結合體,並取得可解讀的實驗室結果。在 1,320 個受測設計中,有 354 個與預定目標結合,整體命中率為 26.8%。

這項結果不只是要求語言模型提出胺基酸序列。Claude 為每個目標進行研究、選擇結合位點、安裝專門的蛋白質設計軟件、產生及優化候選項目,並為每個目標排列 30 個設計。其後,合約研究機構製造這些蛋白質,並以實體測定法量度其結合情況。

個別命中率視乎模型及研究活動格式而定,介乎 22.6% 至 35.1%。Anthropic 將此與根據近期從頭蛋白質設計研究活動計算出的 10%–15% 比率比較。這個比較有參考價值,但並非定論:實驗沒有安排使用相同軟件及相同運算預算的人類團隊作配對對照,而 Anthropic 的技術報告亦尚未接受獨立同行評審。

一、Anthropic 測試了甚麼

蛋白質結合體是一種經工程設計、可附著於另一種蛋白質特定表面的分子。結合可以阻斷蛋白質、活化蛋白質,或提供遞送另一種分子的途徑。這令結合體發現與治療、診斷及生物學研究相關,但結合體本身並不是藥物。

Anthropic 選擇了 16 個目標,包括 EGFR、IL-7Rα、PD-L1、RBX1、TNFα、TREM2、TrkA、VEGF-A,以及兩種形式的 GDF-8。成熟 GDF-8 在測定條件下聚集,並在兩個測試機構都產生非特異性量度結果,因此其 120 個設計被排除。這留下了橫跨 15 個目標、具有可解讀結果的 1,320 個設計。

Claude Opus 4.8 及研究模型 Mythos Preview 以兩種配置接受測試。在多目標研究活動中,每個模型在一次 48-hour 工作階段內處理 14 個目標。在單目標配置中,Mythos Preview 為每個目標獲得獨立的 24-hour 工作階段。Opus 4.8 亦曾針對三個選定目標分別運行。

每個研究活動均以一段約 16,000-word 的協議提示開始——約 30,000 tokens——當中描述蛋白質結合體設計的階段、相關工具、篩選準則、操作規則及科學閱讀清單。該提示沒有指定 Claude 應為任何個別目標使用的表位、支架或序列。

人類研究人員選擇目標、準備協議、提供雲端帳戶及參考資料、批准存取請求、處理基礎設施中斷,並訂購最終序列。Anthropic 表示,研究活動開始後,他們沒有介入 Claude 的科學設計決策。

二、Claude 產生了 354 個已確認的結合體

Opus 4.8 在其多目標研究活動中,從 390 個設計產生了 88 個結合體,命中率為 22.6%。Mythos Preview 在相同格式下,從 390 個設計產生了 104 個結合體,達到 26.7%。

當 Mythos Preview 為每個目標獲得獨立研究活動時,450 個設計中有 158 個結合,即 35.1%。在與其多目標研究活動共用的 13 個目標中,單目標格式產生了 143 個結合體,相比之下多目標格式為 104 個。這項改善伴隨每個目標大幅增加的運算資源,因此實驗無法分辨差異是來自更集中的工作、額外運算資源,還是兩者兼具。

Claude 的排序亦包含有用資訊。在其為每個目標及研究活動排在首位的候選項目中,49% 會結合。技術報告發現,在可作此比較的 13 個目標中,Claude 的排序在其中 12 個目標上較隨機機會更能區分結合體與非結合體。

表現因目標而有顯著差異。Claude 在 90 個 TREM2 設計中找到 72 個結合體、在 90 個 VEGF-A 設計中找到 54 個,以及在 90 個 IL-7Rα 設計中找到 49 個。另一方面,它在合成 β-barrel BBF-14 的 90 個設計中找到三個弱結合體、在 15-PGDH 的 30 個設計中找到一個,並在麥芽糖結合蛋白的 90 個設計中一個也找不到。

麥芽糖結合蛋白的完全失敗尤其具啟發性。Claude 的計算信心分數給予那些候選項目的評分,幾乎與針對成功目標的設計一樣高。因此,該流程在實驗室測試前仍無法辨識某些目標層面的失敗模式。

三、RBX1 與 TNFα 的結果提供最有力的比較

RBX1 可直接與先前透過 Adaptyv Bio 舉辦的公開競賽作比較。245 個從頭競賽參賽項目中有九個與 RBX1 結合,相比之下 Claude 的 90 個設計中有 28 個結合。

Anthropic 亦安排競賽冠軍的設計重新製作,並與 Claude 的候選項目在同一塊測定板上測試。在該測試中,Claude 的最佳設計錄得解離常數,即 K_D,為 3.9 nanomolar,而競賽冠軍量得 45 nanomolar。較低的 K_D 代表結合更緊密,因此在該測定條件下,Claude 的結果約緊密 11 倍。

這比比較不同實驗室的量度結果更有力,但仍未能證明 Claude 勝過受控的人類團隊。競賽參加者有不同限制、運算預算、工具及提交數量。RBX1 競賽的結果亦被納入 Claude 的閱讀資料中。

TNFα 呈現了另一種測試。數個已發表的計算方法先前均報告未能為這個目標找到結合體。Claude 從 150 個候選項目中產生了 12 個結合體,全部由 Opus 4.8 而非 Mythos Preview 產生。

這 12 個序列僅來自四種不同的結構骨架,因此不應視為 12 個完全獨立的解決方案。然而,部分序列仍可與人類、食蟹猴及小鼠 TNFα 結合。在更廣泛的研究中,233 個針對其目標小鼠版本接受測試的結合體中,有 130 個亦能與其結合,這或可減少動物實驗前所需的重新設計工作。

四、Claude 編排專門模型,而非取代它們

Claude 並非單靠其語言模型權重產生蛋白質。它的角色是控制既有、針對特定任務的蛋白質軟件的代理。

研究活動使用了十個結構產生系統,包括 PXDesign、RFdiffusion3、Genie 3、FreeBindCraft、BoltzGen、RFdiffusion 及 Proteina-Complexa。大部分胺基酸序列由 SolubleMPNN 產生,它是 ProteinMPNN 的一個變體。ESMFold2、ESMFold2-Fast 及 Protenix v2 提供主要的結構信心分數,用於篩選及排列候選項目。

Claude 選擇及安裝這些工具、選擇目標區域及表位、分配其運算預算、移除冗餘或不合理的序列,並在其判斷值得時進行額外優化。交付的蛋白質代表了 24 種結構產生與序列設計方法的組合。

多目標研究活動在 48 hours 內最多可使用 12,500 Nvidia H100 GPU-hours。每個單目標 Mythos 研究活動在 24 hours 內最多可使用 2,500 H100 hours。技術報告描述,相應的雲端運算預算為多目標研究活動 $50,000,單目標研究活動則為 $10,000。

在解讀所聲稱的自動化時,這些資源水平很重要。Claude 將人類編排工作壓縮至一或兩日,但並未消除運算成本、協議中編碼的專家知識,或外部合成及濕實驗驗證所需的數星期時間。

五、實驗室驗證如何進行

Adaptyv Bio 收到全部 1,320 個設計,透過無細胞合成逐一表達,並主要以表面等離子體共振測試結合情況。它為 1,296 個設計交回量度結果,其中包括 61 個未能表達的設計。

Twist Bioscience 收到 1,260 個設計,不包括針對 latent GDF-8 的設計。它們將設計作為人類 IgG1 Fc 融合蛋白,在 HEK293 細胞中表達,並在另一個高通量表面等離子體共振平台量度結合情況。

兩個機構使用不同的蛋白質格式及分類程序。Anthropic 在盲法審閱反應軌跡後,按已記錄的規則整合其量度結果。在兩個機構均有測試的 1,235 個設計中,其初步分類在 1,099 宗個案中一致,即 89%,報告的 Cohen's kappa 為 0.71。

這是對結合的真正實體驗證,而非僅是計算預測。不過,這並未證實蛋白質的原子結構、生物學效應、在廣泛脫靶面板中的特異性、在生物體內的穩定性、毒性、藥物代謝動力學或治療效力。沒有任何設計或結合體—目標複合物獲得實驗結構測定。

六、這項結果改變了甚麼,以及沒有改變甚麼

實際的進展在於編排層。蛋白質產生及結構預測模型早已存在,但要有效運用它們,仍需要專家選擇目標表面、安裝及組合快速演變的軟件、管理大型 GPU 工作、篩除失敗項目,以及決定哪些序列值得接受昂貴的實驗室測試。

Anthropic 的實驗顯示,通用 AI 代理可以跨越多個目標執行這個工作流程的大部分,並交回在實驗上具有成效的排序。對已具備評估蛋白質能力的實驗室而言,這類代理可增加可嘗試的目標數目,而毋須由計算專家監督每一個軟件步驟。

研究並未顯示 Claude 可以自主開發藥物。高親和力迷你結合體只是早期候選項目,而非安全性或療效的證據。Anthropic 本身亦指出,迷你結合體並非標準治療模式,後續工程、功能測試、毒理學、製造工作及臨床試驗仍然必要。

這項確切能力亦未作為可直接使用的 Claude 功能廣泛提供。Anthropic 表示,由於雙重用途風險,某些先進生物學任務仍受限制,並計劃建立科學存取計劃。不過,它已按 CC BY 4.0 授權釋出研究活動提示、預測結構、來源記錄及實驗量度資料,讓研究人員可審核分析,並使用這個 1,320-design 數據集作為基準。

常見問題

Claude 有設計出藥物嗎?

沒有。Claude 設計的是可與實驗室目標結合的小型蛋白質。結合是藥物開發的早期步驟,但這些候選項目並未作為安全或有效的藥物接受測試。

Claude 有多少個設計成功?

實驗室測試將 1,320 個設計中的 354 個分類為結合體,整體命中率為 26.8%。在 15 個具有可解讀量度結果的目標中,有 14 個至少找到一個結合體。

使用了哪些 Claude 模型?

結合體研究活動使用 Claude Opus 4.8 及 Mythos Preview。Mythos 在多目標模式達到 26.7%,在分開進行的單目標研究活動達到 35.1%;Opus 在多目標模式達到 22.6%。

這些蛋白質有在真正的實驗室測試嗎?

有。Adaptyv Bio 及 Twist Bioscience 使用實體結合測定法製造及量度這些設計。研究未有測定實驗性的三維結構或治療效應。

這項研究是否經同行評審?

否。Anthropic 發表了技術報告及底層數據集,但在發表時仍等待獨立同行評審。

參考來源

Share

分享這篇文章