AI News字數 2799閱讀時長7 分鐘

Microsoft 發布 GigaPath-Flash 及 GigaTIME-Flash,提升病理 AI 效率

Microsoft 的開放權重病理模型將全切片運算量減少 50×,並將空間蛋白質組學的記憶體用量降低近 8×。

文章目錄 · 11
  1. 一、兩款較小型模型,處理不同病理任務
  2. 二、基準測試顯示甚麼
  3. 三、群體規模下的運算量減少
  4. 四、附帶實際條件的開放權重發布
  5. 常見問題
  6. GigaPath-Flash 與 GigaTIME-Flash 有甚麼分別?
  7. GigaPath-Flash 小了多少?
  8. 這些模型是否開源?
  9. 醫院可否將這些模型用於患者照護?
  10. Flash 研究是否已經同儕審查?
  11. 參考來源

Microsoft Research 發布了 GigaPath-Flash 及 GigaTIME-Flash,這兩款較小型的病理模型旨在令全切片分析及虛擬空間蛋白質組學,可實際應用於規模大得多的研究隊列。

核心成果是大幅降低運算量,而非新增臨床能力。GigaPath-Flash 在兩項切片分類基準測試中保留原始 GigaPath 平均表現的 97%,同時使用約少 49.5 倍的浮點運算。GigaTIME-Flash 在所報告測試中,其平均蛋白質預測表現超越原始 GigaTIME,同時運行速度約快六倍,並在所測試的最大批次大小下使用少近八倍 GPU 記憶體。

Microsoft 於 2026 年 8 月 31 日發布公告。隨附的技術報告最初於 7 月 20 日提交至 arXiv,並於 7 月 22 日修訂。這些模型由 Microsoft Research、華盛頓大學、Providence Genomics、Providence Cancer Institute 及 Providence Research Network 共同開發。

一、兩款較小型模型,處理不同病理任務

GigaPath-Flash 將千兆像素病理切片轉換為可支援下游研究任務的表徵,例如腫瘤分類。與原始 GigaPath 一樣,它分兩個階段處理切片:圖塊編碼器提取局部視覺特徵,切片編碼器則結合該等特徵及其空間位置,以建模整個組織的上下文。

Flash 版本以一個 2,200 萬參數的 ViT-S/16 模型,取代 GigaPath 約十億參數的 ViT-g 圖塊編碼器。每個 224 × 224 像素圖塊會轉為一個 384 維嵌入向量。另一個包含約 2,100 萬參數的 12 層 LongNet 切片編碼器,然後透過隨圖塊數量線性擴展的擴張注意力,為嵌入向量加入上下文。

這個較小型編碼器由凍結的十億參數模型蒸餾而成,而非獨立訓練。研究人員使用 Providence 的全切片圖像,以 DINOv2 自監督目標進行訓練,將較大教師模型的表徵轉移至精簡學生模型。其後,切片編碼器以遮罩自動編碼進行預訓練,學習從周邊切片重建圖塊的表徵。

GigaTIME-Flash 的用途不同。它接收常規蘇木精及伊紅染色(hematoxylin-and-eosin,H&E)圖像圖塊,並預測通常透過多重免疫熒光測量的 21 個蛋白質通道的空間圖譜。其發布的實作會產生 23 個輸出通道,包括兩個背景通道。

原始 GigaTIME 使用一個九百萬參數的卷積 U-Net++ 架構。GigaTIME-Flash 則結合蒸餾後的 ViT-S 編碼器與一個二百萬參數的卷積解碼器,合共約 2,380 萬參數。來自四個 Transformer 層的特徵會輸入至連續的解碼器階段,在大部分運算於較低解像度的標記表徵進行時保留空間細節。

適應期間只訓練 LoRA 適配器及解碼器;其他編碼器參數維持凍結。所報告的配置採用 LoRA rank 8、縮放因子 16 及 0.1 dropout。訓練在 NVIDIA A100 硬件上進行 300 個 epochs,所用資料與原始 GigaTIME 比較相同。

二、基準測試顯示甚麼

GigaPath-Flash 在兩個公開的切片級分類資料集上接受評估。PANDA 測試六類前列腺癌分級預測,而 EBRAINS 涵蓋 30 種腦腫瘤亞型。

對於一張包含 31,469 個圖塊的 EBRAINS 切片,研究人員估算 GigaPath-Flash 需 290.3 TFLOPs,相比原始 GigaPath 的 14,367.3 TFLOPs。其 PANDA 二次加權 kappa 為 0.947,相比 GigaPath 的 0.965;EBRAINS 平衡準確率則為 0.705,相比 0.741。

這兩項分數的平均值,GigaPath-Flash 為 0.826,而 GigaPath 為 0.853。這正是 Microsoft 聲稱較小型模型保留約 97% GigaPath 平均表現的依據。

GigaPath-Flash 在兩項基準測試中亦超越研究所納入的所有僅使用圖塊的基線模型。該等模型需要額外的基於注意力的多實例學習元件,才能結合獨立圖塊表徵。在所評估、於全切片級別預訓練的模型之中,GigaPath-Flash 的估算推論成本最低。

這些比較的範圍仍較一般病理評估狹窄。研究人員建立了自訂訓練、驗證及測試分組,每個下游模型均訓練五個 epochs,並為每個資料集報告一次運行結果。因此,這些結果支持受控的效率比較,並不表示 GigaPath-Flash 在各類病理任務上普遍較優。

GigaTIME-Flash 在來自五名肺腺癌患者的 9,204 個已配準圖塊上,以及涵蓋腦癌、乳癌、結腸癌及肺癌的分布外組織微陣列上接受測試。每個外部癌症隊列均包含約 10 至 20 名患者的樣本。

表現以預測與實驗測量蛋白質活化之間的 Pearson 相關係數衡量,並按大致對應個別細胞的視窗進行彙總。GigaTIME-Flash 在原始測試集及全部四個外部隊列上,均取得比 GigaTIME 更高的平均相關係數。

各蛋白質的增益並不一致。GigaTIME-Flash 改善了多項細胞核、上皮、髓系、增殖及細胞凋亡標記的預測。原始卷積模型在部分血管、基質及稀疏淋巴樣圖樣方面仍具競爭力,包括 CD34、Transgelin、Actin 及 CD20。

三、群體規模下的運算量減少

對於 256 × 256 像素輸入,GigaTIME-Flash 需要 14.9 GFLOPs,相比 GigaTIME 的 69.1 GFLOPs——減少約 4.6 倍。

其優勢隨著在 NVIDIA A100 上進行批次處理而擴大。吞吐量由批次大小 1 時每秒 60.3 個圖塊,升至批次大小 128 時每秒 1,679.2 個圖塊。原始 GigaTIME 的上限約為每秒 390 個圖塊。

在批次大小 128 下,GigaTIME-Flash 的峰值 GPU 記憶體為 2.16 GB,GigaTIME 則為 16.68 GB。較新模型按參數數量計較大,但其 Transformer 主幹網絡更能利用現代 GPU 上可高效平行化的矩陣運算;原始模型則在高解像度特徵圖上執行密集卷積及巢狀跳接運算。

Microsoft 估計,假設每張切片有 10,000 個圖塊及批次大小為 128,使用 GigaTIME-Flash 在一張 A100 上為一百萬張切片生成虛擬多重免疫熒光圖譜,約需 70 日。GigaTIME 的相應估計約為 300 日。對於 100,000 張切片,估計分別為七日及 30 日。

這些數字屬推算,而非實際量度的端到端隊列運行結果。實際時間取決於切片尺寸、圖塊切分解像度、預處理、儲存吞吐量、實作及硬件。

此規模之所以重要,是因為原始 GigaTIME 研究將虛擬蛋白質預測應用於 Providence 的 14,256 名患者,涵蓋 24 種癌症及 306 個亞型。研究生成了 299,376 張虛擬蛋白質圖譜,並報告 1,234 項具統計顯著性的蛋白質—生物標記關聯。降低推論成本,令研究更可行地在不同生物標記、患者子集及驗證隊列中重複進行此類分析。

四、附帶實際條件的開放權重發布

Microsoft 及其合作夥伴根據 Apache License 2.0 發布兩個 Flash checkpoint 及其程式碼。GigaPath-Flash 權重透過 Hugging Face 上的 Prov-GigaPath 組織託管,而 GigaTIME-Flash 則透過 Prov-GigaTIME 組織發布。公開 GitHub 儲存庫包括載入說明及推論 notebook。

這些權重設有存取門檻:用戶必須登入、同意儲存庫條款,並在下載前提供唯讀 Hugging Face token。這意味著,該等成品在獲授存取權後可按開放授權使用及檢視,但並非匿名的一鍵下載。

授權條款與所述預定用途之間亦有區別。Apache 2.0 是寬鬆的軟件授權,但兩張模型卡均將 checkpoint 描述為研究資源,並表示已部署的用途,不論商業與否,均不屬其預定範圍。相關資料沒有解釋,模型卡指引應如何與授權所容許的每項使用方式協調,因此考慮部署的機構應先取得澄清,而非將「Apache 2.0」視作已獲臨床或營運批准的證據。

兩個模型均未經驗證可用於診斷、預後、治療選擇或其他患者照護決策。作者呼籲在不同掃描儀、機構、患者群體及下游任務中,進行跨機構及前瞻性驗證。

更廣泛的病理研究支持這項審慎取態。一項獨立的 2026 年研究發現,病理基礎模型可編碼醫院特定的染色、製備及掃描儀特徵,令下游系統依賴機構偽影而非生物學特徵。該研究在較廣泛的一組模型中評估原始 Prov-GigaPath,而非 GigaPath-Flash,因此並不能證明新發布版本存在缺陷。它確實顯示,較低運算量及理想的基準測試分數不能取代跨站點驗證。

常見問題

GigaPath-Flash 與 GigaTIME-Flash 有甚麼分別?

GigaPath-Flash 為整張病理切片建立具上下文的表徵。GigaTIME-Flash 則從常規 H&E 圖像預測空間蛋白質表達圖譜。

GigaPath-Flash 小了多少?

其圖塊編碼器約有 2,200 萬參數,相比原始 GigaPath 約十億參數。其切片編碼器約有 2,100 萬參數,相比此前的 8,600 萬參數。

這些模型是否開源?

程式碼及權重均根據 Apache 2.0 發布,但下載 checkpoint 須有 Hugging Face 帳戶並接受存取條款。因此,「開放權重」是最準確的描述。

醫院可否將這些模型用於患者照護?

不可。Microsoft 及模型卡均指出,這些模型屬研究發布,並非為臨床診斷、預後、治療選擇或其他照護決策而設,亦未就此驗證。

Flash 研究是否已經同儕審查?

Flash 結果目前記載於一篇 arXiv 預印本。原始 GigaPath 及 GigaTIME 研究則分別刊載於 Nature 及 Cell。

參考來源

Share

分享這篇文章