AI News字数 2860阅读时长8 分钟

微软发布 GigaPath-Flash 和 GigaTIME-Flash,提升病理 AI 效率

微软的开放权重病理模型将全切片计算量降低 50 倍,并将空间蛋白质组学的内存使用量减少近 8 倍。

文章目录 · 11
  1. 一、面向不同病理任务的两款小型模型
  2. 二、基准测试显示了什么
  3. 三、群体规模下的计算量降低
  4. 四、附带实际条件的开放权重发布
  5. 常见问题
  6. GigaPath-Flash 和 GigaTIME-Flash 有什么区别?
  7. GigaPath-Flash 小了多少?
  8. 这些模型是开源的吗?
  9. 医院可以将这些模型用于患者护理吗?
  10. Flash 研究是否经过同行评审?
  11. 参考来源

微软研究院发布了 GigaPath-Flash 和 GigaTIME-Flash,这两款更小型的病理模型旨在让全切片分析和虚拟空间蛋白质组学能够应用于规模大得多的研究队列。

其核心成果是显著降低计算量,而非带来新的临床能力。GigaPath-Flash 在两个切片分类基准测试中保留了原始 GigaPath 平均性能的 97%,同时使用的浮点运算次数约少 49.5 倍。在报告的测试中,GigaTIME-Flash 的平均蛋白质预测性能超过原始 GigaTIME,运行速度约快六倍,并且在测试的最大批量大小下 GPU 内存使用量减少近八倍。

微软于 2026 年 8 月 31 日发布公告。配套技术报告于 7 月 20 日首次提交至 arXiv,并于 7 月 22 日修订。这些模型由微软研究院、华盛顿大学、Providence Genomics、Providence Cancer Institute 和 Providence Research Network 联合完成。

一、面向不同病理任务的两款小型模型

GigaPath-Flash 将十亿像素级病理切片转换为表征,可支持肿瘤分类等下游研究任务。与原始 GigaPath 一样,它分两个阶段处理切片:图块编码器提取局部视觉特征,切片编码器则将这些特征与其空间位置结合,以建模整个组织范围的上下文。

Flash 版本以一个拥有 2200 万参数的 ViT-S/16 模型,取代了 GigaPath 约 10 亿参数的 ViT-g 图块编码器。每个 224×224 像素的图块会转换为一个 384 维嵌入。随后,一个包含约 2100 万参数的独立 12 层 LongNet 切片编码器,利用随图块数量线性扩展的扩张注意力机制对这些嵌入进行上下文化处理。

这个较小的编码器由冻结的 10 亿参数模型蒸馏而来,而非独立训练。研究人员在来自 Providence 的全切片图像上使用 DINOv2 自监督目标,将大型教师模型的表征迁移至紧凑型学生模型。此后,切片编码器通过掩码自编码进行预训练,学习根据切片周边区域重建一个图块的表征。

GigaTIME-Flash 服务于不同的用途。它接收常规苏木精—伊红染色,即 H&E,图像图块,并预测通常通过多重免疫荧光测量的 21 个蛋白质通道的空间图谱。其发布的实现会生成 23 个输出通道,其中包括两个背景通道。

原始 GigaTIME 使用了一个拥有 900 万参数的卷积 U-Net++ 架构。GigaTIME-Flash 则将蒸馏后的 ViT-S 编码器与一个拥有 200 万参数的卷积解码器相结合,总参数量约为 2380 万。来自四个 Transformer 层的特征输入连续的解码器阶段,在大部分计算发生于较低分辨率的词元表征中时保留空间细节。

适配期间仅训练 LoRA 适配器和解码器;其余编码器参数保持冻结。报告的配置使用 LoRA 秩 8、缩放因子 16 和 0.1 的 dropout。训练在 NVIDIA A100 硬件上进行 300 个 epoch,使用与原始 GigaTIME 对比相同的数据。

二、基准测试显示了什么

GigaPath-Flash 在两个公开的切片级分类数据集上进行了评估。PANDA 测试六类别前列腺癌分级预测,而 EBRAINS 覆盖 30 种脑肿瘤亚型。

对于一张包含 31,469 个图块的 EBRAINS 切片,研究人员估计 GigaPath-Flash 需要 290.3 TFLOPs,而原始 GigaPath 为 14,367.3 TFLOPs。其 PANDA 二次加权 kappa 为 0.947,GigaPath 为 0.965;其 EBRAINS 平衡准确率为 0.705,GigaPath 为 0.741。

这两个分数的平均值,GigaPath-Flash 为 0.826,GigaPath 为 0.853。这正是微软声称该小型模型保留了 GigaPath 平均性能约 97% 的依据。

GigaPath-Flash 在两个基准测试中也超过了研究纳入的所有仅使用图块的基线模型。这些模型需要额外的基于注意力的多实例学习组件,以组合独立的图块表征。在所评估的全切片级预训练模型中,GigaPath-Flash 的估计推理成本最低。

这些比较的范围仍小于一般性的病理评估。研究人员创建了自定义的训练、验证和测试划分,将每个下游模型训练五个 epoch,并针对每个数据集报告一次运行结果。因此,这些结果支持受控条件下的效率比较,而非宣称 GigaPath-Flash 在所有病理任务中普遍更优。

GigaTIME-Flash 在来自五名肺腺癌患者的 9,204 个配准图块上进行了测试,也在覆盖脑癌、乳腺癌、结肠癌和肺癌的分布外组织微阵列上进行了测试。每个外部癌症队列包含约 10 至 20 名患者的样本。

性能通过预测与实验测得蛋白质活性之间的 Pearson 相关性衡量,并在大致对应单个细胞的窗口上进行聚合。GigaTIME-Flash 在原始测试集和全部四个外部队列中均取得了高于 GigaTIME 的平均相关性。

不同蛋白质的提升并不一致。GigaTIME-Flash 改善了若干核、上皮、髓系、增殖和凋亡标志物的预测。原始卷积模型在部分血管、基质和稀疏淋巴样模式上仍具竞争力,包括 CD34、Transgelin、Actin 和 CD20。

三、群体规模下的计算量降低

对于 256×256 像素输入,GigaTIME-Flash 需要 14.9 GFLOPs,而 GigaTIME 需要 69.1 GFLOPs,减少约 4.6 倍。

在 NVIDIA A100 上,其优势随批处理增大而扩大。吞吐量从批量大小为 1 时的每秒 60.3 个图块,提升至批量大小为 128 时的每秒 1,679.2 个图块。原始 GigaTIME 则在每秒约 390 个图块时达到平台期。

在批量大小为 128 时,GigaTIME-Flash 的峰值 GPU 内存为 2.16 GB,GigaTIME 为 16.68 GB。较新模型的参数量更大,但其 Transformer 主干更充分地利用了可在现代 GPU 上高效并行的矩阵运算;原始模型则在高分辨率特征图上执行密集卷积和嵌套跳跃操作。

微软估计,若假设每张切片有 10,000 个图块且批量大小为 128,使用 GigaTIME-Flash 在一张 A100 上为 100 万张切片生成虚拟多重免疫荧光图谱约需 70 天。GigaTIME 的相应估计约为 300 天。对于 100,000 张切片,估计时间分别为七天和 30 天。

这些数字是预测值,而非实测的端到端队列运行结果。实际时间取决于切片尺寸、图块划分分辨率、预处理、存储吞吐量、实现方式和硬件。

这一规模十分重要,因为原始 GigaTIME 研究对来自 Providence 的 14,256 名患者、涵盖 24 种癌症类型和 306 种亚型进行了虚拟蛋白质预测。该研究生成了 299,376 张虚拟蛋白质图谱,并报告了 1,234 项具有统计显著性的蛋白质—生物标志物关联。降低推理成本使得在替代生物标志物、患者子集和验证队列中重复此类分析更具可行性。

四、附带实际条件的开放权重发布

微软及其合作者在 Apache License 2.0 下发布了两个 Flash 检查点及其代码。GigaPath-Flash 权重通过 Hugging Face 上的 Prov-GigaPath 组织托管,而 GigaTIME-Flash 通过 Prov-GigaTIME 组织发布。公开 GitHub 仓库包含加载说明和推理 notebook。

这些权重受访问控制:用户必须登录、同意仓库条款,并在下载前提供只读 Hugging Face token。这意味着这些资源在获得访问权限后可在开放许可下使用和审查,但并非匿名的一键下载。

许可证与声明的预期用途之间也存在区别。Apache 2.0 是宽松的软件许可证,但两份模型卡都将检查点描述为研究资源,并表示无论商业与否,部署用途都不属于其预期范围。这些材料没有说明应如何将该模型卡指导与许可证允许的每一种用途相协调,因此考虑部署的组织应获得澄清,而不应将“Apache 2.0”视为临床或运营批准的证据。

两款模型均未针对诊断、预后、治疗选择或其他患者护理决策进行验证。作者呼吁在扫描仪、机构、患者群体和下游任务之间开展多机构和前瞻性验证。

更广泛的病理研究支持这一谨慎态度。一项独立的 2026 年研究发现,病理基础模型可能编码医院特有的染色、制备和扫描仪特征,使下游系统依赖机构伪影而非生物学特征。该研究在更广泛的一组模型中评估了原始 Prov-GigaPath,而非 GigaPath-Flash,因此并不能证明新发布版本存在缺陷。但它说明了为什么较低的计算量和良好的基准分数不能替代跨站点验证。

常见问题

GigaPath-Flash 和 GigaTIME-Flash 有什么区别?

GigaPath-Flash 创建全病理切片的上下文化表征。GigaTIME-Flash 则从常规 H&E 图像预测空间蛋白质表达图谱。

GigaPath-Flash 小了多少?

其图块编码器约有 2200 万参数,而原始 GigaPath 约有 10 亿参数。其切片编码器约有 2100 万参数,而此前为 8600 万参数。

这些模型是开源的吗?

代码和权重均在 Apache 2.0 下发布,但下载检查点需要 Hugging Face 账户并接受访问条款。因此,“开放权重”是最准确的描述。

医院可以将这些模型用于患者护理吗?

不可以。微软和模型卡表示,这些模型是研究发布版本,并非旨在或验证用于临床诊断、预后、治疗选择或其他护理决策。

Flash 研究是否经过同行评审?

Flash 结果目前记录于一篇 arXiv 预印本中。原始 GigaPath 和 GigaTIME 研究则分别发表于 Nature 和 Cell。

参考来源

Share

分享这篇文章