论文解读-Segment anything in medical images
论文代码链接GitHub - bowang-lab/MedSAM: Segment Anything in Medical Images · GitHubhttps://github.com/bowang-lab/MedSAM摘要Medical image segmentation is a core technology in clinical workflows, supporting precise disease diagnosis, treatment planning and long-term disease monitoring. Nevertheless, most existing segmentation algorithms are customized for single imaging modalities or specific diseases, which severely limits their generalization performance across diverse medical segmentation scenarios. To address this limitation, we propose MedSAM, a foundation model built to realize universal medical image segmentation and fill the generalization gap of traditional segmentation models. We train MedSAM on a large-scale dataset containing 1,570,263 image-mask pairs, which covers 10 distinct imaging modalities and more than 30 cancer categories. We perform extensive quantitative and qualitative validation on 86 internal test tasks and 60 external generalization tasks. Experimental results verify that MedSAM achieves superior segmentation accuracy and robustness compared with modality-specific dedicated segmentation models. Capable of fast, precise segmentation for various clinical tasks, MedSAM can greatly accelerate the iteration of medical diagnostic tools and promote personalized treatment development.翻译医学图像分割是临床诊疗流程中的核心技术可为精准疾病诊断、治疗方案规划与病情随访监测提供支撑。但现有分割方法大多仅适配单一成像模态或特定病种难以在多样化医学分割任务中保持稳定泛化能力。针对该痛点本文提出通用医学图像分割基础模型MedSAM以此弥补传统模型泛化能力不足的缺陷。本研究基于包含 1,570,263 组图像 - 掩码配对的大规模医学影像数据集完成模型训练数据集覆盖 10 类成像模态、30 余种癌症病灶。研究在 86 项内部验证任务与 60 项外部泛化任务上开展全面评测实验证明 MedSAM 相比单模态专用分割模型具备更高的分割精度与鲁棒性。MedSAM 可高效、精准完成各类临床分割任务有望推动医学诊断工具快速迭代助力个性化诊疗方案落地。MedSAM 网络架构MedSAM 的整体架构继承自 SAMSegment Anything Model三段式基础结构由图像编码器Image encoder、提示编码器Prompt encoder、掩码解码器Mask decoder三大核心模块串联构成完整推理流程如图所示。首先将原始医学影像作为输入送入图像编码器提取固定维度的图像嵌入Image embedding与此同时人为给定的提示信息图中为包围框 Bounding box prompts经过提示编码器编码得到提示特征图像嵌入与提示特征共同输入掩码解码器最终输出目标区域分割掩码。从本质上看MedSAM 并未改动原生 SAM 的网络拓扑结构核心创新在于采用海量多模态医学影像数据集完成微调将面向自然图像的通用分割大模型适配到复杂多变的临床医学图像场景。图像编码器 Image encoder图像编码器基于 Vision TransformerViT-B搭建负责对输入医学图像进行全局特征提取。对于尺寸为H*W的输入医学图像模型先将图像分块、映射为图像 token经过多层 Transformer 自注意力计算后输出低分辨率、高通道维度的图像嵌入也就是图中标注的 Image embedding。该嵌入只需计算一次在后续多次更换提示框、交互式分割过程中可以重复复用这也是 SAM 系列模型推理高效的关键设计。原生 SAM 训练面向自然照片对 CT、MRI 这类灰度单通道、低对比度、组织边界模糊的医学图像泛化能力较差MedSAM 保留 ViT-B 编码器权重作为初始化参数利用百万级医学图像掩码对微调使编码器能够有效捕捉病灶、器官细微灰度变化与弱边界特征。提示编码器 Prompt encoder提示是引导模型定位分割目标的交互信号图中使用最常用的包围框提示Bounding box prompts除此之外该架构同样支持点提示、掩码提示等多种交互形式。提示编码器负责把人类输入的离散提示信息编码为与图像嵌入维度匹配的提示特征向量 P。包围框坐标经过位置编码嵌入特征空间最终得到提示特征 P。图像嵌入 I 编码图像全局视觉信息提示特征 P 携带 “分割目标在哪里” 的位置先验两类特征融合后送入解码器。在临床场景中医生仅需要绘制简单方框框选感兴趣器官或肿瘤无需完整勾勒轮廓极大降低人工标注成本对应图中多个彩色包围框分别引导模型分割肝脏、肾上腺、脾脏等不同解剖结构。掩码解码器 Mask decoder掩码解码器是最终的预测模块接收融合后的图像特征与提示特征利用多层转置卷积与注意力机制恢复空间分辨率输出二值分割掩码 M 对应图最右侧 Segmentation 结果不同颜色区域代表各个目标器官分割结果。解码器内部引入轻量化跨注意力层实现提示特征与图像特征的精细交互精准还原目标轮廓边界。数学形式上整个前向传播流程可以简写为其中 f_img 代表图像编码器映射函数f_prompt 代表提示编码器映射函数f_decoder 代表掩码解码器映射函数。与传统 U-Net 类模型 “输入图像→直接输出分割图” 范式不同该范式实现图像特征与提示解耦图像特征一次性预计算修改提示框即可多次分割不同目标天然适配交互式医学标注、多器官依次分割的临床工作流。MedSAM 基于该架构的核心改进思路网络骨架和 SAM 完全一致但训练策略是 MedSAM 核心创新。Meta 发布的 SAM 仅使用自然图像数据集缺少医学组织灰度分布、病灶形态先验。MedSAM 构建包含 1,570,263 组图像 - 掩码配对的大规模医学数据集覆盖 CT、MRI、超声、病理等 10 类成像模态、30 余种肿瘤对完整 SAM 模型进行微调。经过医学数据微调后的编码器可以识别软组织、肿瘤等临床特征提示编码器学会理解医学影像内解剖结构包围框解码器适配医学图像模糊组织边界最终实现单模型完成跨模态、跨病种通用分割。