
FlanSFlanS:A Foundation Model for Free-Form Language-based Segmentation in Medical ImagesKDD 2025FLanS用于医学图像中基于自由形式语言进行分割的基础模型它研究的问题是用户不再需要画框、点选病灶或只输入器官名称而是可以用一整句自然语言让模型在医学图像中分割目标区域。例如“请分割右肾。”“请分割图像中最靠左的器官。”“患者疑似胆结石请关注相关器官。”它和 LViT、ARSeg 的区别在于后两者主要使用结构化、较固定的医学描述FLanS 更强调自由表达的文本句式可以灵活、甚至不直接出现器官名称。论文想解决的问题医学分割缺少“图像—自由文本—mask”配对数据大量公开医学分割数据只有图像器官类别分割掩膜却没有“这张图应如何用自然语言描述并指向该器官”的标注。FLanS 用RAG检索增强生成自动产生文本提示收集约 7,000 份医生书写的临床报告并筛出 4,990 条与 24 个器官相关的诊疗记录再结合非医学人员的提问方式与 GPT-4o 生成的合成问句根据器官标签、临床语料和检索到的相似描述让大语言模型生成自然的分割请求。因此无需人工逐图写文本也能构建大规模“文本—图像—掩膜”训练对。两类文本任务解剖知识型提示用户可能知道器官或疾病相关知识但不一定直接说出器官名称。例如“请检查这张 CT 中与肝硬化相关的区域。”虽然没有直说 “liver”模型需要理解“肝硬化”与肝脏有关再分割肝脏。解剖无关型提示用户不需要医学知识只按图像中的视觉位置或大小提问例如“分割最大的器官。”“分割最靠左的器官。”“分割最上方的器官。”作者从真实 mask 的边界框自动判断最大、最小、最左、最右、最上、最下等空间属性再让 RAG 模块把这些属性扩写成自然语言。这类能力很有意思模型不是只会“器官名称 → mask”还要理解“最大”“最左”等语义。FLanS 的模型结构它基于 SAM 风格的三部分图像编码器文本编码器Mask Decoder其中主要有三项设计RAG 自由文本生成器作用是批量生成多样化的自然语言提示使训练文本更接近真实医生或普通用户的说法。例如对于胆囊不只训练“Segment gallbladder.”还会训练与胆结石、胆囊炎、腹部检查相关的不同表达。CLIP 文本编码器 意图分类头自由文本先由 CLIP 文本编码器变为向量再经过一个“意图分类头”。这个分类头的作用是辅助模型明确这段文本最终指向的是哪一个器官类别。训练时同时优化其中最后一项让文本向量更能区分不同器官的分割意图避免“肝脏相关描述”和“肾脏相关描述”在语义空间混淆方向规范化模块CT 的摆放方向可能不一致。比如人体真正的“右肾”在某些翻转后的图像中可能显示在画面左侧。若模型只学“右边的肾”就会犯错。FLanS 在分割前先把任意方向的图像映射到统一、标准的解剖方向再根据文本分割最后再将 mask 映射回原始图像坐标。因此它能区分right kidney人体解剖学上的右肾kidney on the right side of the image画面右侧的肾。这对包含左右、上下等位置词的医学文本尤其重要。数据集与实验设置论文使用了 7 个公开 CT 数据集覆盖 24 个器官包括MSDBTCVWORDAbdomenCT-1KFLARE22CHAOSRAOS训练约使用1,089 个 CT 扫描91,344 张训练验证切片9,873 张测试切片12,120 条训练文本查询其中 11,520 条为解剖知识型、600 条为空间大小型。注意这些文本绝大多数是 RAG 自动生成的并非公开数据集原始自带的人工文本标注。实验结果说明在自由文本分割上FLanS 优于 BiomedParse、CLIP MedSAM、MedCLIP MedSAM 等对比方法。而且把测试 CT 随机旋转翻转后FLanS 依然保持较高性能说明方向规范化模块确实有效。消融实验说明文本意图对齐、图像编码器微调、增强训练和方向规范化共同构成了模型性能的基础摘要医学影像对于诊断患者健康状况至关重要而对这些影像进行准确分割是分离感兴趣区域、实现精准诊断与治疗规划的基础。现有方法主要依赖边界框或点等提示方式然而尽管临床医生常用自然语言描述观察结果和下达指令针对文本提示的研究却相对较少。为填补这一空白我们首先提出了一种基于 RAG检索增强生成的自由形式文本提示生成器。该生成器利用医学领域语料库生成多样化且更贴近真实临床表达的描述。随后我们提出了一种新的医学图像分割模型FLanS。它能够处理多种自由形式文本提示包括具有专业解剖知识的查询不依赖器官名称、由空间位置驱动的查询不依赖器官名称、由大小信息驱动的查询。此外模型还引入了一个具有对称性感知能力的规范化模块。该模块能够在扫描图像方向不一致时仍输出稳定且准确的分割结果并减少模型对“器官在人体解剖学上的位置”与“器官在当前图像画面中的位置”之间的混淆。FLanS 在来自 7 个公开数据集、总计超过 10 万张医学图像的大规模数据上进行训练。大量实验表明该模型在语言理解能力、分割精度以及理解文本与医学图像对应关系方面表现优异在域内数据集和域外数据集上均优于现有最先进方法。论文的代码和预训练模型可在其已发布的项目页面中获取。理解RAG检索增强生成为了弥补“医学分割数据只有图像和 mask、却缺少自然语言描述”这个问题作者设计了一个自动生成文本提示的系统。它会先从医学领域语料中检索与目标器官相关的真实表达再让大语言模型据此生成多样、自然、符合医学语境的分割描述因此作者不需要人工为每一张 CT 图像逐条撰写文本标注也能把原本的CT 图像器官 mask自动扩展为CT 图像自由文本提示器官 mask“多样化且真实”指的是文本既有不同句式和说法又尽量模仿临床记录中的医学表达而不是完全由模型凭空编造图一图1两种语言引导分割类型的示例。(1)来自电子病历EMR的专业诊断片段利用医学相关信息表明最重要的分割区域为胆囊。(2)该描述不依赖于器官的医学名称而是基于位置语义来确定分割目标肝脏。同一个分割模型可以通过两种不同风格的自然语言定位到要分割的器官左边是 CT 图像粉色区域胆囊蓝色区域肝脏。右边给了两类文本提示解剖知识型分割分割胆囊文本大意是建议做腹部 CT以评估是否存在提示胆结石的积液。这句话没有直接说“请分割胆囊Gallbladder”但提到了gallstones胆结石。医学上胆结石主要与胆囊相关因此模型要理解胆结石-最关注的器官是胆囊然后在 CT 中分割粉色的胆囊区域。这叫Anatomy-Informed Segmentation即文本中包含医学知识、疾病术语或解剖相关线索。模型需要利用医学语义推断目标器官解剖无关型分割分割肝脏文本大意是我希望分割这张 CT 中最靠左的器官。这句话完全不说“肝脏”也没有疾病词只给出一个视觉空间条件最靠左。在该图中满足“最靠左”这个条件的目标是肝脏所以模型需要理解leftmost organ-图中最左侧的目标器官-肝脏这叫Anatomy-Agnostic Segmentation即不依赖医学名称或医学知识而是通过位置、大小等可观察属性定位目标。这里的 “leftmost” 指的是图像画面中的最左侧并不等于人体解剖学上的“左侧器官”。这也是 FLanS 后续要处理扫描方向问题的原因。表一表1FLanS可独特支持所有提示类型包括自由格式文本且具备对称性识别能力不同模型接受哪些类型的输入提示以及是否能处理图像方向变化提示类型包括Label类别名称例如“liver肝脏”Point用户在目标区域点一下Box用户框出目标大致位置Text自由形式文本例如“请分割最靠左的器官”或“请关注与胆结石相关的区域”Symmetry Aware是否能处理图像旋转、翻转导致的方向变化并理解解剖学位置含义而 FLanS 是表中唯一同时支持全部五项的模型:能力FLanS 是否支持例子类别名称✓“分割肝脏”点✓在肝脏内部点击一点框✓框住疑似肝脏区域自由文本✓“分割最靠左的器官”方向对称性✓图像旋转后仍能正确理解“右肾”对称性识别能力如果一张 CT 被左右翻转人体解剖学上的右肾可能出现在画面左边。普通模型可能把“right kidney”误理解为“画面右侧的肾”FLanS 会先将扫描规范化到统一方向再根据文本定位真正的人体右肾。表二表2来自不同数据集的示例CT图像显示了方向上的差异这凸显了需要采用对称感知等变模型以确保在不同扫描方向下均能实现一致的分割效果。不同公开 CT 数据集的图像方向并不统一同一器官在画面中的上下左右位置可能不同第 1 张 AbdomenCT-1K肝脏显示在画面左边第 2 张 AbdomenCT-1K肝脏显示在画面右边第 3 张 CHAOS脊柱显示在画面下方第 4 张 BTCV脊柱显示在画面上方。但从真实人体解剖结构来说肝脏始终位于人体右侧脊柱始终位于人体背侧后方。变化的是图像的显示方向例如图像可能被旋转、翻转或来自不同扫描与重建规范。这会带来一个问题模型如果把“图像右边”误当成“人体右侧”就会错误理解文本。因此作者提出对称感知等变的方向规范化模块任意方向 CT-规范化到统一标准方向-根据文本分割-映射回原始方向它的目标是让模型学习“人体解剖学位置”而不是死记“器官出现在屏幕哪个方向”。图二图2RAG自由形式查询生成器。来自电子病历EMR嵌入数据的领域语料库完成了检索增强任务并以临床查询方式优化了大语言模型LLM。FLanS 如何自动生成大量自由形式医学文本提示核心目标是把原本只有图像器官标签mask 的数据扩展成图像自然语言查询mask上半部分构建可检索的医学语料库作者准备了三类文本来源(S_1)医生医学专家的临床记录、电子病历EMR(S_2)非医学专业用户可能使用的提问方式(S_3)由大语言模型生成的合成文本。这些文本先被切成较短的片段Chunks例如一段病历会被切成若干条与疾病、器官、检查有关的小段。接着每个文本片段会被转成一个嵌入向量Embedding。可以把它理解为将文字编码成一串数字使“肝硬化”和“肝脏病变”在向量空间中更接近。所有文本向量放进Domain Corpus即“医学领域语料库向量库”。下半部分根据器官标签生成查询输入有两类Labels目标器官标签例如Liver、KidneyPrompt告诉生成器要完成什么任务的指令例如“请针对肝脏 CT 生成一条自然的分割请求”。随后生成器 (G) 会执行器官标签任务指令-从领域语料库检索相关病历片段-LLM 生成查询例如目标标签是Gallbladder胆囊系统会先检索与胆结石、胆囊炎、胆道等相关的临床表达再让 LLM 生成“请评估该腹部 CT 中是否存在与胆结石有关的异常区域。”这句话没有直接说“胆囊”但医学语义指向胆囊因此可配对胆囊的真实 mask 用于训练。右侧彩色小卡片表示最终生成的多条Queries文本查询。同一器官会有不同表达方式而不是永远只使用“Segment the liver.”借助真实医学语料约束 LLM 的表达风格自动生成多样、较临床化的自由文本提示从而降低人工逐图编写医学文本标注的成本图三图3从真实掩模的Bbox中提取的空间特征经RAG查询生成器G处理后可生成与解剖结构无关的查询。以样本 为例通过Bbox为掩模 提取空间信息并将其归类为最大值、最小值、最左侧、最右侧等空间类别随后RAG生成器G将这些类别转换为与解剖结构无关的文本查询用于增强P̃x。即使不给模型器官名称也可以利用真实 mask 自动生成“最大、最左、最上”等自然语言问题训练模型根据空间语义分割器官。左侧是一个训练样本 (x)其中有多个器官的真实掩膜 (m_x^{(i)})。作者先为每个器官的 mask 计算边界框Bbox再从边界框得到空间属性。例如图中Id:4的紫色器官面积最大 →largestId:5的绿色器官面积最小 →smallestId:2的蓝色器官最靠左 →left-most另一个器官最靠右 →right-mostId:1的红色器官最高 →upmostId:3的灰色器官最低 →bottom这些属性集合记作 K然后RAG 生成器 (G) 把原本简短的类别词扩展成不同句式的自由文本查询例如空间属性生成的自由文本提示最大“I want to segment the largest organ in this image.”最小“What is the smallest organ that can be observed in the CT scan?”最左“Please segment the left-most organ visible in the medical image.”最右“Please segment the right-most organ visible in the medical image.”最上“Identify and segment the uppermost organ in this CT scan slice.”最下“Segment the organ positioned at the lowest point of the CT scan.”生成的每句话会与对应器官的真实 mask 配对这样模型就能学习空间语言-图像中符合该空间条件的器官-分割 maskP̃x可以理解为样本 (x) 原有的文本提示集合 (P_x)经过这些“最大最左最上”等自动生成的提示扩充后得到的增强版提示集合。图四图4我们提出的FLanS模型架构。首先给定一组自由形式文本提示 1 ...、 文本编码器获取文本嵌入向量随后将其输入已学习的意图头层该层将嵌入向量映射到具有明确意图概率的空间中这对FLanS模型的权重更新如等式1所示非常有用。其次我们训练了一个规范化网络可将任意方向的医学图像转换至标准化空间确保编码后的图像符合标准临床实践以避免歧义。第三编码后的提示包括点坐标、Bbox或自由形式文本数据等空间信息与编码后的图像共同通过掩码解码器处理并输出预期的掩码结果。FLanS 的完整工作流程本质上是一个“文本理解 图像方向校正 SAM 式掩膜解码”的模型可以分为两条输入支路最后在 Mask Decoder 汇合自由文本点框提示医学图像-目标器官 mask上半部分处理提示信息左上角输入的是多条自由文本提示 (p_1,……,p_n)这些文本首先经过Text Encoder得到文本嵌入Text Embedding。随后进入意图头 H_int文本嵌入-意图嵌入它的作用是让模型从文本中明确判断“这句话究竟想分割什么”训练时这一分支会有“文本意图分类”监督使文本特征更容易区分不同器官分割目标而不只是生成一个模糊的句子向量接下来这个文本嵌入送入Prompt Encoder变成与图像特征可以交互的提示表示Encoded PromptFLanS 除了自由文本外还保留了传统 SAM 提示方式Point点提示Bbox边界框提示Text自由文本提示。点和框先通过空间编码器E_spatial编码再送入 Prompt Encoder下半部分处理任意方向的 CT 图像左下角输入可能是任意方向的 CT它先经过Canonicalized Network规范化网络把方向杂乱的输入 CT (x)转换到统一的、符合临床解剖习惯的标准方向规范化后的 CT 再经过Image Encoder得到图像嵌入Image Embedding融合与掩膜预测最后两个信息一起输入 Mask Decoder编码后的图像 编码后的提示 - 预测 mask右侧展示三种输出模式红框文本提示分割这是 FLanS 的主要创新黄框点提示分割绿框框提示分割。火焰与雪花FLanS 会训练文本编码相关模块、意图头、图像编码器、规范化网络和 mask 解码器但其部分原始 SAM 提示编码结构通常保持冻结或只部分使用以保留预训练能力表三表3基于解剖结构的分割结果FLanS在器官名称识别和自由文本提示分割任务中均持续优于基线方法展现出卓越的语言理解能力和分割精度这一优势在领域内数据集与领域外数据集中均得到验证即使应用随机变换处理时亦然。验证两件事FLanS 能否根据器官名称分割FLanS 能否根据自由形式文本分割并且验证模型在正常 CT 和随机旋转翻转后的 CT 上是否仍然可靠上半部分是Organ NameFLanS 在全部 6 个测试设置中都是第一下半部分是Free FormFLanS 在所有自由文本、域内域外、原始变换后的测试集上均为最高每个数据集都有两个指标Dice预测 mask 与真实 mask 的重叠程度NSDNormalized Surface Dice预测边界与真实边界的接近程度。FLARE、WORD域内测试集训练中见过相近的数据分布RAOS域外测试集训练时未使用用于检验泛化能力TransFLARE、TransWORD、TransRAOS分别把对应测试图像随机旋转翻转后的版本用于检验模型对扫描方向变化的鲁棒性。FLanS 能把自然语言表达正确对应到医学图像中的目标器官并在陌生数据集、甚至图像方向被打乱时仍保持较高的分割精度图五图5左图采用基于解剖结构的提示进行分割。可见FLanS能够精准分割自由格式文本提示中描述的器官而其他基线方法在识别器官时均存在错误右图采用非解剖结构导向的提示进行分割。可见FLanS具备纹理感知能力能准确理解尺寸与位置描述并其分割精度与直接使用Bbox框标注的方法相当。FLanS 不仅在表格分数上更高而且从预测 mask 的形状和位置看也更接近真实标注左半部分解剖知识型自由文本提示右半部分解剖无关型提示图六图6左图自由形式文本提示嵌入的t-SNE可视化结果。FLanS本研究提出的方法能有效区分不同器官相关的查询请求右图来自 4 和 8 规范化网络对FLARE22数据集中一批随机变换扫描图像生成的标准CT扫描图像。医学影像可成功转换回对齐后的标准化空间。从两个角度验证 FLanS 是否真的“懂文本”和“能处理方向混乱的 CT”左图文本嵌入的 t-SNE 可视化左侧每一个小点代表一条自由文本提示颜色代表它最终对应的器官类别原本文本编码器输出的是高维向量难以直接观察。作者用t-SNE把这些向量压缩到二维平面方便可视化同一种颜色的点聚在一起-不同说法、但目标相同的提示被编码成相似语义不同颜色的点大体分开-针对不同器官的文本在语义空间中可区分。右图方向规范化结果右侧比较三组 CT 小图Original原始图像这些 CT 被随机做过旋转或翻转因此方向混乱(D_4)采用四阶对称群的规范化网络处理后(D_8)采用八阶对称群的规范化网络处理后。从图中可以看出原始 CT 中不同小图的上下、左右朝向不一致经 (D_4) 和 (D_8) 处理后大多数扫描被调整到较统一的标准朝向例如脊柱、肝脏等结构的位置更一致表四表4解剖结构无关分割结果比较基于位置与尺寸信息文本提示的FLanS与基于Bbox或点标注的MedSAM及SAM2的表现。FLanS在域内和域外测试集上均展现出具有竞争力或更优的性能。不告诉模型器官名称只用大小或位置描述让它分割目标器官各方法的输入并不一样方法输入信息SAM2-large (Point)目标器官内部的一个真实点SAM2-large (Bbox)目标器官的真实边界框MedSAM (Bbox)目标器官的真实边界框FLanS (Free-form)自由文本如“最大”“最右”“最下”等FLanS 证明了文本提示不仅能表达器官名称也能在一定程度上替代人工点击和画框操作表五表5消融研究FLanS及其各变体在逐步移除组件后的模型对FLARE22原始测试集及转换后测试集的预测性能。每行代表模型的一个版本其中包含一个额外移除的组件。FLanS 的逐步移除组件消融实验模型版本相比完整 FLanS 被移除的内容FLanS full model没有移除所有模块都保留− Canonicalization去掉方向规范化模块− Data Augm在上一行基础上再去掉数据增强− Trainable ImgEnc再把图像编码器改为冻结不再微调− Classification Loss再移除文本意图分类损失图七图7该模型未进行标准化处理因将解剖位置“右肾”与图像右侧器官的外观混淆导致错误地突出显示左肾。说明为什么 FLanS 需要方向规范化模块输入文本是Highlight the right renal organ.突出显示右肾。这里的 “right renal” 指的是人体解剖学上的右肾不是“画面右边的肾”。FLanS 的规范化模块就是为了先消除这种“人体方向”和“画面方向”的歧义再进行文本引导分割。图八图8图7所示两种方法分割逻辑背后的原理说明。使用规范化模块训练的FLanS能够准确区分询问“右肾”的问题实际上是指人体的“右侧”而非观察侧因为“右肾”与“右侧肾脏”存在本质差异。我们的模型通过精心构建的规范化空间处理这一问题并根据人体标准方位将输入图像 转换为 ′。而不使用此类规范化模块的分割方法只能直接处理输入图像因此在处理语言歧义时容易出错。图 8 是图 7 的“推理过程解释图”上半部分有规范化模块结果正确输入图像x-规范化空间-标准方向图像x-在x上分割-映射回原图x下半部分没有规范化模块结果错误