Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contras...
文章总结与翻译一、主要内容本文针对医疗大型视觉语言模型(Med-LVLMs)在临床应用中存在的幻觉问题(生成看似合理但不符合事实的输出)展开研究,提出了一种名为Med-VCD的稀疏视觉对比解码方法。该方法无需二次解码的时间开销,通过视觉感知令牌稀疏化策略,在保留关键视觉上下文的同时修剪冗余信息,实现效率与可靠性的平衡。研究背景指出,现有幻觉缓解方法要么依赖大规模标注数据进行微调(医疗领域难以实现),要么通过多轮解码或外部工具导致计算开销大、实时性差。Med-VCD通过三大核心组件解决该问题:视觉感知令牌选择(VATS)、稀疏视觉对比解码(SVCD)和沉降注意力校准(SAC),分别实现令牌的精准筛选、无二次解码的对比逻辑校准以及注意力分布优化。实验在8个医疗数据集(涵盖放射学、眼科学、病理学等领域,包含视觉问答、报告生成和专门的幻觉基准测试)中展开,结果显示Med-VCD相比基线模型,事实准确率平均提升13%,幻觉准确率提升6%,同时在解码速度上优于现有方法,且在视觉误解、知识缺陷、上下文错位三类幻觉场景中均表现出稳健的缓解效果。二、创新点从解码阶段的令牌稀疏化角度切入缓解幻觉,提出一种即插即用的方法,将视觉感知增强与令牌稀疏化统一为优化问题,同时兼顾模型效率与保真度。设计视觉感知令牌选择技术(VATS)和基于稀疏的视觉对比解码策略(SVCD),避免多轮解码,利用嵌入生成对比逻辑,减少计算开销。引入沉降注意力校准(SAC)机制,抑制注意力过度集中于语义无关令牌的现象,保障视觉-文本模态的对齐稳定性。