学习日记44:Words or Vision: Do Vision-Language Models Have Blind Faith in Text? 摘要视觉语言模型能再以视觉为中心的任务中很好的整合视觉和文本信息但是对于模态间信息不一致的处理很不充分作者通过实验发现当文本和视觉信息出现不一致时VLMs盲目地相信文本数据而不信任视觉数据导致在损坏的文本下显著的性能下降。分析了影响这个种文本偏向的因素由此使用了增强文本的监督微调并证明其在减少文本偏置的作用。介绍作者探索了指令提示词语言模型的大小文本相关性图像和文本token的顺序以及单模态对于当前任务的确定性对于这种盲目相信文本的情况的影响。为了探索多模态模型对于文本信息的偏好文章中设置了3种图文对即Match(图片和文本信息完全一致)Corruption(图片和文本信息相关但文本被歪曲对图片的描述错误)Irrelevance(图片与文本完全无关各说各的)分别评估相关信息的使用误导信息的处理模型忽略分心物的能力。为了更好评估模型对于各个模态的依赖程度和模型的能力作者设置了更多指标Text Preference Ratio (TPR)衡量当文本和视觉信息不一致时模型选择文本的可能性来表示文本偏见Accuracy任意一组测试集 Q 的标准答题正确率:Macro Accuracy是使用三种不同图文对的模型上的准确率的平均Normalized Accuracy衡量了模型受文本变化影响的程度相对于基准准确率即其在基准问题集B上的准确率。对于文本变化下的任意问题集Q计算相应的归一化准确率为可以理解为相对于基准数据集上的准确率来说这个数据集上的准确率实验实验设置这部分其实主要是测试现象实际上的解决方法十分简单。在四个不同领域的视觉问答 (VQA) 数据集上测试模型效果分别是通用视觉问答文档图文问答视觉数学推理网页品牌识别 / 钓鱼检测。作者实验GPT4o对正常文本对的文本部分进行处理得到三种文本对。在提示词上作者提醒模型注意潜在的错误并鼓励谨慎使用文本信息。并对当前数据进行测试关掉图像输入只把Match / Corruption / Irrelevance三类文本单独喂给模型答题统计纯文本下的准确率这部是检测文字本身单独存在时能独立给出确定正确 / 错误答案 如果不做就无法区分模型答错是「被错误文字误导」还是「文字本身描述不清」实验结论会失去说服力。对文本的盲从可以看到在Match / Corruption / 中TPR的值都十分大无论文本是否正确模型都显示出来对文本信息的极大服从只有在Irrelevanc情况下文本显然与图片无关模型才会对图像更细致的观察。Base只输入图片 问题不加任何额外文本时模型答对题目的百分比。Corruption同时输入图片 矛盾错误文本Corrupted Text 问题模型答对的百分比。强烈的文本偏好使得Corruption情况下的模型表现显著下降。影响因素指令语可以减少文本偏误但具有局限性。使用较大的语言模型进行训练可以减少文本偏差但会出现饱和现象。相关文本更可能影响视觉-语言模型文本和问题越相关模型越愿意相信这段文字哪怕文字和画面矛盾。文本放在前面会大幅加剧文本偏置TPR 显著升高。模型会自动对比自己对图像、文字的自信程度哪边把握大就采信哪边只要文字侧模型很确定哪怕图完全相反也会放弃视觉信息。解决方法使用监督微调具体来说同时使用纯文本样本和图文配对样本两类数据。 一共收集 1000 条微调样本平均均匀分配到 5 种数据类型中纯文本数据、原始标准 VQA 样本、附加匹配文本的 VQA 样本、附加污染错误文本的 VQA 样本、附加无关文本的 VQA 样本以上后三类统称为文本增广样本。去掉纯文本数据微调模型 TPR 大幅下降但会过度排斥正常文本 保留纯文本数据模型能清晰区分匹配 / 污染文本两者 TPR 差距最高 40%既能采信正确文字、又抵抗错误文字效果最优。