Q-MLLM 论文核心总结与翻译一、主要内容总结1. 研究背景与问题多模态大语言模型(MLLMs)在跨模态理解任务中表现突出,但面临两类关键安全漏洞:视觉表征的连续性使其易受梯度-based对抗攻击,攻击者可通过微小扰动绕过文本安全机制;文本安全机制难以迁移到视觉模态,含固有有害内容的图像搭配良性文本即可诱导模型生成不安全输出。现有防御方法(安全微调、预处理检测、生成后检测)存在计算成本高、防御范围有限、推理延迟大等问题。2. 核心方案:Q-MLLM 架构提出融合两级向量量化的多模态模型,通过离散化视觉表征构建对抗攻击屏障,同时保留推理能力:两级向量量化:在像素块级和全局语义级对视觉特征离散化,将连续嵌入转换为离散令牌,阻断梯度攻击路径;安全信号检测:利用量化后的全局语义嵌入,通过轻量级映射数据集构建安全分类器,快速识别有害图像并提前拒绝;两阶段训练:预训练阶段优化投影层和量化码本,微调阶段聚焦语言模型的多模态推理能力,冻结量化组件以保留安全特性。3. 实验结果安全性能:对越狱攻击的平均防御成功率(DSR)达98.4%(部分场景100%),对有毒图像攻击DSR达