SAID: Empowering Large Language Models with Self-Activating Internal Defense 文章核心总结与创新点一、主要内容该研究针对大型语言模型(LLMs)易受越狱攻击的安全隐患,提出了一种无需训练的内部激活防御框架SAID(Self-Activating Internal Defense)。现有防御方法多依赖外部干预(如输入过滤、输出修改),存在泛化能力弱、损害模型可用性或计算开销大等问题,而SAID通过激活模型内在安全机制,将防御从“外部修正”转向“内部能力激活”。SAID包含三阶段核心流程:模型原生意图蒸馏:从可能存在混淆或对抗性的输入中提取核心语义,长输入采用分层蒸馏策略确保意图捕捉完整性;最优安全前缀探测:通过实证优化的安全前缀激活模型潜在安全意识,该前缀经结构化搜索筛选,在强化安全性的同时不损害良性任务性能;保守聚合策略:整合多个探测结果,若任一核心意图被标记为不安全则拒绝响应,确保对多维度威胁的鲁棒防御。实验在5个开源LLM(Vicuna-7B/13B、Llama2-7B、Guanaco-13B、Llama-3-8B-Instruct)上展开,针对6种先进越狱攻击(GCG、AutoDAN、PAIR等),结果显示SAID在降低有害输出方面显著优于现有防御方法,同时保持良性任务性能,且计算开销极小。二、创新点提出首个无需训练的内部激活防御框架SAID,通过意图蒸馏、安全探测和保守聚合的三阶段流程,利用模型自身推理能力实现主动越狱防御;