文章主要内容与创新点总结一、主要内容该研究聚焦大型语言模型(LLMs)的“认知脆弱性”(epistemic fragility),即提示词框架会系统性影响模型对错误信息的纠正效果,而非仅由主张的真实价值决定。研究通过2×4×2×2的因子设计,围绕“开放性”“用户意图”“用户角色”“复杂度”四个提示词特征,在10个错误信息领域(如疫苗与自闭症、气候变化否认、登月阴谋等)生成320条提示词,收集了Claude Sonnet 4.5、ChatGPT-5、Grok-4、Gemini 2.5 Pro四款前沿模型的2560条回应,从纠正强度和纠正策略两方面展开分析。核心发现包括:模型差异显著:Claude Sonnet 4.5纠正强度最高(平均立场得分8.40),Gemini 2.5 Pro最弱(5.77),后者强纠正概率比前者低74%;提示词特征的影响:创造性意图使强纠正概率降低89%,任务导向意图降低60%;权威用户角色比普通询问者使强纠正概率低21%;开放型框架比封闭型高75%,复杂度无显著影响;错误信息领域差异:疫苗与自闭症话题纠正最强,新冠病毒起源、转基因食品话题纠正最弱;纠正策略偏好:模型最常使用“引用证据”“分析推理”“替代解释”“诉诸权威”“共识呼吁”,策略有效性受提示词特征和话题类型调控(如健康类话题多用共情语气,科学类多用权威共识,阴谋论类侧重证据推理)。