LinguaSafe相关总结与翻译一、文章主要内容(一)研究背景随着大型语言模型(LLMs)在全球技术领域的广泛应用,其在不同语言和文化背景下的安全性愈发重要。然而,现有多语言安全评估存在明显不足,一方面过度依赖翻译数据,而这类数据的毒性远低于自然产生的原生多语言数据;另一方面评估维度欠缺,无法全面评估LLMs在不同语言下的安全对齐情况,且低资源语言(如孟加拉语)的安全性能退化严重,仅将恶意提示翻译成低资源语言就能绕过安全对齐,同时LLMs对不同语言文化理解不足,导致在检测和判断有毒内容时存在过度敏感或敏感不足的问题。(二)数据集构建(LinguaSafe)基本信息:包含12种语言(涵盖高、中、低资源语言)的45000条数据,是首个针对匈牙利语和马来语的综合安全基准,数据来源包括原生数据(ND)、翻译数据(TL)和创译数据(TC),确保语言真实性和多样性。数据处理:基于TEaR框架开发TATER(任务感知翻译、评估和优化)框架,用于将英文安全数据集创译为目标语言,通过翻译、评估、优化三个阶段提升数据质量,经测试,该框架能大幅降低孟加拉语和马来语创译的错误率。安全分类与严重程度标注:构建包含5个安全领域(犯罪与非法活动、公平与歧视、露骨内容、隐私与财产、伤害与滥用)及23个子类别的层级安全分类体系,并由人类标注者和AI共同标注4个严重程度等级(L0 -