BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Benga... 文章核心总结与创新点主要内容文章针对现有伦理基准多以英语为中心、受西方框架主导的问题,提出首个孟加拉语大型伦理基准BengaliMoralBench,用于评估大语言模型(LLMs)在孟加拉语及南亚文化背景下的道德推理能力。该基准包含3000个基于孟加拉日常生活的道德场景,覆盖日常活动、习惯、育儿、家庭关系、宗教活动5大领域及50个文化相关子主题,采用美德伦理、常识伦理、正义伦理三维评估框架。通过对Llama、Gemma、Qwen等主流多语言LLMs的零样本评估发现,模型准确率介于50%-91%之间,普遍存在文化扎根不足、常识推理薄弱、道德公平性欠缺等问题,且模型规模并非决定性能的唯一因素,文化相关预训练数据和指令调优策略更为关键。创新点首个针对孟加拉语的大规模文化适配伦理基准,填补非西方语言道德推理评估空白,场景完全源于孟加拉本土生活,避免翻译导致的文化失真。提出三维道德推理框架(美德、常识、正义),契合孟加拉文化传统,实现多维度、精细化的道德评估,超越单一维度的二元判断。构建标准化零样本评估协议与多指标评估体系(准确率、F1值、MCC、Cohen’s Kappa),同时分析提示语言、模型规模、温度参数等对性能的影响,为模型本地化优化提供实证依据。翻译部分(Markdown格式)Abstract(摘要)随着多语言大型语言模型(LLMs)在南亚地区的应用日益广泛