文章主要内容与创新点总结一、主要内容本文针对中文K12教育场景下大型语言模型(LLMs)的评估需求,提出了名为EduEval的层级化认知基准。该基准以整合布鲁姆分类法与韦伯知识深度模型的EduAbility分类法为核心框架,将评估任务划分为记忆、理解、应用、推理、创造、伦理六个认知维度,涵盖24种任务类型、超过11000道题目,素材均源自真实考试题目、课堂对话、学生作文及专家设计提示,全面覆盖小学至高中阶段核心学科。研究团队在零样本和少样本设置下对14个主流LLM(包括商业模型与开源模型)进行了评估,发现模型在事实类任务(如公式回忆)中表现优异(部分准确率超90%),但在课堂对话分类等真实场景应用任务中表现薄弱(准确率低于30%),创造性内容生成结果一致性不足;部分开源模型在复杂教育推理任务上优于专有系统,少样本提示在不同认知维度的效果存在差异,需针对特定教育目标定制方案。此外,研究还揭示了模型在学科适应性、认知层级迁移等方面的特点与局限,为教育领域LLM的优化提供了明确方向。二、创新点提出整合性认知框架:构建EduAbility分类法,首次将布鲁姆分类法(认知操作类型)与韦伯知识深度模型(任务深度)相结合,并新增伦理维度,形成六层级认知评估体系,解决了传统框架在教育AI评估中维度单一、缺乏伦理考量的问题。强调教育真实性:突破传统基准依赖标准化选择题的局限,纳入课堂对话分类、学生作文评分、教学设计等真实教育场景任务,所有素材均源自教学实践,评估指标贴合实际教学标准。