文章核心总结与创新点主要内容该研究以2026年韩国CSAT数学考试为基准,在完全无数据泄露的环境下评估了24款主流大语言模型(LLMs)的数学推理能力。考试共46道题(22道必考题+24道选考题),涵盖概率统计、微积分、几何等核心领域,研究团队在考试公开后2小时内完成题目数字化,避免数据被模型训练收录。通过多输入模态(纯文本、纯图像、文本+图形)、多提示语言(韩语、英语)及不同推理强度的组合测试,发现GPT-5系列部分模型实现满分,Grok 4、Qwen 3 235B等模型得分超97分,小参数模型gpt-oss20B以95.7分展现高性价比;微积分是模型最弱领域,4分难题表现显著下滑,纯文本输入效果优于图像输入,推理强度提升虽能提高成绩但会大幅增加成本与耗时。创新点构建完全无泄露的评估环境:依托CSAT考试的高保密性,考试公开后快速数字化题目,从根源上避免数据泄露影响,确保评估结果真实反映模型推理能力。标准化数字化流程:将面向人类的考试材料转化为LLM可直接使用的评估数据,统一文本(Markdown+LaTeX)、图像提取及元数据格式,保障评估一致性。多维实用评估视角:突破单一准确率指标,整合性能、成本、耗时三大维度,提出时间效率、成本效率及联合效率评分,为实际应用场景提供参考。译文(Markdown格式)Abstract本研究利用2026年韩国大学学术能力测