如何用 OpenCompass 一致性评测检验模型【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100 datasets.项目地址: https://gitcode.com/gh_mirrors/op/opencompassOpenCompass 是开源大模型评测平台它的一致性评测功能把选择题按打乱选项的顺序重新测一遍能识别出模型偏爱 A/B 选项蒙对答案的情况帮你验证评测分数是否真实稳定。新手跟着下面的步骤用现成示例就能完成第一次模型稳定性检验。做模型一致性评测时的常见痛点 一道题换种选项顺序模型答案跟着变——分数看着高其实是选项字母偏好结论不可用 两次跑分结果不一样你无法判断模型是真理解还是蒙对的⚖️ 多模型对比时高分模型输出波动反而最大单一 accuracy 数字暴露不了这个问题最短上手路径三步完成第一次一致性评测获取项目并装依赖git clone https://gitcode.com/gh_mirrors/op/opencompass cd opencompass pip install -r requirements.txt改一处配置直接复用官方示例 examples/eval_circular.py它已把 MMLU、C-Eval 等 9 个选择题数据集换成了循环评测版本只需把其中的模型配置换成你手上的模型即可。运行看结果python run.py examples/eval_circular.py跑完后汇总报告会多出acc_origin和perf_circular两列两列差值就是模型选项偏好的直观证据。OpenCompass 一致性评测的核心能力拆解循环评测一道题变四道题把一道题按选项顺序增广成 4 道变体题全部答对才算对蒙对和偏好的水分会被挤掉。做法是让数据集类带上CircularDatasetMeta元类自动生成选项模式circular是 4 次轮换all_possible是 24 种全排列评测器换成CircularEvaluator。实现见 opencompass/datasets/circular.py。攻击评测看输入扰动下的分数变化自动对题目做同义词级别扰动量化模型判断在轻微改动下改变多少。做法是把任务设为OpenICLAttackTask指定攻击方式示例用 textfooler和查询预算。示例见 examples/eval_attack.py。汇总报表一眼看出偏好程度报告把acc_origin单次答题正确率和perf_circular所有顺序都答对才计对并排展示差距越大说明选项偏好越明显。用CircularSummarizer并通过metric_types选择展示哪些指标即可实现位于opencompass/summarizers/circular.py。一致性评测组合怎么选三种典型配置对比场景推荐配置适合人群注意事项快速稳定性检查circular模式 acc_origin/perf_circular新手、小规模抽检推理量增至 4 倍注意计算资源严格全排列评测all_possible模式发论文、做严格对比推理量增至 24 倍只建议小样本题目输入鲁棒性OpenICLAttackTask textfooler红队测试、鲁棒性检查用NaivePartitioner整数据集一次跑完跑一致性评测的常见疑问❓ 问循环评测分数为什么比常规分数低 答判对更严4 种顺序全对才计分差距大说明模型有选项偏好不是能力下降。❓ 问示例里的模型我本地没有怎么办 答示例预置了 Qwen、InternLM 等开源模型把配置里的模型换成你已有的即可。❓ 问指标口径细节在哪查 答见 循环评测文档逐项说明 acc、perf、more_num 的差别。两列指标的差值能告诉你模型成色更多评测组合请看docs/zh_cn/advanced_guides/与examples/目录。【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100 datasets.项目地址: https://gitcode.com/gh_mirrors/op/opencompass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考