2026-08-24 赢政指数 Smoke 快测覆盖 11 个模型Gemini 3.1 Pro 以 96.98 分位居当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。当日排名排名模型主榜代码执行材料约束诚信#1Gemini 3.1 Pro96.9894.5100pass#2Gemini 2.5 Pro92.1694.589.3pass#3GLM-4.687.5486.189.3warn#4Grok 487.0986.188.3pass#5豆包 Pro86.5494.576.8warn#6GPT-o383.2369.5100pass#7Claude Opus 4.782.9877.889.3pass#8DeepSeek V4 Pro80.4694.563.3pass#9Qwen3 Max71.7377.864.3pass#10GPT-5.564.6644.589.3pass#11Claude Sonnet 4.658.2344.575pass数据解读今日赢政指数 Smoke 快测中Gemini 3.1 Pro 以代码执行 94.5、材料约束 100 的搭配取得主榜 96.98Gemini 2.5 Pro 代码执行 94.5、材料约束 89.3 对应主榜 92.16GLM-4.6 代码执行 86.1、材料约束 89.3 获得主榜 87.54显示头部模型在代码执行与材料约束两项上的强弱组合差异明显。豆包 Pro 代码执行 94.5 但材料约束 76.8主榜 86.54GPT-o3 代码执行 69.5、材料约束 100主榜 83.23此类结构呈现一端突出另一端受限的特点。与上一同口径 run 相比GLM-4.6 主榜 64.1 分、代码执行 69.4 分、材料约束 57.6 分Gemini 2.5 Pro 主榜 28.9 分、代码执行 25 分、材料约束 33.6 分GPT-o3 主榜 27.7 分、代码执行 19.5 分、材料约束 37.6 分Grok 4 主榜 22.8 分、代码执行 19.4 分、材料约束 26.9 分Gemini 3.1 Pro 主榜 18.5 分、材料约束 37.6 分这些升幅反映单日分数结构的变化。DeepSeek V4 Pro 材料约束暴跌 -18.4 分属于异常信号可能源于题目抽样波动或真实退化需后续 run 复核确认。Smoke 快测为小样本单日信号以上解读仅基于今日数据未做长期判断。主要变化GLM-4.6主榜上升 64.1 分代码执行 69.4 分材料约束 57.6 分Gemini 2.5 Pro主榜上升 28.9 分代码执行 25 分材料约束 33.6 分GPT-o3主榜上升 27.7 分代码执行 19.5 分材料约束 37.6 分Grok 4主榜上升 22.8 分代码执行 19.4 分材料约束 26.9 分Gemini 3.1 Pro主榜上升 18.5 分材料约束 37.6 分需要关注的信号DeepSeek V4 Pro材料约束暴跌 -18.4 分读这类 Smoke 简报时重点应放在两个问题上第一某个模型是否连续多日暴露同一类弱点第二诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。数据来源赢政指数 (YZ Index) | Run #292本文首发于赢政天下 (https://www.winzheng.com)获取更多深度技术内容与资源欢迎访问官网。