AI大模型与数学 第37课二元函数驻点、极值判别:海塞矩阵基础判定(10道多元极值计算题)
本课学习驻点求解海塞矩阵极值判定对应AI训练核心问题寻找损失函数最小值、区分局部最优/全局最优、识别鞍点。开篇前简述二元函数驻点、极值判别、海塞(Hessian)矩阵 在大模型中的应用一、基础概念二元函数 f(x,y)驻点一阶偏导数全部为0的点\frac{\partial f}{\partial x}0,\quad \frac{\partial f}{\partial y}0驻点只是坡度0的平地不一定是极值可以是极小、极大、鞍点。海塞矩阵H二阶偏导构成对称方阵H\begin{bmatrix}\frac{\partial^2 f}{\partial x^2} \frac{\partial^2 f}{\partial x\partial y}[4pt]\frac{\partial^2 f}{\partial y\partial x} \frac{\partial^2 f}{\partial y^2}\end{bmatrix}混合偏导连续时 \displaystyle \frac{\partial^2 f}{\partial x\partial y}\frac{\partial^2 f}{\partial y\partial x}矩阵对称。行列式\boldsymbol D\det(H)f_{xx}f_{yy}-(f_{xy})^2。驻点处二阶判别法则D0,\ f_{xx}0H正定 → 局部极小值碗底D0,\ f_{xx}0H负定 → 局部极大值山顶D0H不定 → 鞍点马鞍点一个方向向上弯、一个方向向下弯不是极值D0二阶信息失效无法判断要看更高阶导数。几何理解梯度一阶告诉你往哪走海塞矩阵二阶描述曲面局部曲率告诉你脚下地形是碗、山峰、马鞍还是平坦地面。二、推广到大模型高维损失函数 L(\boldsymbol w)大模型损失是百万‑亿维参数\boldsymbol w的标量函数。梯度\nabla L一阶每一个参数的偏导数海塞矩阵\boldsymbol H二阶导数矩阵尺寸【参数量 × 参数量】现实中根本无法完整存储参数量几十亿矩阵规模爆炸工程只做近似、海塞‑向量乘积HVP不构造完整矩阵。海塞矩阵特征值含义高维全部特征值0正定局部极小全部特征值0负定局部极大高维损失曲面极少出现特征值有正有负不定鞍点大模型训练大量遇到部分特征值≈0半定平坦极小区域参数改动很多损失几乎不变。大模型里面海塞矩阵4个核心原理与应用7. 区分极小值和鞍点最关键梯度等于0不一定到达谷底很可能卡在鞍点马鞍地形。普通SGD只看梯度分不清海塞矩阵看曲率识别鞍点。高维空间鞍点数量极多是训练停滞的重要来源 。8. 区分尖锐极小 vs 平坦极小关联模型泛化能力海塞特征值整体大尖锐谷底参数稍微扰动损失暴涨容易过拟合大量特征值接近0平坦谷底参数扰动损失变化小泛化能力往往更好。这是深度学习理论重要结论模型不一定收敛到“损失最低点”平坦极小往往实际效果更好。9. 二阶优化器牛顿法为代表理论基础梯度下降只利用一阶信息牛顿法利用海塞矩阵修正更新方向会根据曲率自适应调整步长。现实大模型不会直接用完整牛顿法海塞太大衍生各类近似二阶优化器。10. 泰勒二次近似损失函数在参数点附近局部展开L(\boldsymbol w\Delta\boldsymbol w)\approx L(\boldsymbol w)\nabla L^T\Delta\boldsymbol w\frac12\Delta\boldsymbol w^T H\Delta\boldsymbol w海塞矩阵决定二次项刻画局部弯曲程度是几乎全部优化理论分析的数学底座。三、现实工程提醒大模型不会显式计算完整海塞矩阵维度爆炸内存装不下。实际做法海塞‑向量乘积(HVP)只算矩阵乘向量不生成完整矩阵用来做理论分析、近似二阶优化、评估样本影响等。极简总结记忆11. 梯度坡度海塞矩阵地形曲率驻点坡度为零但地形有碗顶、马鞍、平地。12. 二元看行列式D高维看海塞矩阵特征值符号。13. 大模型损失空间大量鞍点、平坦区域海塞矩阵是理解训练收敛、泛化能力的数学工具但工程上只能做近似不直接构造完整矩阵。核心知识点14. 驻点定义梯度 \nabla f(x,y)(0,0) 的点即满足\begin{cases}\dfrac{\partial f}{\partial x}0[4pt]\dfrac{\partial f}{\partial y}0\end{cases}驻点分三类极小值点、极大值点、鞍点。海塞矩阵二元H\begin{pmatrix}\dfrac{\partial^2 f}{\partial x^2} \dfrac{\partial^2 f}{\partial x\partial y}[4pt]\dfrac{\partial^2 f}{\partial y\partial x} \dfrac{\partial^2 f}{\partial y^2}\end{pmatrix}判别式 D\displaystyle \frac{\partial^2 f}{\partial x2}\cdot\frac{\partial2 f}{\partial y2}-\left(\frac{\partial2 f}{\partial x\partial y}\right)^2判定规则D0,\ \dfrac{\partial^2 f}{\partial x^2}0极小值点损失最低点训练目标D0,\ \dfrac{\partial^2 f}{\partial x^2}0极大值点D0鞍点梯度为0但不是最优大模型训练易停滞D0判别失效无法判定AI对应逻辑17. 损失函数极小值 模型训练收敛目标18. 鞍点梯度为0但曲面是马鞍形普通梯度下降会卡在这19. 海塞矩阵二阶优化器牛顿法能识别鞍点、跳出局部最优。10道二元极值计算题步骤AI工程解读题1f(x,y)x24y2求驻点并判定极值20. 一阶偏导f_x2x,\ f_y8y21. 令梯度为02x0,\ 8y0驻点 (0,0)22. 二阶偏导f_{xx}2,\ f_{yy}8,\ f_{xy}023. D2\times8 - 0^2160,\ f_{xx}0结论(0,0) 极小值点极小值 f(0,0)0AI解读标准二维MSE损失全局唯一极小值梯度下降一定收敛无局部最优干扰。题2f(x,y)-x2-3y25求驻点与极值f_x-2x,\ f_y-6y驻点(0,0)f_{xx}-2,\ f_{yy}-6,\ f_{xy}0D120,\ f_{xx}0极大值点极大值5AI解读反向损失曲面现实训练不会出现仅用于对比凹凸逻辑。题3f(x,y)x2-y2判别驻点类型f_x2x,\ f_y-2y驻点(0,0)f_{xx}2,\ f_{yy}-2,\ f_{xy}0D2\times(-2)-0-40结论鞍点AI解读典型马鞍形损失曲面梯度归零但不是最优普通SGD极易卡在鞍点停滞。题4f(x,y)x2xy2y2求驻点并判定f_x2xy,\ f_yx4y联立\begin{cases}2xy0\x4y0\end{cases}解得驻点(0,0)f_{xx}2,\ f_{yy}4,\ f_{xy}1D2\times4 - 170,\ f_{xx}0极小值点AI解读带权重耦合的损失函数混合偏导不为0但整体正定依旧稳定收敛。题5f(x,y)x3-3xyy3求全部驻点并判定f_x3x2-3y, f_y-3x3y2联立yx2, xy2解得驻点(0,0)、(1,1)24. (0,0)f_{xx}0,f_{yy}0,f_{xy}-3,\ D0-9-90 → 鞍点25. (1,1)f_{xx}6,f_{yy}6,f_{xy}-3,\ D36-9270,f_{xx}0 → 极小值点AI解读存在鞍点局部极小模型初始化位置不同可能收敛到不同结果。题6f(x,y)e{x2y^2}求驻点判定f_x2x e{x2y^2},\ f_y2y e{x2y^2}驻点(0,0)f_{xx}2e{x2y2}(12x2),\ f_{yy}2e{x2y2}(12y2),\ f_{xy}4xy e{x2y^2}(0,0)处f_{xx}2,f_{yy}2,f_{xy}0,\ D40极小值点AI解读指数型正则损失曲面平滑且仅一个全局最小值训练十分稳定。题7f(x,y)4-x2-xy-y2驻点极值判断f_x-2x-y,\ f_y-x-2y联立解得驻点(0,0)f_{xx}-2,f_{yy}-2,f_{xy}-1D4-130,f_{xx}0极大值点AI解读负向损失曲面无实际训练意义用于区分极大/极小判定逻辑。题8f(x,y)xy驻点类型判定f_xy,\ f_yx驻点(0,0)f_{xx}0,f_{yy}0,f_{xy}1D0-1-10鞍点AI解读纯权重交叉项损失全局无最小值训练会持续震荡无法收敛。题9f(x,y)x22y2-2x4y求驻点、极小值f_x2x-2,\ f_y4y4令梯度为0x1,\ y-1驻点(1,-1)f_{xx}2,f_{yy}4,f_{xy}0,\ D80极小值点极小值f(1,-1)-3AI解读带偏移参数的二维损失存在唯一全局最低点梯度下降可稳定收敛。题10 压轴综合f(x,y)x^2 e^{y}-2y求驻点并判定极值一阶偏导f_x2x e^y,\quad f_yx^2 e^y -2联立方程2x e^y0 \Rightarrow x0代入第二式0-20方程无解结论无驻点函数无极大、极小值AI解读特殊复合损失曲面不存在梯度归零的位置模型训练会持续迭代永远无法完全收敛。课程核心总结衔接第38课梯度下降完整数学推导26. 驻点是梯度为0的位置分为极小、极大、鞍点三类27. 海塞判别式D是区分鞍点与极值的核心工具28. AI训练目标是找到损失函数极小值点鞍点会造成训练停滞29. 若不存在驻点代表损失无下限模型会持续发散震荡。训练大模型时经常遇到卡在鞍点、局部最优的问题你知道哪些优化算法可以缓解这个现象欢迎评论区交流