彻底搞懂 Transformer 注意力:从图像直觉到 C++ 源码实现 北京地铁的线路图上,10 号线是一个规整的圆。你照着它换乘、数站数、跟人讲清楚怎么走,一次都不会错——这张图是对的。可要是拿它去挖隧道,第一铲子就歪了:真实的 10 号线是一条被地质、产权和既有管线反复揉过的曲线,圆是画给乘客看的,不是画给盾构机看的。Jay Alammar 那篇《The Illustrated Transformer》,就是注意力机制的线路图。它可能是全世界被转载最多的一张 Transformer 图解,我带过的每一个新人都是从它入的门,我自己第一次真正“看见”多头注意力也是靠它。这篇文章不打算重画一遍他的图,他画得比我好。我要做的是另一件事:拿着那张图,一笔一笔地问“这一划在真实系统里对应哪行代码”,然后你会撞见三个对不上的地方——不是他画错了,是图这个载体天然装不下它们。softmax 那条“一行加起来必须等于 1”的硬约束,图上没有;exp 在半精度下会炸成 inf,图上没有;那个N×NN \times NN×