CS336 Lecture1~4  Assignment1 学习简记
前言要是有着想要在业余时段去学习跟大模型紧密关联的ai infra这样的想法, 那就绝对得去学一学那声名远扬的CS336课程, 恰好2026年这个版本也已然开启篇章了。此课程所涵盖的知识数量颇为庞大加之本人并没有什么相关基础, 因而通勤的那段时间以及下班之后的时间基本上全被用于学习这件事情上了。当下已然完成了相关学习任务, 并且运用特定 数据集在我自身的4060 Ti显卡之上开展了大概40M这个量的训练操作。尽管仅仅只是一个规模较小的模型、数据量也不多的实验, 然而当目睹那模型确实能够生成一段具备流程特性的文本之际, 仍然是颇具成就感的。这般简单地记录关于学习的心得之处, 同时分享一些我个人认为挺不错的入门资料。于我而言, 通勤的那段时间是极为适宜去观看视频的, 因而所提及的视频资料会是比较多的。笔记于着手学习之前, 要有一心理预期, CS336的知识量甚巨, 其覆盖面亦极广, 短时间内绝无可能全然掌握。吾关于此门课程之学习策略为, 挑选自身感兴趣的、与AI Infra相关性较强的部分予以更深入探究, 其余部分先构建起基本概念, 后续待有需要之际再进行深入研习, 课程所提供的参考资料数量众多, 有空之时可多多翻阅浏览。了解训练大语言模型的基本组件完成 1 后对这些内容会有一个更直观的认识。现如今, 于大语言模型当中最为常见的那种方案, 乃是BPE此为Byte - Pair 的简称。其基本原理是, 持续地将高频出现的相邻byte或者token pair合并成为全新的token , 并一步步地构建起词表。在这一方面, 能够配合大神所制作的视频以及代码一块儿去学习, 其中讲解得极为直观。针对结构的理解, 我给出这样的建议, 那就是可以先去观看李宏毅老师所讲的关于self-以及某些相关内容的讲解视频, 其讲解深入浅出, 值得一看先去建立起基本概念, 之后再去看论文, 如此一来会顺畅许多。关键要点是, 要掌握评估模型训练所需资源的方法。像模型参数量, 计算量, 显存占用这些方面, 都属于评估范畴。依据这些指标, 能够大概推导得出, 什么样配型的机器可以训练规模多大的模型不同规模大小的数据集开展训练需要耗时多久以及训练过程中的瓶颈大致会在什么地方。学习到 、、、fp8 和 fp4 的格式。去学习, 关于里库的用处运用之法, 尤其是其中的和这部分情况, 当去处理各种维度的相关事宜时, 能够削减好多心智负担呢。FLOPs(-point )一些常见的预估方式FLOP/s, 它指那种每什么的 -point, 这也被称作 FLOPS。MFU(Model FLOPs ):训练显存占用有一些方法能减少训练内存介绍一些经过实践验证的有效模型结构和训练技巧。常见结构包括常用位置编码方法模型结构调参主要涉及训练稳定性技巧与之相关的内容数量颇为可观, 能够与李宏毅老师所讲的关于优化方面的视频一同进行观看:这部分内容我目前只是做基本了解。的一些变体如MoE( of ) 专家网络相关我对于这一部分也是不曾有着深入的探究, 要是真的需要去进行学习的话, 那么先是得去埋头钻研论文以及技术报告才行, 当前它并非是我学习时候最为着重紧要的要点, 因而在此仅仅是做出基本层面的了解罢了。1完完整整走了一回语言模型训练流程, 收获颇为丰厚。不但学到了大模型训练的某些基础知识, 还学到了好多工程实现方面的优化细节。即便作业所涵盖的内容数量繁多, 文档呈现出来的页面长度较长, 然而依照给定的说明, 依次逐步去达成, 实际上难度还算尚且可以, 再加上有大模型予以助力, 碰到不明白的地方, 询问就能够解决问题了。下面简要地记录一下各个部分的心得体会。BPE :block:相关比较基础Train loop:Text:最后测试是通过了。训练做消融实验, 我并未开展, 这又是如何, 而因为了此次学习目的并非进行调参这个操作, 从工程学习的角度层面, 已然达到了我想要去了解知晓的那般情形。最终能借助AI一下子达成, 能够学到某些常规做法的优化方式以及一些经典的达成形式。小结时间早在 2025 年的时候, 我就知晓 CS336 这门课程了。那个时候, 当我看第一讲的时候, 基本上就如同在听一本奇怪的书那样一知半解 , 之后当看到第一个作业是接近 50 页的 PDF 文件时 , 当时我的第一反应便是: 暂且搁置一旁 , 等到后面再去学习。此刻, 伴随某些前置知识的增添, 逐渐也能够大致领会了, 要是存在不明白的, 持续向大模型追问就行。维持干劲, 持续展开学习吧。