how-to-train-your-gpt 是一本 12 章、7500 多行的教材,带着从零写出一个 LLaMA 3 那套架构的语言模型。
分词器、嵌入层、注意力、训练循环、推理引擎,每一部分都自己动手写,每行代码都注了是什么和为什么。
GitHub:http://github.com/raiyanyahya/how-to-train-your-gpt
另配 28 篇专题拆细节,RoPE 怎么用旋转表达相对位置、KV 缓存省在哪、混合精度是怎么回事,都单独讲。
还有两篇走查,跟着一句话从进模型到出结果走一遍,中间每一步的数字都摆出来。
最后能训出一个 151M 参数的模型,配了 Colab 笔记本,不用自己折腾环境。
作者在开头写了句实话,说做这个是因为自己一直没吃透注意力那部分,边学边写。
学习需要一点 Python 基础,微积分和线性代数这些不用。在注意力那一章卡住过的朋友,可以从这份重新走一遍。