想搞懂 Transformer 到底怎么运转的,翻教程不是一行代码调完接口,就是直接甩来 40 页论文。

想搞懂 Transformer 到底怎么运转的,翻教程不是一行代码调完接口,就是直接甩来 40 页论文。

how-to-train-your-gpt 是一本 12 章、7500 多行的教材,带着从零写出一个 LLaMA 3 那套架构的语言模型。

分词器、嵌入层、注意力、训练循环、推理引擎,每一部分都自己动手写,每行代码都注了是什么和为什么。

GitHub:http://github.com/raiyanyahya/how-to-train-your-gpt

另配 28 篇专题拆细节,RoPE 怎么用旋转表达相对位置、KV 缓存省在哪、混合精度是怎么回事,都单独讲。

还有两篇走查,跟着一句话从进模型到出结果走一遍,中间每一步的数字都摆出来。

最后能训出一个 151M 参数的模型,配了 Colab 笔记本,不用自己折腾环境。

作者在开头写了句实话,说做这个是因为自己一直没吃透注意力那部分,边学边写。

学习需要一点 Python 基础,微积分和线性代数这些不用。在注意力那一章卡住过的朋友,可以从这份重新走一遍。


分类