查看: 1|回复: 0

想搞懂 Transformer 到底怎么运转的,翻教程不是一行代码调完接口,就是直接甩来 40 页论文。

[复制链接]

13

主题

0

回帖

49

积分

新手上路

积分
49
发表于 昨天 21:19 | 显示全部楼层 |阅读模式
想搞懂 Transformer 到底怎么运转的,翻教程不是一行代码调完接口,就是直接甩来 40 页论文。

how-to-train-your-gpt 是一本 12 章、7500 多行的教材,带着从零写出一个 LLaMA 3 那套架构的语言模型。

分词器、嵌入层、注意力、训练循环、推理引擎,每一部分都自己动手写,每行代码都注了是什么和为什么。

GitHub:http://github.com/raiyanyahya/how-to-train-your-gpt

另配 28 篇专题拆细节,RoPE 怎么用旋转表达相对位置、KV 缓存省在哪、混合精度是怎么回事,都单独讲。

还有两篇走查,跟着一句话从进模型到出结果走一遍,中间每一步的数字都摆出来。

最后能训出一个 151M 参数的模型,配了 Colab 笔记本,不用自己折腾环境。

作者在开头写了句实话,说做这个是因为自己一直没吃透注意力那部分,边学边写。

学习需要一点 Python 基础,微积分和线性代数这些不用。在注意力那一章卡住过的朋友,可以从这份重新走一遍。


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部