「从零手写大模型」系列完结了
https://nano-ai.tech/articles/
推理篇 15 篇,训练篇 5 篇,共 20 篇
从模型的基本结构
到如何生成文字,再到损失、梯度与参数更新
把学习过程整理成了一套完整笔记
每一篇都有可练习的代码示例
📖 推理篇 · 15 篇
01|LLM From Scratch:整体大纲路线
02|Tokenizer:分词器
03|Embedding:嵌入层
04|Positional Encoding:位置编码
05|Self-Attention:自注意力机制
06|Multi-Head Attention:多头注意力机制
07|Residual Connection:残差连接
08|LayerNorm:层归一化
09|FFN:前馈神经网络
10|Activation Function:激活函数
11|Transformer Block:Transformer 模块
12|Transformer Stack:Transformer 堆叠
13|Loading Pretrained Weights:加载预训练权重
14|Text Generation:文本生成
15|Interpretability:可解释性
🛠 训练篇 · 5 篇
01|Loss Function:损失函数
02|Backpropagation:反向传播
03|Gradient Descent:梯度下降
04|Adam Optimizer:Adam 优化器
05|Learning Rate Scheduling:学习率调度
推理篇,理解模型如何一步步算出下一个 token
训练篇,理解模型如何从误差中学习、更新参数
欢迎一起学习、交流,也欢迎指出笔记里的问题