查看: 10|回复: 0

「从零手写大模型」系列完结了

[复制链接]

7

主题

1

回帖

23

积分

新手上路

积分
23
发表于 前天 20:55 | 显示全部楼层 |阅读模式
「从零手写大模型」系列完结了
https://nano-ai.tech/articles/
推理篇 15 篇,训练篇 5 篇,共 20 篇

从模型的基本结构
到如何生成文字,再到损失、梯度与参数更新
把学习过程整理成了一套完整笔记
每一篇都有可练习的代码示例

📖 推理篇 · 15 篇
01|LLM From Scratch:整体大纲路线
02|Tokenizer:分词器
03|Embedding:嵌入层
04|Positional Encoding:位置编码
05|Self-Attention:自注意力机制
06|Multi-Head Attention:多头注意力机制
07|Residual Connection:残差连接
08|LayerNorm:层归一化
09|FFN:前馈神经网络
10|Activation Function:激活函数
11|Transformer Block:Transformer 模块
12|Transformer Stack:Transformer 堆叠
13|Loading Pretrained Weights:加载预训练权重
14|Text Generation:文本生成
15|Interpretability:可解释性

🛠 训练篇 · 5 篇
01|Loss Function:损失函数
02|Backpropagation:反向传播
03|Gradient Descent:梯度下降
04|Adam Optimizer:Adam 优化器
05|Learning Rate Scheduling:学习率调度

推理篇,理解模型如何一步步算出下一个 token
训练篇,理解模型如何从误差中学习、更新参数

欢迎一起学习、交流,也欢迎指出笔记里的问题

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部