早先翻到的 RL 和 LLM 资料,要么飘要么浅。

早先翻到的 RL 和 LLM 资料,要么飘要么浅。

直到这门 UCLA 公开课《Reinforcement Learning of Large Language Models》,从强化学习接到语言模型训练,线才清楚。主讲是数学系的 Ernest K. Ryu。

2025 春的课后来重录上了 YouTube,幻灯和作业在课程页。先修大概到图像分类就行,深度 RL 那几讲要会一点条件期望。

第一章过 MDP、策略梯度、A3C、PPO,也有 GRPO。
第二章补语言模型和 Transformer。
第三章拆 RLHF,PPO、DPO 都讲;
另有一讲可验证奖励 RLVR。有 Jupyter 和练习。

直达http://ernestryu.com/courses/RL-LLM.html



分类