直到这门 UCLA 公开课《Reinforcement Learning of Large Language Models》,从强化学习接到语言模型训练,线才清楚。主讲是数学系的 Ernest K. Ryu。
2025 春的课后来重录上了 YouTube,幻灯和作业在课程页。先修大概到图像分类就行,深度 RL 那几讲要会一点条件期望。
第一章过 MDP、策略梯度、A3C、PPO,也有 GRPO。
第二章补语言模型和 Transformer。
第三章拆 RLHF,PPO、DPO 都讲;
另有一讲可验证奖励 RLVR。有 Jupyter 和练习。
直达http://ernestryu.com/courses/RL-LLM.html