查看: 9|回复: 0

早先翻到的 RL 和 LLM 资料,要么飘要么浅。

[复制链接]

21

主题

0

回帖

57

积分

注册会员

积分
57
发表于 昨天 22:13 | 显示全部楼层 |阅读模式
早先翻到的 RL 和 LLM 资料,要么飘要么浅。

直到这门 UCLA 公开课《Reinforcement Learning of Large Language Models》,从强化学习接到语言模型训练,线才清楚。主讲是数学系的 Ernest K. Ryu。

2025 春的课后来重录上了 YouTube,幻灯和作业在课程页。先修大概到图像分类就行,深度 RL 那几讲要会一点条件期望。

第一章过 MDP、策略梯度、A3C、PPO,也有 GRPO。
第二章补语言模型和 Transformer。
第三章拆 RLHF,PPO、DPO 都讲;
另有一讲可验证奖励 RLVR。有 Jupyter 和练习。

直达http://ernestryu.com/courses/RL-LLM.html



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部