跳到主内容
精选75向阳乔木技巧与观点

Nathan Lambert 新书与课程:大模型 RLHF 与后训练实战

Nathan Lambert 写一本专门介绍大模型 RLHF 的书。

原文

Nathan Lambert 写一本专门介绍大模型 RLHF 的书。

配套 13 讲正课和免费 PPT,大善人啊。

不要求大语言模型基础,只有学习动力,加上AI辅助完全可以学。

开头讲基础:LLM原理、KL 散度、交叉熵等。

后正文讲了 RLHF 和后训练的基础框架、指令微调、奖励模型、拒绝采样、RLVR 、DPO等。

还有合成数据和现在的Post Traing训练方法。

课程和PPT下载见评论区,比较硬核。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近