精选75向阳乔木技巧与观点
Nathan Lambert 新书与课程:大模型 RLHF 与后训练实战
Nathan Lambert 写一本专门介绍大模型 RLHF 的书。
Nathan Lambert 写一本专门介绍大模型 RLHF 的书。
配套 13 讲正课和免费 PPT,大善人啊。
不要求大语言模型基础,只有学习动力,加上AI辅助完全可以学。
开头讲基础:LLM原理、KL 散度、交叉熵等。
后正文讲了 RLHF 和后训练的基础框架、指令微调、奖励模型、拒绝采样、RLVR 、DPO等。
还有合成数据和现在的Post Traing训练方法。
课程和PPT下载见评论区,比较硬核。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力