精选75Hugging Face 博客(RSS)技巧与观点
Mini-R1:复现DeepSeek R1顿悟时刻的RL教程
Mini-R1:复现DeepSeek R1“顿悟时刻”的RL教程
Hugging Face 发布 Mini-R1 教程,旨在通过强化学习复现 DeepSeek R1 的“顿悟时刻”。该教程基于小型模型和简单游戏环境(如倒计时游戏),演示了如何通过 RL 训练使模型自发涌现推理能力。教程提供了完整代码、训练脚本和实验分析,适合开发者学习 RL 在推理任务中的应用。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力