跳到主内容
@wquguru
精选70Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞)技巧与观点

RL训练中混合多模型思维链轨迹可提升策略多样性

> The CoT has a mishmash of DeepSeek-preview/GLM/Kimi features

原文
发到 X

> CoT(思维链)混合了 DeepSeek-preview/GLM/Kimi 的特性 思考:在中期训练中,很可能明智的做法是将来自不同模型在同一问题上的成功轨迹纳入其中,以最大化强化学习中的策略多样性。这是另一种形式的多智能体扩展。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近