精选75Hugging Face 每日论文(json_list)论文研究
无参考后训练提升开源多语言翻译模型
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation
我们研究了使用开放大语言模型对多语言机器翻译进行无参考后训练的方法。从经过监督微调的MiLMMT-46-v0.1模型开始,我们应用组相对策略优化(GRPO),其奖励是平均两个无参考质量评估模型,并通过语言识别进行门控。然后,我们对监督微调(SFT)和强化学习(RL)模型检查点进行线性插值,以获得MiLMMT-46-v1.0。在46种语言中,所得模型在翻译质量上持续优于其SFT对应模型,超越了近期强大的开放基线模型,包括Seed-X、HY-MT2和TranslateGemma,并在与评估的专有系统(如Google Translate、Gemini 3 Pro和GPT-5)相比时,取得了领先的无参考分数。我们进一步研究了在线策略蒸馏,发现它达到了但未超越通过RL与检查点插值所达到的质量前沿。我们发布了模型和代码,以促进未来的研究。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力