跳到主内容
@wquguru
精选88Hugging Face 每日论文(json_list)论文研究

Hugging Face论文:基于生产流量分析的LLM后训练与专家合并实践

From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix

原文
发到 X
推荐理由

提供了一套从生产流量分析到后训练合并的完整工程闭环,参数与效果数据详实,对做私有化部署和降本增效的团队极具参考价值。

数据驻留限制迫使企业自行托管大语言模型(LLM),但持续采用新模型而不退役旧模型会扩大服务集群,从而分割有限的 GPU 资源池。我们通过生产错误分析在三个维度上识别出的质量差距——指令遵循、函数调用和内部任务分布——来缩小这些差距,并将来自 200 多个内部应用程序的流量整合到单一模型上。质量通过分层匹配生产流量的离线基准进行测试,并由确定性验证器或校准后的大语言模型裁判进行评分。为了避免联合优化所有目标时引入跨域奖励干扰,我们针对每个维度训练一个独立的 GRPO 专家,并通过两阶段 SLERP 将它们合并。每个专家的奖励机制暴露出不同的失败模式,即语义崩溃、过度调用和冗长漏洞利用,每种模式都需要特定领域的修复方案。在非推理模式下,该配方在内部 Arena 上的总参数量比基线模型小约 7 倍的情况下,取得了 69.6 对 65.8 的成绩;在指令遵循方面达到 0.85 对 0.83,在函数调用方面达到 0.79 对 0.77,同时提升了通用对话基准测试的表现。该模型承担了平台 50% 的流量,每月处理 1.16 亿次请求,而服务成本仅为原来的一小部分。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近