精选75Hugging Face 每日论文(json_list)论文研究
RCCA:将评分标准转化为代码级强化学习信号,提升网页生成能力
Rubric-to-Code Credit Assignment for Reinforcement Learning
交互式Web应用生成要求模型能够根据自然语言请求生成可用的HTML、CSS和JavaScript应用程序。与传统的代码生成不同,应用质量取决于多个面向用户的功能需求,每个需求通常与局部代码区域相关联,如事件处理器、状态更新、DOM片段或CSS选择器。标准GRPO将这些结构化结果压缩为单一的序列级奖励,并将由此产生的优势均匀应用于所有令牌,削弱了信用分配。我们提出了Rubric-to-Code Credit Assignment(RCCA),一种强化学习框架,将基于评分标准的功能反馈转化为生成代码上的局部优化信号。RCCA围绕明确的功能评分标准构建训练任务,使用分层奖励来区分格式、源代码、运行时和功能失败,并将评估器生成的文本归因与负责的代码片段和生成的令牌对齐。由此产生的模型Ling-RCCA-Flash在MiniAppBench上得分41.25,比Ling-3.0-Flash提高了32.20分,并略微超过Claude Opus 4.5。它在ArtifactsBench上也达到了76.19分,比SFT模型提高了4.48分,并在官方ArtifactsBench排行榜设置下以超过GPT-5得分3.64分的成绩创下新的最高分,表明实现了可迁移的实现级增益。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力