精选70Hugging Face 博客(RSS)模型发布/更新
Open LLM排行榜引入DROP基准深度解析
Open LLM排行榜深度解析DROP基准
Hugging Face 在其 Open LLM 排行榜中新增了 DROP(Discrete Reasoning Over Paragraphs)基准测试,用于评估大语言模型在离散推理任务上的表现。DROP 要求模型对段落中的数字、日期等实体进行精确推理和计算,涵盖算术、排序、计数等操作。该基准的加入旨在弥补现有评测对数值推理能力覆盖不足的问题。排行榜已更新多个模型的 DROP 分数,包括 Llama、Mistral 等系列。此举将推动社区更关注模型的推理能力,尤其是涉及精确数值处理的场景。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力