精选85Hugging Face 博客(RSS)模型发布/更新
3C3H基准发布:重新定义LLM评估
3C3H基准与排行榜:重新思考LLM评估
推荐理由
做模型选型和评估的同学必看,3C3H 基准从能力、成本、安全性多维度打分,比单一指标更有参考价值,赶紧去跑一下你的模型排名。
Hugging Face 发布 3C3H 基准与排行榜,旨在重新思考大语言模型(LLM)的评估方式。该基准从三个维度(C:能力、一致性、成本;H:有害性、幻觉、帮助性)全面衡量模型表现,覆盖多语言、多任务场景,并引入动态测试集以防止过拟合。首批榜单包含多个开源与闭源模型,评估结果揭示了不同模型在实用性与安全性上的权衡。该基准为开发者提供了更贴近实际应用的模型选择参考。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力