精选70Hugging Face 博客(RSS)模型发布/更新
NPHardEval排行榜:评估LLM推理能力
NPHardEval 排行榜:通过复杂度类评估 LLM 推理能力
Hugging Face 发布 NPHardEval 排行榜,通过复杂度类(如 P、NP-hard 等)评估大型语言模型的推理能力。该基准测试包含多个难度级别的问题,旨在衡量模型在算法推理、组合优化等任务上的表现。排行榜显示,当前模型在简单问题上表现较好,但在 NP-hard 问题上仍有显著差距。该工具为研究者提供了标准化评估框架,有助于追踪推理能力的进展。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力