精选70Hugging Face 博客(RSS)技巧与观点
开源模型工具调用能力基准测试方法
Is it agentic enough? Benchmarking open models on your own tooling
Hugging Face 发布了一篇博客,探讨如何评估开源模型在工具调用(tool use)方面的能力,即“代理性”(agentic)。文章指出,现有基准测试(如伯克利函数调用排行榜)存在局限性,无法反映真实场景中的工具调用表现。作者提出了一种更实用的评估方法:用户可以在自己的工具集上运行测试,通过定义工具、任务和评估指标来量化模型性能。博客还提供了使用 Hugging Face 的 smolagents 库和 Gradio 界面进行测试的示例,并展示了几个开源模型(如 Llama 3.1、Qwen 2.5)在自定义工具上的表现对比。该方法旨在帮助开发者选择最适合其特定工具链的模型。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力