精选75Hugging Face 博客(RSS)模型发布/更新
Judge Arena:评估LLM作为评判者的新基准
Judge Arena:评估LLM作为评判者的基准
Hugging Face 发布 Judge Arena,一个用于评估大型语言模型(LLM)作为评判者能力的基准平台。该平台通过让不同LLM对模型输出进行成对比较,并利用人类偏好投票来排名,从而衡量LLM的评判质量。Judge Arena 旨在解决LLM作为评估器时的可靠性和一致性问题,为AI社区提供更客观的模型评估工具。目前已有多个主流模型参与排名,包括GPT-4、Claude等。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力