精选70Hugging Face 博客(RSS)模型发布/更新
TextQuests:用文字游戏评估LLM表现
TextQuests:LLM在文字游戏中的表现评估
Hugging Face 发布 TextQuests 基准,用于评估大语言模型在文字游戏中的表现。该基准包含一系列基于文本的冒险游戏,要求模型理解上下文、制定策略并生成连贯的文本输出。初步测试显示,当前主流模型在复杂任务中仍存在明显不足,尤其在长期规划和常识推理方面。TextQuests 为评估 LLM 的交互式推理能力提供了新视角。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力