StartupBench:基于市场验证工作流的端到端智能体基准
StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
大型语言模型(LLMs)和智能体的最新进展显著提升了AI系统执行复杂任务的能力。然而,现有基准大多依赖于研究者选择的任务,这使得这些进展是否延伸到现实世界用户实际要求AI系统完成的工作仍不确定。我们引入了StartupBench,一个基于市场验证的AI初创公司产品的端到端(E2E)智能体基准。我们不是从预设的关于有用智能体能力的假设来定义任务,而是系统地研究那些已被证实被采纳的AI产品,连同其产品工作流程和用户,以识别AI在多个专业领域已确立实际需求的实际任务。我们将这些工作流程转化为完整的、面向交付物的任务,并通过捕捉其复杂需求的细粒度评分标准进行评估。在统一智能体框架下评估的代表性模型中,即使是最强的模型也只能成功完成StartupBench的大约30%,尽管在许多任务上取得了实质性的部分进展。进一步的分析指出,复杂指令遵循和领域特定专业知识是失败的主要来源。我们的结果显示,许多市场验证的工作流程仍超出当前通用智能体的可靠能力范围,使StartupBench成为衡量向现实世界用户任务端到端完成进展的经验性指标。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力