精选80Hugging Face 博客(RSS)论文研究
IBM与UC Berkeley发布IT-Bench和MAST,诊断企业Agent失败原因
IBM与UC Berkeley诊断企业Agent失败原因:IT-Bench与MAST
IBM研究院与UC Berkeley联合发布IT-Bench和MAST,旨在系统诊断企业级AI Agent的失败原因。IT-Bench是一个包含11个真实企业IT任务的基准测试,涵盖故障排除、配置管理等场景;MAST(Multi-Agent Stress Test)则是一个压力测试框架,通过引入干扰、任务冲突等复杂因素,评估多Agent系统的鲁棒性。实验发现,当前主流Agent在IT-Bench上的成功率不足40%,在MAST下性能下降更显著。研究揭示了Agent在任务规划、工具调用和错误恢复等方面的常见失败模式,为改进企业Agent设计提供了方向。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力