知识门控任务构建协议:验证LLM Agent对私有知识的依赖
Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents
专业智能体任务通常依赖于公共语料库中缺失的惯例,但基准测试很少控制智能体是否能够访问这些惯例。我们引入了一种知识门控的任务构建协议,将任务指令与包含私有惯例、参考表和实用算符的紧凑工件分离开来。通过构建时的溯源信息、在提供工件和扣留工件条件下字节完全相同的任务指令、泄露审计以及可执行见证,使对工件的依赖变得明确且可测试。在十五个校准任务中,一种前沿智能体配置在使用工件时通过率为 68.0%,而在不使用工件时为 0%;在一个任务上,一个看似合理但不正确的工件在五轮试验中也产生了 0% 的通过率。确定性求解器和规则语料库为结构化任务提供了精确的真实值,而命名标准级评分量表支持那些无法通过单一可执行预言机进行检查的输出。相对于配置的校准屏幕保留了七个满足我们五轮实证知识门控屏幕的任务。这些实验验证了构建协议的行为;它们并未确立保留的任务能够提升训练后性能。我们在 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction 公开发布了部分任务套件及支持工具。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力