跳到主内容
@wquguru
精选78Hugging Face 每日论文(json_list)论文研究

法律引用验证:模型难辨同案不同页的支撑关系

Is this Citation on Point?

原文
发到 X

2023年,在Mata诉Avianca案中,纽约一名法官因两名律师提交的诉状包含由ChatGPT生成的虚构引注而对其进行了制裁。此类错误大多可通过数据库检索发现;更棘手的问题是检测那些指向真实案例但并未支持其所引命题的引注——这一失败模式在现有针对法律用例的大语言模型评估中基本被忽视。本文通过两个法律语料库中获取的真实法律引注进行受控扰动,要么替换所引案例,要么仅更改同一案例内的精确页码,来研究命题级引注支持验证。我们在由此产生的示例上评估了十四种模型配置。模型能捕获93-100%的错误案例扰动。对于法院意见中的错误页码扰动,模型仅能捕获37-61%;对于法律诉状中的此类扰动,捕获率为52-83%。当模型未能捕获错误页码扰动时,它们会基于主题重叠而非页码级支持来接受引注。模型规模和扩展推理缩小了这一差距,但并未消除:GPT-5.4在高推理努力下仍遗漏了法院意见中40%的页码不匹配,以及诉状中18%的此类问题。提示模型验证所引页码处的支持可提高召回率,但同时也提升了误报率。识别正确的法律主题与验证所引命题的支持是两种不同的能力,而当前模型将二者混为一谈。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近