LandingAI 先分类后抽取文档解析范式
LandingAI 的「先分类后抽取」文档解析范式
LandingAI 的「先分类后抽取」文档解析范式
把传统文档解析「按统一规则硬抽」的盲抽方式,改成先给每一页打标签、再用对应 schema 抽取的流水线,让解析器从「盲读」变为「看懂再读」。
痛点:盲抽的根因 一份贷款申请 PDF 里往往混杂工资单、银行流水、税表、身份证件,传统解析器对所有页面套同一套字段模板。结果是:从税表里抽「净薪资」、从身份证页里抽「账户号」——抽出的是「模板要的」,而不是「页面有的」。本质问题是解析器不知道自己在解析什么。
解法:Classification before Extraction 整个工作流被拆成两个明确阶段,关键在于顺序:
阶段 1 — ADE Classify(先分类) · 逐页并发评估,为每一页独立分配类别标签(注意粒度是 page,不是 document,因为一份 PDF 内可能跨类型)。 · 类别路由到对应流水线:工资单 → 工资单流水线、银行流水 → 银行流水流水线。 · outlier 兜底:不符合任何已知类别的页面不会硬塞,而是被标记并给出建议类别,交给人工或后续流程处理。
阶段 2 — ADE Extract(后抽取) · 按类别应用对应的 Pydantic schema,而非一套通配 schema。 · 工资单 → 雇员姓名、发薪周期、毛薪、净薪 · 银行流水 → 银行名、账号、余额 · 核心反转:schema 跟着页面走,而不是页面去凑 schema。
不可忽视的工程价值:Visual Grounding 每个抽出的值都带回两类引用: · chunk reference:映射回解析文档的具体切片 · page-level bounding box:在原图上框出该数值的来源区域
这意味着每个数字都可回溯到源——这在金融、合规、审计场景里不是「nice to have」,而是审计链 (audit trail) 的硬要求。LLM 抽取最被诟病的「凭空生成」在这里被物理坐标证伪。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力