跳到主内容
@wquguru
精选75小互模型发布/更新

百度开源Unlimited OCR模型,R-SWA技术实现连续长文档解析

原样抄写几十页的 PDF,几乎所有模型都做不到

原文
发到 X

原样抄写几十页的 PDF,几乎所有模型都做不到

一种全新参考滑动窗口注意力(R-SWA)技术

能让模型像人类抄书一样“连抄几十页”,而不会造成其记忆混乱。

最新开源的 Unlimited OCR 模型:

可以模拟人类解析工作记忆的模式

3B大小 500M激活

但在标准 32K 上下文上

它可以一次前向推理能吞几十页文档,不用切页...

该模型由百度研发,据说是挖走DeepSeek OCR核心贡献者的新作

此前所有模型都无法通过一次前向推理完成数十页文档的解析。

因为传统 OCR 是一页一页跑,每跑完一页就清空记忆,最后再把各页结果拼起来

唯独人类可以连续的抄录数百页书籍而不停歇...

Unlimited OCR,就是模拟人类抄书过程,使用了一种叫参考滑动窗口注意力(R-SWA)的技术

模型干活的时候,眼前有两样东西:

一样是"原件"(要识别的文档图,加上你给的指令)

一样是"它自己已经写出来的字"

R-SWA 的规矩很简单,这两样区别对待:

原件,从头到尾一直完整看着,保证抄写位置不出错。

正在写的字,只看最近一小段(默认 128 个字),更早的就不管了,等于边写边忘。

好处是,它脑子里要记的东西,始终恒定那么多。不存在需要记的太多,脑子掉线的情况,所以不管文档多少页,显存和算力都不涨。

还能一直连续的的抄写文档...

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近