- 汇总 2026-07-31 微信公众号 20 篇文章正文与摘要 - 金鹏.md 新增当日五大主题板块(AI办公、制造业AI、Agent自进化、OCR/TRIZ、AI治理) - 配套 6 张主题配图
3.2 KiB
新品上线|Unlimited-OCR 企业级服务邀您体验!
来源:微信公众平台 作者:百度智能云 发布日期:2026-07-31 原文链接:https://mp.weixin.qq.com/s/Bf_Z-XQnkPCDMnqM-jcQfw
几十页的财报、上百条款的合同、图文并茂的研报、扫描件堆成的档案——企业里的这些文档,数量庞大、内容密集、格式复杂。它们是高价值的信息资产,但也是智能化应用落地过程中最难啃的骨头。想要把这类长文档送进知识库、接入大模型、做智能审阅,第一步都离不开 OCR。
而过去的 OCR,受限于模型瓶颈,面对长文档时几乎都绕不开这样的预处理方案:逐页识别、分段拼接、人工校对。页数越多,链路越长,结构越容易错,成本越不可控。
近日,面向长文档解析场景打造的 Unlimited-OCR 一经发布,迅速获得全球开发者的广泛关注,GitHub Star 五天破万,位列 HuggingFace 全球多模态大模型榜单第一。
百度智能云同步开放 文档解析(Unlimited-OCR)企业级 API 服务,限时免费体验,开箱即用、快速集成。
开创长文档解析新时代
传统 OCR 模型在面向长文本时,解码阶段的 KV Cache 会随着输出长度持续增长——识别内容越多,占用显存越大,推理速度越慢。
逐页识别+结果拼接是工程的方案,但不是技术的终点。Unlimited-OCR 开创性地推出了 R-SWA(Reference Sliding Window Attention)机制。
其核心灵感源自人类阅读与摘抄长文档时的认知模式:始终将注意力锚定在原始文档上,同时仅将最近生成的片段作为"工作记忆",而非无限制地累积全部历史信息。得益于这一设计,模型能够在单次前向推理中一气呵成地完成数十页文档的解析,实现从首页到末页的连贯输出,同时将解码阶段的 KV Cache 维持在固定规模,从而确保计算开销与显存占用不会随输出长度持续膨胀。
用实力说话!
Unlimited-OCR 总参数 3B,推理时激活参数约 570M,轻量高效。在 OmniDocBench v1.6 基准测试中,Unlimited-OCR 取得 93.92% 综合成绩,刷新端到端 OCR 领域最新纪录。与 DeepSeek OCR 相比,真实文档场景推理速度提升约 12.7%;当输出长度达到 6000 tokens 时,速度优势扩大至 35%——输出越长,优势越明显,这正是长文档场景最需要的特性。
即便面对 40+ 页的超长文档,模型依然保持连贯输出,极少出现内容遗漏或错位。
不只是 OCR
Unlimited-OCR 的价值,不只是"能识别更长的文档"。它更重要的意义,在于为长文档场景的 AI 应用提供了一个可靠的数据入口。
合同、财报、档案、论文、知识手册——这些沉睡在 PDF 和扫描件里的内容,通过 Unlimited-OCR 解析后,可以直接以 Markdown 或 JSON 的形式进入知识库、RAG 系统、智能体工作流。由此可见,文档解析(Unlimited-OCR)不是在做文档数字化的最后一步,而是在做企业文档智能化的第一步。
文档解析(Unlimited-OCR)现已开启限时免费体验,点击「阅读原文」,立即体验