Files
tech/微信公众平台/关注AI的/2026-07-31_百度开源无限OCR_跑通长程解析_核心作者YY疑是来自DeepSeek_摘要.md
T
arno 6ef0d3a091 文档(金鹏): 新增 2026-07-31 文章归档
- 汇总 2026-07-31 微信公众号 20 篇文章正文与摘要
- 金鹏.md 新增当日五大主题板块(AI办公、制造业AI、Agent自进化、OCR/TRIZ、AI治理)
- 配套 6 张主题配图
2026-07-31 13:07:41 +08:00

4.7 KiB
Raw Blame History

📊 文章摘要:百度开源无限OCR,跑通长程解析,核心作者YY疑是来自DeepSeek

原文2026-07-31_百度开源无限OCR_跑通长程解析_核心作者YY疑是来自DeepSeek.md 原文链接https://mp.weixin.qq.com/s/Fcdv7KZaLYcwlKFJjZL-4A 来源:微信公众平台 作者:关注AI的 发布日期2026-07-31 摘要日期2026-07-31 价值评级


核心命题

解码端长程突破 — 百度 Unlimited OCR 通过在解码端引入 R-SWA 注意力机制,解决了长文档 OCR 中 KV Cache 膨胀的根本瓶颈


文章概要

本文报道了百度新开源模型 Unlimited OCR,该模型以 DeepSeek OCR 为基线,核心创新在于将标准多头注意力机制替换为 R-SWA(参考滑动窗口注意力),使模型能够一次性完成数十页文档的端到端解析,而非传统逐页处理模式。在 OmniDocBench v1.5 上以 93.23% 总分超越 DeepSeek OCR 6 个百分点,拿下 SOTA。文章还提出一个大胆猜测:Unlimited OCR 的技术报告风格与 DeepSeek 极为相似,署名"YY"的 technical director 可能来自 DeepSeek 团队。


关键要点

  1. R-SWA 注意力机制是核心创新 — 将模型注意力分为参考信息(视觉 token 始终可见)和最近输出(仅保留 128 个 token 窗口),实现解码阶段 KV Cache 恒定,打破长文档解析瓶颈 [分类: 范式突破]
  2. 直接构建于 DeepSeek OCR 之上 — 未重做编码器,而是充分利用 DeepEncoder 的极限视觉压缩(256 token/页),将精力聚焦解码端 [分类: 共识]
  3. "人类抄书"类比生动贴切 — 软遗忘机制模拟人类处理长程任务的认知方式,为技术路线提供了直观的认知锚点 [分类: 共识]
  4. 长程性能优势随输出长度递增 — 6000 token 输出时速度比 DeepSeek OCR 快 35%40+ 页文档编辑距离仍低于 0.11 [分类: 共识]
  5. 核心作者来源存疑 — YY 身份未公开,是否为 DeepSeek 前研究员(如魏浩然)纯属猜测,缺乏直接证据 [分类: 争议]

批判性分析

假设前提

文章的核心假设是「R-SWA 能够在不损失准确率的前提下实现长程解析」。实验数据确实支持这一假设,但文章隐含的更强假设——"一次性端到端解析优于逐页处理"——并未充分论证。逐页处理虽有缺点,但在工程实践中可能更灵活(如容错、部分重处理)。此外,文章将"For-loop 范式"定性为"权宜之计而非迈向 AGI 的路径",这一判断隐含了对 AGI 路径的特定立场,具有争议性。

论据与逻辑

技术论证链条清晰:编码端压缩已足够 → 瓶颈在解码端 KV Cache 膨胀 → R-SWA 限制输出窗口 → 恒定计算开销实现长程。实验数据完备,覆盖多类别文档、多页数场景。但文章后半部分关于"YY 来自 DeepSeek"的猜测逻辑较弱——仅凭行文风格相似和署名不透明推断,缺乏实质证据,更像是流量导向的叙事策略而非严谨的信息挖掘。

边界与局限

1)文章未讨论 R-SWA 的 128 token 窗口是否在极端情况下(如跨页表格、跨章节语义依赖)导致信息丢失;(2)32K 上下文限制在"读完整本书"场景下仍显不足,真正常见的书籍在 32K token 下只能覆盖约 30-40 页;(3)没有讨论模型在非拉丁语系(中文竖排、阿拉伯语)长文档上的表现;(4)3B 总参数/500M 激活参数的模型规模是否足够处理极端复杂版式(如学术论文中的复杂公式)值得继续观察。


可引用金句

"原始文档始终可见,已经输出过的文本只保留最近一段。"


总体评价

亮点

  • 技术解读深入,清晰区分编码端与解码端两个瓶颈,帮助读者理解全链路优化思维
  • "人类抄书"类比极好,将复杂的技术机制转化为直觉可理解的认知模型
  • 对 R-SWA 的技术细节和实验数据呈现完整,具备独立判断的素材基础

不足

  • "YY 来自 DeepSeek"的猜测部分论述松散,缺乏实质证据,降低了文章的专业严肃性
  • 未讨论 R-SWA 的潜在局限和适用边界,偏向正面宣传口径
  • 缺少与同类方案(如长上下文 LLM 直接 OCR)的横向对比

适用场景:AI 研究员了解 OCR 前沿进展;技术决策者评估长文档处理方案;工程师理解注意力机制工程优化思路

关联建议:建议同步关注 DeepSeek OCR 原论文以对比编码端策略,以及 PaddleOCR 在工业场景的实际表现