# 📊 文章摘要:百度开源无限OCR,跑通长程解析,核心作者YY疑是来自DeepSeek > **原文**:[2026-07-31_百度开源无限OCR_跑通长程解析_核心作者YY疑是来自DeepSeek.md](./2026-07-31_百度开源无限OCR_跑通长程解析_核心作者YY疑是来自DeepSeek.md) > **原文链接**:https://mp.weixin.qq.com/s/Fcdv7KZaLYcwlKFJjZL-4A > **来源**:微信公众平台 > **作者**:关注AI的 > **发布日期**:2026-07-31 > **摘要日期**:2026-07-31 > **价值评级**:⭐⭐⭐ 高 --- ## 核心命题 > **解码端长程突破** — 百度 Unlimited OCR 通过在解码端引入 R-SWA 注意力机制,解决了长文档 OCR 中 KV Cache 膨胀的根本瓶颈 --- ## 文章概要 本文报道了百度新开源模型 Unlimited OCR,该模型以 DeepSeek OCR 为基线,核心创新在于将标准多头注意力机制替换为 R-SWA(参考滑动窗口注意力),使模型能够一次性完成数十页文档的端到端解析,而非传统逐页处理模式。在 OmniDocBench v1.5 上以 93.23% 总分超越 DeepSeek OCR 6 个百分点,拿下 SOTA。文章还提出一个大胆猜测:Unlimited OCR 的技术报告风格与 DeepSeek 极为相似,署名"YY"的 technical director 可能来自 DeepSeek 团队。 --- ## 关键要点 1. **R-SWA 注意力机制是核心创新** — 将模型注意力分为参考信息(视觉 token 始终可见)和最近输出(仅保留 128 个 token 窗口),实现解码阶段 KV Cache 恒定,打破长文档解析瓶颈 `[分类: 范式突破]` 2. **直接构建于 DeepSeek OCR 之上** — 未重做编码器,而是充分利用 DeepEncoder 的极限视觉压缩(256 token/页),将精力聚焦解码端 `[分类: 共识]` 3. **"人类抄书"类比生动贴切** — 软遗忘机制模拟人类处理长程任务的认知方式,为技术路线提供了直观的认知锚点 `[分类: 共识]` 4. **长程性能优势随输出长度递增** — 6000 token 输出时速度比 DeepSeek OCR 快 35%,40+ 页文档编辑距离仍低于 0.11 `[分类: 共识]` 5. **核心作者来源存疑** — YY 身份未公开,是否为 DeepSeek 前研究员(如魏浩然)纯属猜测,缺乏直接证据 `[分类: 争议]` --- ## 批判性分析 ### 假设前提 文章的核心假设是「R-SWA 能够在不损失准确率的前提下实现长程解析」。实验数据确实支持这一假设,但文章隐含的更强假设——"一次性端到端解析优于逐页处理"——并未充分论证。逐页处理虽有缺点,但在工程实践中可能更灵活(如容错、部分重处理)。此外,文章将"For-loop 范式"定性为"权宜之计而非迈向 AGI 的路径",这一判断隐含了对 AGI 路径的特定立场,具有争议性。 ### 论据与逻辑 技术论证链条清晰:编码端压缩已足够 → 瓶颈在解码端 KV Cache 膨胀 → R-SWA 限制输出窗口 → 恒定计算开销实现长程。实验数据完备,覆盖多类别文档、多页数场景。但文章后半部分关于"YY 来自 DeepSeek"的猜测逻辑较弱——仅凭行文风格相似和署名不透明推断,缺乏实质证据,更像是流量导向的叙事策略而非严谨的信息挖掘。 ### 边界与局限 (1)文章未讨论 R-SWA 的 128 token 窗口是否在极端情况下(如跨页表格、跨章节语义依赖)导致信息丢失;(2)32K 上下文限制在"读完整本书"场景下仍显不足,真正常见的书籍在 32K token 下只能覆盖约 30-40 页;(3)没有讨论模型在非拉丁语系(中文竖排、阿拉伯语)长文档上的表现;(4)3B 总参数/500M 激活参数的模型规模是否足够处理极端复杂版式(如学术论文中的复杂公式)值得继续观察。 --- ## 可引用金句 > "原始文档始终可见,已经输出过的文本只保留最近一段。" --- ## 总体评价 **亮点**: - 技术解读深入,清晰区分编码端与解码端两个瓶颈,帮助读者理解全链路优化思维 - "人类抄书"类比极好,将复杂的技术机制转化为直觉可理解的认知模型 - 对 R-SWA 的技术细节和实验数据呈现完整,具备独立判断的素材基础 **不足**: - "YY 来自 DeepSeek"的猜测部分论述松散,缺乏实质证据,降低了文章的专业严肃性 - 未讨论 R-SWA 的潜在局限和适用边界,偏向正面宣传口径 - 缺少与同类方案(如长上下文 LLM 直接 OCR)的横向对比 **适用场景**:AI 研究员了解 OCR 前沿进展;技术决策者评估长文档处理方案;工程师理解注意力机制工程优化思路 **关联建议**:建议同步关注 DeepSeek OCR 原论文以对比编码端策略,以及 PaddleOCR 在工业场景的实际表现