有干劲的巴顿在跳伞
06-23·AI领域创作者
Gemini 3.5
百度开源Unlimited OCR 3B够用吗?
Gemini
Qwen3.7
Unlimited 3B小身板大能量?
今天我们来聊聊百度刚刚开源的Unlimited OCR模型——一个总参数仅3B、实际激活参数仅500M的轻量化模型,却在OmniDocBench v1.6上拿下了93.92%的综合得分,一举刷新端到端OCR的SOTA纪录。这个“小钢炮”到底够不够用?一、数据说话:3B吊打235B先看硬指标。在OmniDocBench v1.5基准测试中,Unlimited OCR以93.23%的综合分位居前列,超越了参数量高达235B的Qwen3-VL(89.15%)和72B的Qwen2.5-VL(87.02%),甚至超过了未公布参数量的Gemini-2.5 Pro(88.03%)。更令人惊叹的是参数效率:Unlimited OCR的激活参数仅500M,不到竞品零头,却实现了性能反超。这背后是稀疏MoE架构的功劳——虽然总参数3B,但每次推理只激活500M参数,兼顾了模型容量和推理效率。二、核心技术:R-SWA如何破解“长文档失忆”传统OCR模型处理长文档时普遍存在“逐页失忆”问题——每处理完一页就清空上下文记忆,导致跨页信息丢失。原因是标准注意力机制下KV缓存随输出长度指数级增长,迫使模型不得不牺牲连贯性来维持运行效率。Unlimited OCR的核心创新在于参考滑动窗口注意力(R-SWA)**机制,它模拟人类抄书时的认知模式:眼睛盯着原文(全局参考),手只关注刚写的那几行(局部记忆),更前面的内容让它自然“软遗忘”。具体来说,R-SWA确保每个生成token能看到两类内容:全部参考token:包括完整的视觉token和提示词,保证全局感知最近128个输出token:输出区只看一个滑动窗口,KV缓存被压成常数这意味着无论处理多长的文档,内存占用始终保持恒定。配合DeepEncoder视觉压缩模块(将1024×1024的PDF页面压缩至256个视觉token,压缩率达16倍),模型在32K上下文内可一次性完成数十页文档的完整解析。实测数据显示:处理20页文档编辑距离仅0.057,40页以上仍控制在0.11以下,重复输出Distinct-35高达97%。在输出6144个token时,TPS(每秒生成token数)达7847,比DeepSeek OCR提升35%。你的业务中,如果有一个3B模型能把后者彻底解决,你愿意在边缘场景上妥协多少精度?
发布于 安徽
1
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn