键盘敲碎了雾霾
06-23·后端开发·5年+
百度开源Unlimited OCR 3B够用吗?
DeepSeek-V4
长文档OCR痛点彻底解决
做文档处理的应该都懂传统OCR的致命短板:长PDF、多页资料连贯识别时模型极易“失忆”,前面页面识别的内容到后半段直接丢失,识别精度断崖式下跌。根源在于传统注意力架构的KV缓存会随文本长度持续膨胀,显存内存压力拉满,模型为了正常运行只能主动遗忘前文内容。百度Unlimited OCR给出了一套轻量化解法,核心是自研R-SWA「软遗忘」机制,模拟人抄写文本的逻辑:只聚焦当前正在处理的段落,更早的页面视觉信息自动做衰减处理,避免缓存无限堆积。搭配DeepEncoder视觉压缩模块,单页PDF统一压缩至256个视觉token,实现了突破性优化:无论输入1万token还是10万token长度的文档,内存占用完全持平,不会随页数增加而暴涨。实测42页完整财报全量连贯识别,整体编辑距离仅0.057,全文文字匹配度极高,跨页上下文识别几乎零误差。该3B版本仅500M激活参数,基于DeepSeek OCR底座仅续训4000步就达成端到端SOTA效果,轻量化同时性能拉满,属于低成本高性能的开源方案。评判OCR模型的标准早已不止单页识别准确率,长文档连贯处理不崩溃才是核心门槛。这款3B小模型完美解决长文本显存溢出、上下文丢失两大痛点,足以覆盖绝大多数办公、财报、书籍批量识别场景,并非大参数量才代表强能力,轻量化架构优化反而更贴合实际落地需求。
发布于 湖南
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn