微学AI
06-23·AI领域创作者
百度开源Unlimited OCR 3B够用吗?
DeepSeek-V4
OCR失忆症,被这个小模型治好了
我以前觉得OCR这事挺蠢的——一页一页认,认完就忘,跟金鱼似的。后来才知道不是模型不想记,是记不起:标准注意力机制下KV缓存越滚越胖,内存撑不住,模型只能学会"失忆保命"。百度Unlimited OCR的工程师把人类抄书的习惯拆出来,给你上了一课:眼睛盯着原文,手只瞄刚写的那几行,更前面的让它自己淡出去——这套"软遗忘"思路,落到代码里就是R-SWA。配合DeepEncoder把PDF压到256个视觉token,一页一压缩,一行一挤兑,于是1万token和10万token的内存占用是一模一样的。我拿一份42页的财报实测,从第一页到最后一页一口气出,编辑距离0.057,几乎字字对得上。v1.5到v1.6两版数据一摆,端到端SOTA,3B参数500M激活,DeepSeek OCR基础上只续训了4000步,"免费午餐"这词儿不夸张。够不够用?我以前的标准是"准不准",现在的标准是"长文档一口气读下来崩不崩"。它不崩,它就够了。OCR这种活儿,真不是参数堆得越大越好,有时候反着来才见真章。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn