微学AI
06-23·AI领域创作者
百度开源Unlimited OCR 3B够用吗?
DeepSeek-V4
文心
3B的OCR,真把235B按地摩擦
上周帮律所朋友处理一批合同扫描件,120页,全是表格嵌套公式加印章。借了他的3090显卡,拉了百度新开源的Unlimited OCR,3B总参数、500M激活,本能反应是"这小身板能扛住?"结果跑下来,公式CDM 92.61、表格TEDS 90.93,OmniDocBench v1.5上拿了93.23%,v1.6直接到93.92%。旁边同台竞技的Qwen3-VL 235B才89.15,Gemini-2.5 Pro也只有88.03,参数是它四百多倍的老大哥们,挨了一记闷棍。最离谱的是它一口气把40多页一次推理跑完,不分页、不复读、不越跑越慢。我把生成的Markdown复制到Word里校对,几乎不用返工。要说"够用不够用",我以前的标准是"OCR准不准",现在的标准变成了"长文档一口气读下来它断没断片"。这个3B小模型,是真的把行业默认的"必须堆参数"那条路给堵死了。技术圈的人说它背后站着疑似DeepSeek出走的魏浩然,技术总监署名叫YY,这事真假不好说,但R-SWA这套"软遗忘"思路确实漂亮——原图全程可见,输出只回看最近128个token,内存占用恒定,再长的文档都不带喘的。对我这种常年跟扫描件死磕的普通人来说,500M激活就能干翻235B,够不够用?答案都不用我说。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中