李韩飞
06-27 · 苏宁易购
架构设计
🔍百度开源Unlimited OCR
传统OCR模型处理多页文档时,每生成一个token都会扩大KV cache,导致显存占用和延迟飙升,用户体验上就是“AI越读越卡”。Unlimited OCR基于DeepSeek OCR架构,总参数量30亿,推理时仅激活5亿参数。其核心创新在于两级视觉编码+16倍token压缩——将1024×1024的PDF图像压缩为256个视觉token,从源头减轻负担。训练上冻结编码器、仅训练解码器,200万份样本(单页与多页9:1)在8×16 A800 GPU上跑4000步。在OmniDocBench v1.5上得分93.23,超越DeepSeek OCR的87.01。案例:某政务系统处理百页合同扫描件,传统模型20分钟后响应迟缓,Unlimited OCR全程保持稳定速度,编辑距离仅0.038,公式识别准确率92.61%。
发布于 江苏
2
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn