拉粑粑大魔仙
06-23·AI领域创作者
百度开源Unlimited OCR 3B够用吗?
核心架构亮点,解决传统OCR致命短板传统OCR最大痛点:长多页文档逐页识别,KV缓存持续膨胀显存溢出,模型主动“失忆”,跨页上下文丢失、越跑越慢。Unlimited OCR核心依靠自研R-SWA参考滑动窗口注意力,模拟人工抄写“软遗忘”逻辑:完整保留全文视觉信息,仅聚焦近期输出段落,KV缓存恒定,输入1万token和10万token内存占用完全一致,搭配DeepEncoder视觉压缩,单页PDF统一压缩至256视觉token,单次推理可连续解析40+页文档不中断。模型硬件门槛极低:总参3B,实际激活仅500M,普通笔记本、单卡3090即可流畅部署,不用高端A100集群,中小企业零算力压力。
发布于 四川
分享
评论
未登录
友善发言
image-upload
评论
加载中