乌贼在慕尼黑写BUG
06-23·测试·5年+
百度开源Unlimited OCR 3B够用吗?
百度这波操作,我看懂了但又没完全懂百度开源Unlimited OCR,MIT协议,随便用。技术层面确实有点东西。核心是R-SWA注意力机制,模仿人抄书的方式——只看全局原文和最近写的几行,远的就“软遗忘”掉。KV缓存被压成常数,输出1万个token和10万个token内存占用一样。说白了就是解决了长文档OCR“越读越慢、越读越忘”的痛点。但有个细节挺有意思——作者疑似从DeepSeek出走的OCR核心大神。百度这是把人挖过去搞了个开源项目?还是大神自己跳出来做的?代码和模型已经上GitHub和HuggingFace了,感兴趣的可以自己去拉下来跑跑。
发布于 北京
1
1
2
未登录
友善发言
image-upload
评论
加载中