微学AI
07-15·AI领域创作者
腾讯混元OCR免费开放,好用吗?
1B参数,OCR进入"小钢炮"时代
腾讯混元OCR开源后,HyOCR-1.5又在2026年7月13日全栈开源,这个只有1B参数的端到端OCR专家模型,最近在OCR圈刷屏。我第一眼看到"1B"两个字时也嘀咕过——这能打过Gemini-2.5-Pro?现实打脸:在OmniDocBench v1.6端到端榜单上,HyOCR-1.5以94.74分拿下第一;在覆盖149种语言的MORE基准上,HunyuanOCR以92.42分超过第二名PaddleOCR-VL(87.96)近5分;在OCRBench上拿到860分;ICDAR 2025 DIMT小模型赛道冠军。1B打235B这种事,在通用VLM里几乎不可能,在OCR这个专项任务上却成了现实。我自己的感受:OCR是"窄而深"的任务,数据质量和任务聚焦远比参数规模重要。混元走的是"专家模型"路线——架构上用原生分辨率ViT+轻量LLM+MLP适配器,训练上首次把强化学习引入OCR,再叠加DFlash投机解码,让Transformers推理加速6.37倍,vLLM加速2.14倍,每页1.408秒。腾讯用1B参数打出了"小而美"的最强音。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中