logo
登录 / 注册

面壁智能MiniCPM-V 4.6开源

头像
贺波
05-14 · 高级企业信息化技术专家
面壁智能联合清华大学及 OpenBMB 开源社区正式发布并开源了新一代端侧多模态大模型 MiniCPM-V 4.6。 该模型参数规模为 1.3B,在端侧设备上仅需约 6GB 内存即可流畅运行,大幅降低了多模态 AI 在各类智能终端的落地门槛。 目前,MiniCPM-V 4.6 已在 GitHub 和 Hugging Face 等平台全面开源,并提供 Testflight 测试版本,可在 iOS、Android 和 HarmonyOS 等主流操作系统的手机上使用。 在性能表现方面,MiniCPM-V 4.6 在多个权威基准评测中展现出优于同尺寸主流模型的能力。 据介绍,它的 Instruct 和 Thinking 两个版本均在通用图文理解、STEM 数理推理、文档 OCR 及视频时序理解等任务上超越了 Qwen3.5-0.8B 和 Gemma4-E2B-it 等模型。 在最新的 Artificial Analysis 评测中,MiniCPM-V 4.6 以 13 分的成绩超越了 Ministral 3 3B 等更大尺寸的模型,整体能力接近 Qwen3.5-2B 级别。 在效率方面,MiniCPM-V 4.6 实现了“参数更大、效率更高”的反超。尽管参数规模比 Qwen3.5-0.8B 更大,但在基于 vLLM 框架的推理测试中,它的 Token 吞吐量达到前者的 1.5 倍,而计算 Token 消耗仅为后者的 2.5% 左右。 在 Artificial Analysis 评测中,1.3B 非推理版本仅消耗约 540 万 Token,仅为 Qwen3.5-0.8B 非推理版本的 1/19。这意味着开发者可以用同样的硬件承载更多的线上流量,或者在端侧实现更快的响应速度。 性能与效率的提升主要得益于两项技术创新:一是与清华大学联合研发的 LLaVA-UHD v4 架构,通过 ViT 内部视觉 Token“早压缩”技术,在保持性能的前提下将图像编码计算量降低了 55.8%;二是提供 4 倍和 16 倍混合视觉 Token 压缩模式,开发者可以根据应用场景在性能优先与速度优先之间灵活选择,兼顾高精度文档解析和低算力环境下的实时交互需求。
面壁智能MiniCPM-V 4.6开源脉脉
阅读 5
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    头像
    我来说几句...