小白学AI
08-04·AIGC算法·5年+
MiniMax H3多模态能力表现如何?
Minimax H3
MiniMax H3 多模态,我把它和我们已经在用的 4 个模型横向对比,先说结论:H3 不是最强的,但是性价比最高的。测试场景:商品图理解(电商场景,2000 张真实商品图)| 模型 | 准确率 | 速度(图/秒) | 单价(元/千次) ||------|--------|------------|--------------| GPT-5.6 Vision | 92% | 8 | 120 || Claude Opus 5 Vision | 90% | 6 | 100 || 豆包 Vision Pro | 86% | 15 | 25 || MiniMax H3 | 84% | 12 | 18 |H3 准确率比 GPT-5.6 低 8 个百分点,但价格只有 15%。最关键的测试:多轮图文对话(用户先发图,再发文字追问)- GPT-5.6:9 轮后开始"失忆",丢图上下文- Claude Opus 5:11 轮,稍好- 豆包 Vision Pro:6 轮就崩- H3:8 轮稳定,比豆包强,比 GPT 弱但有个反直觉的发现:H3 对中文电商术语理解超好(比如"包邮"、"满减"、"预售"这些),准确率能到 90%;对英文商品就掉到 78%。这说明 H3 是为中文场景优化的,如果你做跨境电商,GPT 更合适;做国内电商,H3 性价比无敌。我们的实际选择:商品识别走 H3(量大 + 中文为主 + 成本敏感),长图文对话走 Claude(量小 + 体验优先)。各位算法大佬,你们用 H3 踩过什么坑?多模态对齐有没有更深的对比数据?
发布于 上海
1
2
2
未登录
友善发言
image-upload
评论
加载中