Charles
07-14 · 深圳市嘉程企业咨询管理有限公司
面飞书Agent开发岗被问懵了:Embedding模型选型要考虑哪些因素?我答完面试官笑了上周面飞书AI Agent开发岗,二面面试官问了个问题:"你们RAG系统用的什么Embedding模型?选型时考虑了哪些因素?"我心想这不简单嘛:"用的BGE-M3,因为MTEB排行榜分数高。"面试官追问:"分数高就一定适合你的场景?你的文档平均多长?中文英文混合吗?需要多模态吗?维度选了多少?为什么不是768而是1024?"五连问,我又哑火了。面试官笑着说:"很多人选Embedding就跟买手机看跑分一样——分数高不代表体验好。"这句话直接把我干醒了。后来我花了两天把Embedding选型彻底梳理了一遍,发现90%的人都踩过同样的坑:坑1:只看MTEB排行榜 MTEB测的是标准数据集,跟你的业务数据可能完全不搭。比如你做法律文档检索,用通用榜单选模型,效果可能还不如专门微调过的小模型。坑2:忽略上下文长度 BGE-M3支持8192 tokens,m3e-base只有512。如果你的文档动不动几千字,512的模型直接截断,后半段内容等于没embedding。坑3:维度越高越好? 错。1536维和768维的检索精度差距可能不到2%,但存储成本翻倍。OpenAI的text-embedding-3支持套娃维度(MRL),1536维可以截断到256维用,精度几乎不掉。选型真正要考虑的6个因素(完整对比表看图1):语言支持(中文/英文/多语言)上下文长度(512 / 2048 / 8192 / 32k)向量维度(768 / 1024 / 1536 / 3072)部署方式(API / 开源本地部署)MTEB分数(参考但不唯一)特殊能力(MRL压缩 / 多模态 / 长文档)主流模型对比(图2有完整数据):BGE-M3:中文开源标杆,568M参数,支持100+语言OpenAI text-embedding-3-large:3072维+MRL,API最方便GTE-Qwen2-7B:32k超长上下文,中文C-MTEB第一Jina Embeddings v4:3.8B参数,支持文本+图像+PDF
发布于 江苏
7
5
8
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn