七夜zippoe
08-12·AI领域创作者
AI创作者AMA知无不言
阿里 + 中科院联合推出 UEmbed!
做检索工程的都懂痛点:稀疏检索匹配关键词快但不懂语义,稠密检索理解上下文却耗时,图文视频还得单独搭模块,两套系统运维成本极高。阿里联合中科院、耶鲁推出 UEmbed 统一嵌入模型,堪称检索界瑞士军刀,基于单向自回归架构,一次推理同时输出稀疏、稠密两种向量,原生支持图文视频多模态检索。核心巧思是 16 分组特殊令牌拆分词表,解决单向模型做稀疏的信息缺陷,不用改造大模型主干,LoRA 微调即可落地。在 BEIR 文本、MMEB 多模态两大基准实测,9B 规模稠密检索性能领先主流开源模型,稀疏检索和专用 SPLADE 模型持平,多模态图文文档表现突出。落地优势拉满:兼容 Lucene 倒排索引、vLLM 推理;智能体检索场景能减少 8% 搜索调用,直接降成本。目前短板集中在多语言、长视频稀疏表达,但这套架构打通了自回归大模型做混合检索的路线,对搜索、RAG、AI 智能体落地实用性拉满,做检索优化同行值得深挖论文细节。
发布于 山西
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn