在职摸鱼技术负责人
07-07 · 神州数智科技(北京)有限公司
转行做RAG项目的,一被问评估指标就支支吾吾,全靠肉眼翻几条结果说效果不错?我是老汪,当年摸鱼摸成CTO,面过七八十个转大模型的,八九成都栽在评估这关上。我当年从后端转AI,第一次做知识库RAG也踩过这坑,上线前全凭自己体感说没问题,被leader一句话问得哑口无言。很多人觉得项目跑通就行,评估随便应付两句,反正面试官也不会细抠。但在面试官眼里,连正经评估都没做过的项目,基本就是跟着教程跑的Demo,连最基本的工程闭环都没有。RAG项目里,评估做没做,比召回率数字多少更能体现真实项目经验。别只说“效果不错”“准确率很高”。不少人讲项目成果全是主观描述,没有任何量化支撑,面试官一听就知道没正经做过评估,纯练手项目。哪怕是小项目,也要拆出两个可落地的评估维度,不用追求复杂。我当年做内部知识库RAG,最开始也只会说回复更准了,后来补了两个简单指标:一个是召回准确率,抽50条真实query人工标注,从62%调到78%;另一个是无答案拒答率,之前瞎答的占三成,加了置信度阈值后降到8%,就这两个数,比一堆空泛的夸赞管用得多。别拿通用评测集当自己的项目成果。张口就说MMLU多少分、通用榜单排名,全是公开数据集的结果,和自己的业务场景没什么关联。在面试官看来,这就是没自己构造过评估数据,纯搬运开源成果。要讲你针对业务场景,怎么搭建的专属评估集。我们当时做客服场景RAG,根本没碰通用评测集,从历史工单里抽了200条真实用户问题,标上对应标准答案和目标文档,专门测业务场景下的召回命中率,比通用指标有说服力得多。别回避评估发现的坏case。很多人只挑好的结果说,藏着问题case不提,显得项目完美无缺。但真正做过的都懂,评估本身就是找问题的,全说好反而假。主动讲评估发现的问题,以及对应的优化动作,才是完整的项目闭环。我们第一次评估时,发现多轮对话的指代召回特别差,用户前一轮提过的产品名,后一轮用代词的时候总召回错文档,后来加了query改写模块,复测时这部分准确率提了15个百分点。其实转大模型的朋友,大多不是项目做得差,是没把评估的逻辑讲透,光说效果好没人信,有数据有闭环才扎实。都是从Demo阶段一步步踩坑过来的,没人一开始就懂完整的项目流程。我整理了RAG项目常用的评估维度和落地模板,还有一些真实业务的坏case优化案例。
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn