子期
08-14 · 北京测吧
【面经】宇宙厂 AI 测试开发二面复盘
按顺序把题记下来:一、项目二轮深挖(约20分钟)一面聊过的自动化平台,这次换个角度问:这个平台的ROI怎么算?你拿什么数据向老板证明它值?平台在团队内推广顺利吗?有没有人不愿意用?你怎么推动的?你做的质量改进,最终体现在哪些业务指标上?漏测率、发布效率这些有没有量化?如果让你重新设计这个平台一次,你会改哪里?为什么?平台里哪个模块是你最不满意的设计?当时为什么妥协了?二、系统设计(约25分钟,本场重头戏)现在让你从0设计一个大模型应用的评测平台,你会怎么做?(他给的约束:要支持多业务线接入、评测集版本管理、结果可视化、能接入CI卡点)评测指标怎么分层?哪些能自动化,哪些必须人工?人工标注的部分怎么保证质量?Prompt和模型版本频繁更新,你怎么设计回归和准入门槛,既能卡住质量又不阻塞算法同学的迭代速度?评测要大规模调模型,成本很高,你有哪些降本手段?(追问:缓存、采样、小模型裁判,各自的坑是什么)用LLM当裁判(LLM-as-Judge)评LLM,你怎么验证这个裁判本身是可信的?
发布于 北京
分享
1
未登录
友善发言
image-upload
评论
加载中