子期
2天前 · 北京测吧
大模型服务性能测试,和传统压测有什么区别
我没背指标,讲了前司大促零点的事。平时首字延迟 0.8 秒,零点流量涨十倍,首字等到 15 秒,用户盯着空白对话框关掉;部分请求 504,重试又把流量加倍,恶性循环。事后查是三件事叠加:没做过容量规划,并发水位全凭拍脑袋;推理服务没设并发限制,高并发下缓存被打满,出字速度也跟着恶化;没有降级预案,卡死时连一句"稍后再试"都给不出。面试官问怎么压。我说先换指标体系:等待体验看首字延迟 P95,流畅度看每字间隔,产能看吞吐,用阶梯加压找并发拐点——拐点就是首字延迟开始非线性上涨的位置;生产水位压在拐点七成以下,告警线设在五成,给限流和扩容留反应时间。另外压测流量必须按线上真实分布混长短文本,长上下文吃资源的速度是短请求的几十倍,全用短问题压出来的容量是假的。最后补一句:传统压测测的是接口活不活,大模型压测测的是用户等不等得起。越过拐点之后,压得越狠,死得越快。你们的大模型服务扛住大促了吗?欢迎交流。
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn