子期
2天前 · 北京测吧
大模型服务性能测试,和传统压测有什么区别
我没背指标,讲了前司大促零点的事。平时首字延迟 0.8 秒,零点流量涨十倍,首字等到 15 秒,用户盯着空白对话框关掉;部分请求 504,重试又把流量加倍,恶性循环。事后查是三件事叠加:没做过容量规划,并发水位全凭拍脑袋;推理服务没设并发限制,高并发下缓存被打满,出字速度也跟着恶化;没有降级预案,卡死时连一句"稍后再试"都给不出。面试官问怎么压。我说先换指标体系:等待体验看首字延迟 P95,流畅度看每字间隔,产能看吞吐,用阶梯加压找并发拐点——拐点就是首字延迟开始非线性上涨的位置;生产水位压在拐点七成以下,告警线设在五成,给限流和扩容留反应时间。另外压测流量必须按线上真实分布混长短文本,长上下文吃资源的速度是短请求的几十倍,全用短问题压出来的容量是假的。最后补一句:传统压测测的是接口活不活,大模型压测测的是用户等不等得起。越过拐点之后,压得越狠,死得越快。你们的大模型服务扛住大促了吗?欢迎交流。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中