霍格沃兹测试开发学社
08-04 · 北京测吧
72GB显卡能否撑起长上下文Agent四
2. Token间延迟:ITL或TPOTITL,即相邻输出 Token 之间的时间间隔。TPOT,即 Time Per Output Token。两者在很多场景下表达的是相近概念,但不同测试工具的具体定义可能存在差异,报告中必须明确采用哪一种计算方式。单请求生成速度可以近似表示为:输出速度 ≈ 1 ÷ TPOT但需要注意:1 ÷ median_itl只能作为近似结果,不能严格等价于“所有请求吞吐率的中位数”。更严谨的方式是:先计算每个请求的 Token 生成速度;再对请求结果计算 P50、P95和P99。3. 系统总吞吐率系统总吞吐率表示单位时间内,整个推理服务完成的 Token 数量。它与单用户吞吐率不是同一个指标。提高并发后,经常会出现:单用户输出速度下降;首字延迟增加;系统总吞吐率上升。这是动态批处理带来的典型结果。4. 峰值吞吐不能直接代表系统容量原始材料中使用了“最高吞吐量”作为重要指标。峰值数据可以反映短时间内的能力上限,但不能直接作为生产容量依据。因为峰值可能只持续一两秒,还可能受到以下因素影响:请求集中完成;批次大小突然变化;统计窗口过短;测试流量处于爬升或下降阶段。生产评估更应该关注:稳态平均吞吐率;P50、P95、P99延迟;请求成功率;长时间吞吐波动;目标SLO下的最大并发。八、4K短对话场景:并发越高,单用户体验越容易下降从测试趋势图可以看到,随着并发从1逐步提升到64:TTFT持续上升;单用户Token生成速度持续下降;系统总吞吐量在一定区间内上升;超过某个并发点后,排队和资源竞争开始明显增加。
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中