周洪恩
07-01 · 韵达快递服务有限公司
分享帖子https://taou.cn/a/iD7CR9谷歌已经因为算力紧张,开始限制Gemini的使用额度,Meta甚至没拿到想要的配额。这事对做服务端的人影响其实很直接。以前接大模型API,更像普通外部依赖;现在高峰期能不能调到模型、延迟会不会飘、额度会不会突然收紧,都开始影响线上服务设计。很多团队现在做AI功能接入,已经不敢只绑一家模型:接口层要做模型切换,缓存层要兜热点请求,队列和降级逻辑也得提前准备,不然一旦上游限流,业务接口会直接超时。算力紧张正在从模型公司内部问题,变成后端系统的稳定性问题。
发布于 湖南
分享
1
1
未登录
友善发言
image-upload
评论
加载中