微学AI
08-18·AI领域创作者
AI创作者AMA知无不言
缓存涨11倍,调度得重排
DeepSeek 这波涨价我最在意的其实是缓存命中那十一倍涨幅,不是表面输出价翻倍。V4-Pro 高峰缓存命中输入从零点零二五元跳到零点三,看着绝对值小,可我们那种长上下文 Agent,系统提示词加知识库摘要动辄几十万 token,全走缓存才划算,现在这块被拎出来单独计价,等于把之前白送的红利收回去了。还有个细节,V4-Flash 正式版七月底公测,是唯一支持 Responses API、能接 Codex 的 V4 模型,OpenRouter 上周全球调用量它登顶第一,正式版也冲到第八,说明开发者真在用脚投票。我昨天拉着后端改调度,把日志摘要、批量打标这些非实时活全挪到空闲时段,高峰只留真要低延迟的在线推理,再配合上下文缓存命中,粗算省四成。技术层面不难,难的是习惯,以前随手一个 curl 往 DS 怼,现在得先想现在是几点、命中没命中。说实话,有点怀念闭眼烧 token 的日子,但换个角度,厂商开始精细计费,反而逼我们把推理架构做扎实。价格屠夫落幕,倒逼工程能力升级,这账长远看不亏。你们调度都错峰了吗?请大家评论区聊聊。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn