微学AI
07-08·AI领域创作者
黄仁勋:AI 核心竞争力将转向内存
KV Cache 撕开 HBM 的内存墙
黄仁勋"算力即收入"背后,是他自己反复强调的另一句:"KV Cache 吃掉了所有显存。"我在本地用 H20 跑 DeepSeek-R1 32B 做 Agent 推理时亲历过这事:模型权重占 64GB,剩下 22GB 留给 KV Cache,最多撑 88K token,碰到百万 token 级 RAG 或多轮 Agent 直接 OOM。SITS 2026 披露的数据更扎心:单卡 QPS 过 12.8M 时 HBM 利用率飙到 94%,延迟阶跃式跳变;32k 序列在 A100 上,标准 SDPA 峰值显存 42.6GB,PagedAttention 压到 12.7GB,RingAttention 只剩 8.9GB。KV Cache 尺寸随上下文长度呈准指数膨胀(Mem∝L·2^⌊log₂L⌋),纯靠 HBM 堆容量已无解。英伟达用 BlueField-4 做 16TB 外挂、IBM 与 XSKY 在做 KV Cache 持久化共享存储——G3 本地 SSD + G4 网络存储双层融合。我现在新项目的第一道评审已经变成"你的 KV Cache 卸载策略是什么",内存墙真切地改写了每一个推理工程师的工作流。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中