李贤男
08-14 · Fidelity International.Senior AI Engineer
llm-d的去中心化
从中心化 Proxy 到 Sidecar:llm-d 的去中心化改进什么是 llm-dPD 分离把 prefill 和 decode 拆到不同 GPU 池,靠 NIXL/RDMA 传 KV cache。vLLM、SGLang 都原生支持,但生产环境还需要路由调度和 K8s 生命周期管理。llm-d 补的就是这一层:提供智能路由的 EPP,以及部署在每个 decode pod 里的 routing sidecar。它不改引擎本身,只做编排。vLLM 原生流程(无 llm-d)自带 toy proxy,独立进程,顺序 + pull:Proxy 先调 P,拿到 prefill 元数据后再发第二次请求给 D;D 主动用 NIXL 把 KV cache 从 P 显存拉过来才开始 decode。两次完整往返。SGLang 原生流程(无 llm-d)自带 sglang-router,并发 + push:router 生成 bootstrap_room,同时塞进发给 P 和 D 的请求;两者握手后,P 通过 RDMA 把 KV cache 写入 D 显存,D 轮询等待完成。llm-d 的去中心化改进llm-d 把两套独立的中心化组件,统一换成每个 decode pod 内的轻量 sidecar,配合 EPP 做 P/D 配对:Client → EPP → sidecar(D pod 内)→走vllm和sglang的原生pd分离流程。sidecar 不重造协议,只照搬引擎原生契约——接 vLLM 保留顺序语义,接 SGLang 保留并发语义。引擎行为不变,变的只是编排代理的位置:从外置进程搬进跟着 D pod 扩缩容的 sidecar。好处无单点瓶颈,编排能力随集群线性扩展sidecar 到本地 decode 走 localhost,延迟更低EPP 管调度、sidecar 管交接,两层解耦随 D pod 一起扩缩容,无需单独运维不 fork 引擎源码,能跟随上游版本小结llm-d 不是新协议,而是架构搬迁:编排逻辑从中心化进程搬进 per-pod sidecar。vLLM 的 pull 语义、SGLang 的 push 语义都被原样保留,llm-d 只是消除了中心化瓶颈。
发布于 辽宁
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn