福大大架构师每日一题
06-26·AI领域创作者
AI创作者AMA知无不言
lmdeploy v0.14.0发布:FP8 KV Cache量化、Qwen3 Omni、OpenAI Responses接口、PPL端点全量升级解析本次版本更新主要包括以下几类内容:• 新增功能• FP8 KV Cache 量化• 支持 Qwen3 Omni• turbomind 后端支持 qwen3.5 视觉推理• 新增兼容 OpenAI Responses 的接口• 新增 /get_ppl 端点• 核心改进• turbomind 建模基础设施升级• CUDA 错误处理整合并增加手动堆栈追踪• 新增 Qwen3.5 Moe lite awq• sleep engine 时支持队列排空• chat completions 与 v1/messages 扩展 token-in、token-out 与 routed experts 返回• 服务端进一步对齐 OpenAI 规范• 健康检查、指标、日志概率输出、XML 工具解析器、前缀缓存、cudagraph 捕获批大小等多方向持续优化• 大量 Bug 修复• anthropic 适配器• GPT-OSS 结构化输出• 多模态 tensor 紧凑化• 老版本 VLM 预处理器• Dockerfile 依赖缺失• FA3、CUDA 版本比较、KV Cache padding、流式 usage chunk• 大图输入内存泄漏• Windows 模型加载与 CUDA 路径处理• qwen3.5 多项推理与量化问题• gdr、mtp、prefix caching、scheduler、tool-call XML 解析等多个底层问题• 文档与工程维护• 多模态模型支持文档更新• 依赖抽取、CI 调整、测试配置更新、版本冻结、版本号升级等可以看出,v0.14.0 并不是一个单点突破的小版本,而是一个覆盖功能、接口、性能、兼容性、稳定性和工程体系的综合升级版本。
发布于 北京
1
评论
1
未登录
友善发言
image-upload
评论
加载中