小葵爱晒太阳
08-15·后端开发·5年+
Qwen3.8Max开源,如何更好本地化?
Qwen3.8-Max
Qwen3.8‑Max正式开源,不少小伙伴兴冲冲部署,结果要么显存爆,要么速度拉胯。简单说,纯fp16吃显存很高,普通消费显卡很难跑满。优先AWQ/GGUF量化,7‑8bit兼顾效果和速度。不要直接无脑最高精度。还有上下文窗口,不要直接拉满,根据业务限制窗口大小,IO和内存压力会小很多。有条件开启kv缓存优化。但是量化之后部分代码、逻辑题会掉一点性能。大家本地化踩过什么坑?
发布于 江西
分享
评论
2
未登录
友善发言
image-upload
评论
加载中