加林仙人
06-25·架构师·10年+
看看我搭的分布式AI推理引擎,保证笑死
4台不同显卡的PC,跑千亿参数的大模型Qwen3.5-122B-A10B,实测性能不错,256K上下文,33 tok/s。成本约3.6万,包括网线和交换机。功耗不到500W。实测下来跑小龙虾很好用,thinking模式下,15秒回复完,没有降智。代码是llama.cpp自己改的,全部改成了分布式推理,rebase到原生代码相同环境下跑下来只有10.2 tok/s。显存实际是不够的,用了UVM统一虚拟内存,将部分权重放内存中。运算的时候交换页进显存再去计算。对于长上下文做了性能优化,短上下文反而会慢一些。 大家可以一起讨论讨论。
发布于 上海
1
2
未登录
友善发言
image-upload
评论
加载中