加林仙人
06-25·架构师·10年+
看看我搭的分布式AI推理引擎,保证笑死
4台不同显卡的PC,跑千亿参数的大模型Qwen3.5-122B-A10B,实测性能不错,256K上下文,33 tok/s。成本约3.6万,包括网线和交换机。功耗不到500W。实测下来跑小龙虾很好用,thinking模式下,15秒回复完,没有降智。代码是llama.cpp自己改的,全部改成了分布式推理,rebase到原生代码相同环境下跑下来只有10.2 tok/s。显存实际是不够的,用了UVM统一虚拟内存,将部分权重放内存中。运算的时候交换页进显存再去计算。对于长上下文做了性能优化,短上下文反而会慢一些。 大家可以一起讨论讨论。
发布于 上海
1
2
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn