袁嘉林
07-01 · 上海菲星萌网络科技有限公司 CEO
千亿级分布式推理引擎达到61tok/s
我在llama.cpp上写的分布式推理引擎,在4或5节点上达到了 2并发61 tok/s,5节点是Qwen3.5-122B-A10B-Q4_K_M,改了各节点异步推理,最后被拉胯的3080 laptop显卡拖累了。改回了4节点,不过用了Qwen3.5-122B-A10B-Q3_XXS。对推理算法做了优化,对比测试下来精度基本一致,损失很小,还做了推理剪枝,每层推理后剔除无关的专家,减少了算力损耗,workbuddy也跑的飞快。单请求也达到了Gen 33.1 tok/s,还优化了输入处理速度,对于长文本上下文256K特殊优化,最高可达700 tok/s。 我这边都是256K上下文,是因为我用agent需要上传上下文和技能工具信息,所以上下文不能太少。 预告:我自己手搓的通用智能体要写好了,准备开源,正在测试中,对标hermes,目前和hermes赛马,看看是否能超越hermes,主打低幻觉,多职能,兼容hermes和openclaw的技能。从0开始写的,没有在hermes的代码上改,所以bug可能会比较多,等开源后,希望大家多参与公测和多提意见 。
发布于 上海
分享
评论
未登录
友善发言
image-upload
评论
加载中