雪咤
07-01·全栈工程师·5年+
Ornith开源,Copilot还稳吗?
GitHub Copilot
vLLM部署Ornith踩坑全记录
周末花了两天用vLLM把Ornith-1.0的13B版本部署到公司内部GPU服务器上,踩了不少坑分享给想搞本地部署的兄弟。第一个坑是模型格式Ornith放出的是PyTorch格式vLLM需要转成safetensors用自带的转换脚本搞定。第二个坑是显存13B版本FP16需要26GB显存单张A100刚好但4090只有24GB不够,用了AWQ量化压到13GB后4090能跑但精度损失约2%可接受。第三个坑是推理速度首次加载慢要两分钟但后续请求延迟在200毫秒内体验跟Copilot差不多。第四个坑是跟IDE集成用Continue.dev插件配置自定义endpoint连本地vLLM服务一分钟搞定。部署完后团队8个人共用一张4090零API费用无限调用,之前Copilot一个月团队费400多刀现在全省了。最大的收获是数据完全不出内网对金融和医疗团队来说这是刚需。建议想省钱的团队技术负责人赶紧搞这个投入产出比极高。
发布于 广东
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn