人生就是体验
06-28·AI领域创作者
杨立昆:AI高成本将引发行业估值泡沫破裂
DeepSeek发布DSpark
昨天DeepSeek携手北京大学正式推出大模型推理加速框架 DSpark,并进行了全流程开源。DSpark主要是专门解决高并发生产环境中大模型"生成慢"的问题。简单来说,就是解决了下面2个瓶颈。传统大模型的通病(逐一预测方法→很慢):大模型回答原本是一个字一个字地"接龙"。但如果n个人同时提问(高并发),服务器计算不过来,用户就会感觉卡顿。传统加速方法的问题(一次性预测→浪费资源): 为了解决"慢"的问题,后来尝试让小模型"一次性猜一串字"来加速,再让大模型集中验证。但这种越往后猜得越不准。大模型一拒绝,之前的计算资源就浪费了。DSpark是如何解决的?“逐字接龙卡顿”的问题: 依然用"一次性预测"的解方法,但DSpark这次升级了小模型,提高了一次性预测的文稿正确率,让小模型能"带着前后逻辑"连贯地猜,大模型几乎不用修改就能直接通过,从而实现无损的极速吐字。“越往后越不准、资源浪费”的问题: DSpark建立动态验证机制,刚刚理解类似于用"潮汐车道"的解决方法。人少空闲时,就放开了让小模型多猜、拉满速度;人多(高并发)时,就稳定输出,不让无效猜测拖垮服务器。DSpark的效果如何?速度提升了 60% 至 85%: 在不影响大模型原本输出质量的前提下,DSpark 让线上真实生产环境的单用户字生成速度提升了 60% 至 85%。高并发吞吐量提升了 51% 至 400%: 在高并发的环境中,DSpark将系统的整体吞吐能力提升了 51% 到 400%。以后服务器在高并发时不仅不会垮,反而能多处理数倍的请求。
发布于 山西
分享
评论
未登录
友善发言
image-upload
评论
加载中