人生就是体验
06-29·AI领域创作者
马斯克:中国AI产业发展速度远超欧美预期
DeepSeek这动作,比发新模型都带π
DeepSeek融完500亿,我以为会放一个炸裂的新模型。结果今天一看,它亮出来的第一手牌,是一套让现有模型跑得更快的工程方案。不是V5,不是什么多模态大升级,是DSpark的推测解码框架,配合DeepSpec的训练工具链。效果是,DeepSeek-V4的生成速度直接提升了60%到85%。说真的,我第一反应是,就这?但仔细想了想,我觉得这一手牌反而比发新模型更值得聊。先用大白话讲讲DSpark到底干了什么。大模型生成文字,传统方式是一个字一个字往外蹦,每个字都要完整跑一遍模型,准确但慢。后来有人想了个办法,让一个小模型先快速打一串草稿,大模型只负责检查,对的留下,错的改掉,速度就上去了。但问题是,草稿写长了后半段基本全崩,大模型一查全部驳回,等于白算。几万人同时在线的时候,服务器拼命算一堆注定要扔掉的东西。纯浪费。DSpark做的事情就是解决这个浪费。打草稿的时候让字和字之间保留依赖关系,后半段不容易崩。然后在检查之前先估一下靠不靠谱,觉得大概率会被驳回的,干脆别查了,省下算力给别的请求用。不算什么颠覆性创新。但聪明的地方在于,不是让模型变得更强,而是让模型少做无用功。这个思路特别值得品一品。很多人一直在等DeepSeek拿到钱之后搞大动作。500亿,这个数字放在全球AI行业都是顶级融资规模了。大家期待的是什么?更大的模型,更炸的benchmark,直接对标GPT-5。但DeepSeek的第一张牌,打的是省钱。
发布于 山西
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn