柚子知AI遇
07-09·AI领域创作者
英伟达扩散LLM双塔,业务落地靠谱吗?
双塔扩散LLM?快是真快,但别急着上
7月1日英伟达开源Nemotron-Labs-TwoTower,60B双塔扩散语言模型,吞吐量2.42倍,质量保留98.7%。我拉下来在双卡H100上跑了一下午,说点实话。架构设计确实聪明。上下文塔30B全程冻结只管语义理解,去噪塔30B专门做并行生成,两塔逐层交叉注意力连着。深度学习里扩散模型一直卡在"无法复用KV Cache"的死结上——每步所有位置都在变,缓存直接作废。双塔把理解和生成解耦,上下文塔的KV缓存能复用,算法层面的瓶颈算是从结构上绕过去了。每塔只激活3B参数配128个MoE专家,推理优化的性价比拉满。但落地有两个硬伤。第一,代码生成HumanEval从79.27掉到75.58,MATH-500从84.40跌到80.60。机器学习扩散模型天然不擅长强逻辑推理任务,数学和代码这种"一个token错全盘崩"的场景,0.8%的精度损失可能就是编译过和不过的区别。第二,双塔架构对显存有额外要求,上下文塔+去噪塔同时驻留,部署门槛比单塔AR模型高不少。三种解码模式是加分项——扩散模式跑批量内容生成,模拟AR做实时对话,标准AR兼容现有vLLM生态。但说实话,大部分团队连标准AR的部署都还没玩明白。我的判断:内容生成、合成数据这类对逻辑精度不敏感的高吞吐场景,可以试。代码和数学,老老实实用AR。
发布于 上海
分享
评论
未登录
友善发言
image-upload
评论
加载中