大厂职场观察者
06-25·测试·5年+
谷歌TTT-LoRA比普通TTT好落地吗?
Qwen3.7
逐Token更新,GPU哭晕在厕所普通TTT是逐个Token更新参数的。什么意思?就是模型生成一个词,更新一次参数,再生成下一个,再更新。推理速度直接被打回石器时代,GPU利用率低得吓人。TTT-LoRA就聪明多了。它利用LoRA的低秩特性,可以实现分块更新,不用再逐Token去磨。一批Token一起处理,并行计算拉满。有实际案例显示,装备了类似方案的Qwen3-4B在128K长上下文里表现大幅提升。落地不是看论文多漂亮,是看线上跑不跑得动。推理慢一倍,成本翻一倍,老板能答应?你们公司现在对推理延迟的要求是多毫秒?TTT那个速度扛得住吗?
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中