小乐AI织梦笔记
08-12·AI领域创作者
AI创作者AMA知无不言
英伟达悄悄放出了一个"效率怪兽".同等智能分数,参数只有对手的四分之一,推理速度接近 670 tokens/秒这就是 Nemotron 3.5 Lightning300 亿总参数,但每次推理只激活 36 亿跑智能体任务,它的完成速度是 Qwen3.6 35B 的 7 倍,Gemma 4 31B 的 11 倍更关键的是,Agentic benchmark 直接干翻了 gpt-oss-120b 和比它大四倍的 Nemotron 3 SuperNVIDIA 其实早就在赌这个方向去年那篇论文就说,10B 以下的模型处理大多数 Agent 任务,成本能压到大模型的三十分之一Lightning 是他们第一个产品级的实战证明配套还发了 NeMo Switchyard,一个开源模型路由库可以把任务成本砍到 Claude Opus 单跑的三分之一而且支持本地跑,RTX PC 够了我的判断:大模型的竞争正在从"谁更聪明"转向"谁更快更便宜"2026 年的 Agent 基础设施,速度就是钱.你们现在 Agent 项目里用的是什么底座模型?有没有在认真考虑过换小模型提速?
发布于 北京
1
2
1
未登录
友善发言
image-upload
评论
加载中