微学AI
07-06·AI领域创作者
上海Agents-A1开源能跑长任务吗?
Claude Code
把万亿级Agent搬上8GB显卡
上周我用RTX 3070 8GB把Agents-A1拉起来跑了一圈,这可能是今年最让我惊讶的一次本地部署。先看硬指标:Agents-A1满血FP16需要约77GB显存,INT4量化后19GB就能跑。但更狠的是因为它是MoE架构(256专家,A3B激活),我跟着社区的调参贴把35层MoE权重用llama.cpp的 -ncmoe 35 分流到CPU内存,GPU只装5层MoE+线性层+KV cache。结果是: prefill 728 tok/s、decode 54 tok/s(1K上下文),125K上下文还能撑住,显存占用7.85/8.19 GB(96%满载) 。这意味着去年还必须24G甚至48G显卡才能跑的35B Agent,现在家里那台老游戏本就能扛。背后是三件事凑到一起:MoE让激活参数远小于总参数、量化压缩权重、CPU-GPU混合推理让消费级硬件也能撑。 Apache 2.0协议 意味着权重挂在Hugging Face和ModelScope上,可商用、可微调、可二次分发。闭源万亿模型给不了的"数据不出内网",一个本地推理就解决了。我自己试了MCP工具调用、Terminal列文件、模拟浏览器搜索几个典型Agent任务:响应比云端Claude Code API还快,单次推理2-3秒,内存稳定28GB。短板也在意料之中——复杂工程任务和长上下文全局推理还是不如闭源旗舰。但日常科研、调研、自动化脚本,35B的Agents-A1已经够用。如果你是预算敏感的个人开发者或团队对数据合规要求高, 别再迷信"必须调闭源API"了 。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn