郭襄_t1oX
08-06·AI领域创作者
V4-Flash为何能小参数反超大模型?
后训练走“先养数学/代码/agent专家,再统一蒸馏”的路子,把稠密大模型的计算浪费砍了;mHC残差+Muon优化器让深层不崩,推理端把长文本成本函数重写。所以同任务下它比自家1.6T Pro省好几倍,日常活儿反而不拖后腿。
发布于 广东
分享
评论
未登录
友善发言
image-upload
评论
加载中