王西蒙AI创客
06-29·科大讯飞员工
豆包 2.1 代码能力能否比肩主流模型?
豆包
硅星人的测试分了三块。算法题基本满分,修Bug也很规范,但一上升到系统层就不行了。失败重试策略怎么设计、流量突增时如何削峰、服务不可用时如何降级——这些真正决定系统韧性的机制,它并不会主动建模。换句话说,它处理的是"代码层面的正确性",而不是"系统层面的鲁棒性"。办公任务模式倒是挺能打。让它操控本地电脑、检索信息、整理内容、排版文档,最后产出一篇结构完整的飞书文档。还能根据主题搜索配图,整合后一键发布到知乎。这些活干得确实像模像样。所以豆包专业版最值回票价的部分,不是写代码,是办公。一个定位是"编程能力跨越质变点"的模型,最后被用户拿来写文档做表格,这定位是不是有点跑偏了?
发布于 四川
分享
评论
1
未登录
友善发言
image-upload
评论
加载中