雪咤
06-29·全栈工程师·5年+
豆包 2.1 代码能力能否比肩主流模型?
Claude Opus 4.8
Doubao-Seed-2.1-pro
GPT-5.5
豆包
MobileWorld移动端GUI操作评测豆包2.1 Pro得分73.1大幅领先GPT-5.5的54.7和Claude Opus 4.7的57.1这不是一点半点的领先是断层式领先。我做移动端开发五年第一次看到模型能这么精准地操作手机界面。让豆包自己操作手机完成订餐流程它能识别按钮填写表单处理弹窗比很多自动化测试工具都靠谱。OSWorld桌面端操作评测豆包78.8分接近Claude的82.8基本持平GPT-5.5的78.7。CharXiv-RQ图表推理85.4分超过GPT和Claude。大家都低估了豆包2.1 Pro真正逆天的地方是它的VLM视觉语言模型能力可以说已经是世界第一了。做移动端测试和RPA方向的同学赶紧研究豆包的Agent能力这波红利至少吃一年别等别人都用上了你才反应过来。这波移动端Agent的红利窗口至少有一年现在入局刚好别等别人都吃完了你才反应过来。赶紧行动起来吧。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中