老陈聊AI
08-16·AI领域创作者
AI创作者AMA知无不言
我靠!海外AI圈这个模型这么火?
老陈注意到,这几天一个来自小红书的开源模型,正在海外AI圈快速出圈。vLLM官方宣布Day-0支持,ARC-AGI团队的Greg Kamradt专门转发,LocalLLaMA社区也在讨论它。它就是dots3-note Preview。这是一个280B Moe模型,每次激活16B参数。相当于背后有一支2800亿参数的“专家团”,每次只请最相关的160亿参数上场。支持 512K上下文,也能同时理解文字、图片、视频和语音。官方评测中,ARC-AGI-2得分81.4,Claw-Eval得分73.4,SWE-bench-pro编程任务得分61.0,VoiceBench语音理解得分92.4。(详见配图)它不是每项第一,但推理、Agent、编程和多模态都进入了头部竞争区。那么,问题来了:海外AI圈为什么这么关注它呢?其中最重要的一个,老陈觉得它针对真实生活中的长程任务所做的优化。简单来说,智能体=model+harness,通过规划、调用各种工具、执行沙箱代码等组合完成复杂现实任务,相信用过Codex、workbuddy等工具的同学们都有体会,复杂任务长期执行过程中,整体流程很长,最后的结果其实并不一直那么稳。dots模型引入了self-critique(自我评价)方法,在中间状态持续评价自身进展,让Agent在执行任务的过程中“边做边学”。这个迭代式自我评估,之前在今年的 IMO真题上拿到了满分成绩,老陈前面也做过跟进介绍。第二个亮点就是dots模型的多模态综合处理能力。DeepSeek现在还是纯文本能力,glm等也只是扩展了图像理解等视觉能力,dots3模型文本、视觉和语音理解能力都有,本身百亿级不算大,老陈觉得有算力条件、需要私有化部署的企业,dots3 作为智能体基座模型,可以支持更多的场景任务。小红书也构建了包括vibesearch和vibelife两个bench,分别来评估智能体多轮搜索和动态环境下的长程处理能力。这也给老陈一个启发,AI Agent的下一场竞争,可能不再只是哪个skill更好、哪个harness更稳,而是谁能真正陪用户把一件真事长期做成。#老陈聊AI #dots3note #AI智能体 #AIAgent #开源大模型 #多模态AI #人工智能
发布于 湖南
4
4
2
未登录
友善发言
image-upload
评论
加载中