7G冲浪选手
1天前·咨询顾问·10年+
DeepSeek Harness更新多模态能力
DeepSeek Harness能看图啦
8月13号DeepSeek Harness公测那晚我熬到半夜,拉下来跑了88页论文翻译和贪吃蛇游戏,当时就觉得“脑子有了,还差点眼睛”。结果不到一周,昨晚v0.1.0-rc.8就来了,14项更新,多模态是头号重头戏。最核心的变化就一个:Agent现在能直接看图片了。/goal、/plan这些命令直接支持图文混合输入。我把一张UI截图丢进去,让它“照着这个风格帮我改页面”,它真的能看懂布局和配色。@菜单也支持引用本地文件了。更妙的是Harness的“曲线救国”方案。如果调用的模型本身不支持看图,它会自动调用OCR、颜色统计、像素扫描这些工具,把图片拆成结构化信息再交给文本模型推理。相当于给纯文本模型拼了一套“工具层视觉”。PPT截图、流程图、UI界面这些结构清晰的东西能恢复大量信息,真实照片稍微差点意思。一个Agent框架,让纯文本模型也能“看图”,这才是Harness这套“一切皆插件”架构真正厉害的地方。 公测一周就补上多模态,迭代速度确实够快。
发布于 四川
4
2
4
未登录
友善发言
image-upload
评论
加载中