島上财经
1天前·银行职员·10年+
DeepSeek Harness更新多模态能力
事情是这样的,DeepSeek Harness昨天发了公测后首个大版本,14项更新里最亮眼的就是多模态能力,现在/ goal、/plan这些核心指令,直接就能接收图文混输,发张截图它也能看懂!但有个细节让我觉得挺有意思,哪怕是纯文本模型,Harness也能让它“看”图,它会先调OCR做文字识别,再结合像素扫描、颜色比例统计,把图片拆成结构化信息,再喂给文本模型推理,相当于给盲人配了根会说话的拐杖,不用换“大脑”也能感知视觉世界!我觉得这思路挺巧妙,不是非得等模型迭代,工具层就能把短板补上。
发布于 广东
1
评论
未登录
友善发言
image-upload
评论
加载中