小乐AI织梦笔记
1天前·AI领域创作者
DeepSeek Harness
DeepSeek-V4-Flash
DeepSeek-V4-Pro
我去!DeepSeek Harness更新后,纯文本模型也能「看图」了.DeepSeek Harness昨天更新到rc.8,我随手测了一下,发现一个有意思的事。 底座模型选的是DeepSeek V4 Pro、V4 Flash,这俩都是纯文本模型,按理说看不了图。但我往对话里丢了张图片,它居然给我返回了正确的图片描述。 ??? .纯文本模型怎么看图的? 我翻了一下执行日志,逻辑是这样的。DSH先尝试调用read_image,发现纯文本模型不支持,调用失败。然后它没有直接报错,而是启动了一个fallback机制,用OCR把图片里的文字全部提取出来,只要文字不要坐标,再把提取到的文字喂给文本模型。模型拿到这些文字之后,自己重新整理、归类,把图像内容「还原」出来。 .我实际跑了三个case,都达到了预期。 第一个,最基础的图文消息。@引用一张图片,然后问「描述这张图片」,直接返回了正确的文本总结。 第二个,/goal指令加图片。输入「/goal 描述这张图片 @02-five-types.png」,DSH能同时接收文本目标和图片输入,识别图片内容后完成goal任务。 第三个,/plan指令带图片。输入/plan后附带图片,它能读取图片信息,基于图片内容输出计划,没有忽略图片。 .坦率的讲,这个方案肯定有局限。OCR只能提取文字,如果你的图片是纯图表、照片、设计稿这类文字很少的内容,效果肯定会打折扣。但对于截图、文档图片、含文字的信息图这些场景,已经够用了。 我觉得比较有意思的地方在于,它体现了一种「能力不够,工程来凑」的思路。模型本身不支持多模态,但通过工具链的编排和fallback设计,照样能把事情做了。这也是Harness这类Agent框架的价值所在,不是等模型能力到位了再做,而是用工程手段先把体验拉上来。 .想试的话,先把DSH更新到rc.8,底座随便选V4 Pro或者Flash,然后往对话里丢张带文字的图试试就知道了。.以上全文,觉得有用的话,动动发财的小手,点点赞哦emoji
发布于 北京
3
3
4
未登录
友善发言
image-upload
评论
加载中