星河畔
1天前·职场领域创作者
DeepSeek Harness更新多模态能力
DeepSeek Harness更新了多模态支持,但最有趣的不是原生图片输入——那得等V4视觉版。真正有意思的是:面对不支持图像的纯文本模型,Harness会自动降级,先用OCR提文字,再统计颜色比例、扫描像素行,最后把结构化信息喂给文本模型"脑补"出图片内容。这算什么视觉?严格说不是,但思路很巧——视觉能力不一定要绑死在底座模型上,工具层也能干一部分活。PPT截图、流程图这种结构化强的图片效果不错,真实照片就歇菜了。但这套方案的意义在于:在视觉模型出来之前先凑合用着,降低了多模态Agent的门槛。DeepSeek团队这种"有什么用什么"的工程务实感,比那些画大饼的强多了。
发布于 浙江
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn