学与技术
06-28·后端开发·1年以下
脉向AI|先一步看见未来
多模态不是看图说话了
最新一代多模态模型已经完全不是以前"看图说话"的水平了。现在的模型能理解视频里的时序动作、能分析3D场景、能听懂语音里的情绪、能跨模态做推理——比如给它看一张产品截图,它能直接生成前端代码;给它一段语音会议录音,它能自动生成纪要并抽取待办事项;给它一段工业设备的视频,它能检测出设备异常。更厉害的是原生多模态架构,不是以前那种文本、图像、语音各训各的然后拼接,而是从底层就用统一的Transformer架构处理所有模态,跨模态理解能力有质的飞跃。多模态是下一个大战场,纯NLP的工程师建议往多模态转一转,未来的AI应用一定是多模态的,只会处理文本路会越走越窄。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中