AI拯救打工人
07-06·AI产品经理·10年+
如何用AI Agent改造工作流
Codex自动剪视频神器:把AI发挥极致
网上挖到 browser-use 团队刚开源的 video-use,目前已经 15k+ star。试用下来最有意思的不是“AI 会剪视频了”,而是它的底层思路太工程化了。利用Agent把所有可用的工具都组合起来了。它没有让大模型傻傻地一帧帧看视频,而是先用 ElevenLabs Scribe 把视频压缩成带时间戳的文字稿,再让 Claude Code / Codex 在文本层做剪辑决策,生成 EDL 剪辑表,最后交给 FFmpeg 渲染。整个流程大概是:音频转录 → 文本打包 → Agent 推理 → 生成 EDL → FFmpeg 渲染 → timeline_view 自检 → 必要时重渲染。这套方案真正聪明的地方,是把视频这种高成本媒介,变成了 Agent 能读懂、能修改、能执行的结构化对象。它不是让 AI “看懂所有画面”,而是让 AI 先读懂时间线。大部分决策在文本里完成,只有遇到剪口、停顿、画面衔接这些关键点,才按需生成 filmstrip + waveform 的视觉视图。这就很像 browser-use 的思路:网页不给大模型看截图,而是给 DOM;视频不给大模型喂帧流,而是给 transcript + timeline。更细的地方也很有工程味:每个切口自动加 30ms 音频淡化,避免爆音;字幕最后烧录,避免被 overlay 挡住;动画可以交给 Manim、Remotion、PIL 并行生成;渲染完还会跑 timeline_view 做剪口和字幕检查,最多重试 3 次。当然,它现在更像一个面向 coding agent 的视频剪辑 skill,不是成熟的剪映替代品。代码开源,但转录依赖 ElevenLabs API;项目也还在快速迭代中。但它给了一个非常重要的启发:AI Agent 真正的突破,可能不是端到端吞掉所有复杂媒介,而是把复杂媒介拆成模型可读的结构、可控的计划、可执行的工具链。网页是 DOM,而视频就是 transcript + EDL。
发布于 广东
9
5
7
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn