260729|我参考 ChatCut,用 Codex 跑通了一套 AI 剪辑工作流》(1)

AI剪辑的核心资产是判断规则,不是工具

主要观点

面对ChatCut积分消耗高、导出受套餐限制且错误难追踪的问题,实践者没有继续购买成品服务,而是借助公开的MCP协议、16个skill文件和40多个工具定义,重组出自有流程。最有操作价值的不是炫技式全自动,而是把删口癖、语义删改、画面选择和动画生产分层,每层都留下可读、可审核的结果。首轮发布又证明,自动出片只能解决产能,真正影响表现的仍是前三秒、信息密度、CTA位置、平台画幅与互动设计;系统应围绕真实数据持续修正。

关键要点

  • ChatCut将口播清理拆成两步:先用固定口癖词表和静音压缩做机械清理,再重新通读进行语义编辑。“去口癖”与“判断一句话是否该保留”不能合并,否则模型容易误删。
  • 编辑结果被物化为timeline.md:删除用删除线、调序用移动行,最后通过apply_script落回时间线。相比直接操作JSON,这种中间格式便于人工发现错误、修改和追溯。
  • 一条3分钟口播处理到导出FCPXML约需5-8分钟,其中AI运行2-3分钟,其余时间用于网页审核;方言和专业术语仍可能转录错误,火山引擎的模型API选择也增加了配置成本。
  • 分镜采用六类“观众任务”:无明确需求时留真人,需要章节感用小节标签,数字与关键词用浮层,抽象流程用图解动画,真实证据用截图或录屏,节奏调节则改变景别。画面切换由信息需求触发,而非按固定秒数堆素材。
  • A-roll一旦定稿后再调整语序,所有分镜起止时间都会失效,因此流程必须设置硬门禁:口播时间线未锁定,不启动下游分镜。动画还需检查平台安全区,否则标题可能被抖音头像区等界面元素遮挡。
  • 首批数据揭示了产能与效果的落差:抖音互动率为1.6%,同类作者为9.1%;完播率为1.4%,同类作者为21.6%。另一次规则检查发现87.47秒视频的CTA位于81秒,约在片长92.6%处,说明问题更多出在内容结构而非剪辑自动化程度。

建议带着这些问题阅读

  • 如何把“观众任务”进一步转化为可量化、可用发布数据验证的分镜规则?
  • 当A-roll变化会使下游时间点全部失效时,能否用语义锚点替代绝对时间码来降低返工成本?
  • 在完播与互动明显偏低的情况下,应优先调整脚本结构、视频长度还是画面密度?
滚动至顶部