卓智/Skill 产品线/SKILL-04 · 金鱼影视流程 ID: SKILL-04-JINYU15 节点实测
Skill · AI 影视生产

金鱼:把 AI 短片做成「流水线」——从剧本到成片的 15 节点生产流程

更新:2026-10 · 阅读约 12 分钟 · 文末含获取方式与推广说明

这不是一篇「提示词集合」,而是一套可复用的工业生产规范:什么时候该用哪个模型、素材怎么命名归档、角色怎么锁脸、视频为什么要按段生成、哪一步容易翻车、翻车了怎么修。所有步骤均来自真实生产:婚礼短片(76 秒成片,全流程数字账在第四节)的完整实操 + RHTV 原范例的题材参考。

用 AI 做一个短片不难,难的是做出一条能交付的片子:人物第 3 个镜头就换了脸、同一件衣服颜色前后不一致、背景突然从宫殿变成了灰棚、字幕被烧进画面、音乐忽大忽小……这些问题的根源不是模型不行,而是流程没有工程化。这套「金鱼」流程要解决的就是这件事——把一部短片拆成 15 个可检查、可回退、可并行生产的节点。

15 节点从剧本到成片的完整流水线
76.2 秒真实成片:1829 帧 / 高清 2880×1664
¥0.064/条单条 10 秒视频生成实测成本

这套流程能做什么

  • AI 剧情短片 / 漫剧:从一句需求到成片(分镜、角色、场景、台词、配乐、字幕全链);
  • 角色一致性控制:三视图 + 定妆照 + 脸部裁切的多参考体系,跨镜头、跨段落锁住同一个人的脸;
  • 专业级后期:整片高清修复(FlashVSR)、原生对白修复、字幕识别校对、交付校验;
  • 真实照片入片:把真人照片变成同款 AI 角色,或让照片以「镜中世界」的方式出现在剧情里;
  • 成本可控:生图按张计价(几分钱到几毛钱),视频按段生成(10 秒约 ¥0.06 级),全流程费用透明可预算。

全流程总览:15 个节点

整条流水线分三段:前期(1–9 节点,建立世界观与资产)→ 生成(10–11 节点,产出画面与视频)→ 后期(12–15 节点,剪辑成片)。每一步都有明确的输入、输出和验收标准,不会「做一步看一步」。

前期 · 资产建立 ①–⑨ ① 剧本 场次 · 对白结构化 ② 分镜脚本 16 镜 × 7 字段 ③ 演员生成 脸部裁切 · 锁脸 ④ 三视图 写实参考底 ⑤ 定妆 妆容 · 发型 · 服饰 ▼ 由 ③④⑤ 派生资产,并行制作 ⑥ 角色声音 音色参考 ⑦ 服装资产 无人物 · 无文字 ⑧ 道具资产 外观 · 材质 ⑨ 场景资产 空间 · 光源 · 元素 生成 · 画面与视频 ⑩–⑪ ⑩ 首帧锚点 每段第一帧定稿 —— 全片一致性基准 ⑪ 四宫格 + 按段视频 2–4 镜/段 · 段间过渡 · 原生对白 后期 · 成片闭环 ⑫–⑮ ⑫ 剪辑 + 修音 原生对白驱动时间轴 ⑬ 整片高清 FlashVSR 按帧覆盖 ⑭ 字幕 识别 + 逐句人工校对 ⑮ 交付 校验值 · 完整交付包
金鱼全流程:前期建立资产与风格基准 → 生成阶段锁定画面与视频 → 后期完成剪辑、高清与交付
#节点产出物关键点
1剧本场次/地点/时间/人物 + 对白结构化格式,动作与台词分离
2导演分镜脚本16 镜 7 字段表(镜号/景别/运镜/情绪/台词/音效/时长)每 8 镜一张手绘 contact sheet
3演员生成角色参考图授权脸部裁切 → 明确「严格锁定面部特征」
4三视图正面/侧面/背面全身 + 面部特写纯灰摄影棚底、白 T 短裤,不带风格滤镜
5化妆与发型定妆图妆容/发型/服饰三段式描述
6角色声音音色参考mp3 参考 + 音色描述
7–9服装 / 道具 / 场景资产资产参考图无人物、无文字、无水印
10首帧锚点每段第一帧定稿锚点 = 全片一致性的唯一基准
11四宫格 + 视频分镜四宫格 + 按段视频整段一次生成,段间用过渡衔接
12剪辑 + 修音无字幕母版时间轴原生对白驱动,局部问题局部修
13整片高清高清无字幕母版FlashVSR 按帧覆盖、按序拼接
14字幕字幕成片 + SRT从最终音轨识别,逐句人工校对
15交付完整交付包路径/时长/尺寸/大小/校验值齐全
RHTV 原画布「导演分镜表」contact sheet 模板截图
原始画布范例截图:RHTV「导演分镜表」contact sheet 模板——列头固定为 镜号 / 分镜图 / 景别 / 运镜 / 情绪·动作 / 台词 / 音效 / 时长(每段 8 镜一张)。来源:YZ_金鱼 RunningHub 原范例画布

这套流程从哪里来:源起与蒸馏

先说清楚出处:这套生产流程不是凭空发明的,它蒸馏自 B 站 UP 主 YZ_金鱼(57000+ 粉的 AI 影视技术分享作者)的实战教学和其在 RunningHub 上的官方画布范例。原始素材是「一小时的长视频 + 一张画布」,信息密度极高,但视频里的执行细节散落在几十分钟的口播里,画布也只能「看」不能直接跑。

我做的工作就是蒸馏:把长视频和画布里散落的做法,提炼成 15 个节点的标准流程、每个节点的 prompt 骨架、命名规范与验收标准,再加上我自己实战项目(婚礼短片,以及后续多个测试片段)踩出来的几十条坑位清单——最终变成一套AI Agent 可以直接照着执行的生产规范。这样你可以:

  • 直接使用:拿到 Skill 就能开工,不用先看一小时视频、不用自己总结;
  • 回到源头查看:想深入理解原始思路,可以去看原视频与原画布(链接在下面),两者互补。
原始来源链接说明
原视频 · 专业流程讲解B站 BV1YURLBTEwi《目前最详细的AI影视剧创作专业流程讲解》:运用传统影视工业流程思维,1 小时完整讲解
原视频 · H3 工作流讲解B站 BV1w1u26hEQ7《MiniMax H3 AI影视剧专业创作流程思路讲解》:多合一工作流、提示词 Skills、使用技巧
原画布 · 范例《赛博精神病诊疗》RunningHub canvas 2099660115945123841RHTV 原范例画布(需登录 RunningHub 查看)
原 TV 项目入口RunningHub camp 2050163786811203586RHTV 项目页(需登录)

说明:原始视频与画布版权归原作者所有,本页仅作来源标注与学习指引;本 Skill 中的蒸馏规范、扩展节点与踩坑清单为原创整理。

三条「铁律」,比任何提示词都重要

铁律一:画面里永远不要出现文字

模型生成的文字 99% 是乱码,而且会毁掉镜头。所有字幕、标题、祝福语一律后期叠加;生成阶段的 prompt 里必须显式禁止「字幕/文字/水印/Logo」。这条从第一节点贯彻到最后交付。

铁律二:参考底和最终风格要分层

角色三视图 / 定妆 / 服装 / 道具这些资产阶段全部用写实摄影棚风格(中性白 T、纯灰背景),最后的首帧和视频才套用项目风格(3D 仙侠 / 写实都市 / 胶片复古)。把最终风格提前绑死在资产上,后面所有服装场景都要重做。

铁律三:锁脸只用「脸部裁切特写」

身份参考禁止使用整张生活照或定妆图全图——脸占比太小,身份信号会被稀释。正确做法是从三视图和定妆图里裁出面部特写作为参考,画面里有几个人就给几张裁切,prompt 里逐张绑定「谁的脸以哪张为准」。

RHTV 原画布「男演员多视图」节点及 prompt 截图
原始画布范例截图:RHTV「男演员多视图」节点及其 prompt——三视图规范:上 1 张面部特写 + 下 3 张全身(正面 / 侧面 45° / 背面),纯灰暗调摄影棚 + 白 T 短袖 + 短裤 + 无鞋。来源:YZ_金鱼 RunningHub 原范例画布

一条「强制门禁」:生成前先做白模预演

这套流程里有一个别家教程很少提的环节,也是成片质量的保险丝:凡是复杂段落,进首帧生成之前,默认先做一次 3D 白模预演(用 Blender 或网页白模工具搭出场景、摆好人物、排好镜头),产出一段"结构参考视频"。

它解决的是 AI 视频最贵的浪费:一条 10 秒镜头生成要花钱花时间,构图/遮挡/走位错了,重做就是双倍成本。白模预演把"结构问题"提前暴露在便宜的环节——预演视频还能直接作为正式生成时的结构参考(video1 槽位)。

下面任一条件成立时,这道门禁不得跳过:

  • 画面里有两名以上角色;
  • 镜头有推拉、摇移、跟随、升降或明显景别变化;
  • 场景里有门、镜子、台阶、桌面这类影响遮挡的结构;
  • 需要复现参考视频的动作节奏或空间连续性;
  • 该段之前出现过人物漂移、道具消失、灰棚污染、跳景或接缝问题。
设计哲学一句话:能用便宜手段暴露的问题,绝不留给贵的环节暴露。这条思想贯穿整个 15 节点流程。

真实踩坑:AI 影视生产会被「整」的 N 种死法

下面这些坑全部来自真实生产(婚礼短片实测 + 流程验证),每一条都对应流程里的一条验收标准——这些才是这套 Skill 里最贵的部分:

你看到的现象真实原因流程里的防法
反复生成,人物就是不是本人初始身份裁切拿错了——根源在第一步就错,后续 prompt 救不回来先确认"哪张是谁";只用批准过的脸部裁切
修一个人,结果全家人脸都开始漂参考图只覆盖目标人物,但模型连带改了别人全员脸部裁切逐张绑定,保留眼镜、年龄感,逐一对照验收
脸看起来没问题,下游还一直漂三视图那一步本身就漂了、脸在整图里太小查资产链回到源头修,不换回随意生活照
越修越怪,错构图被"焊死"把坏图当构图参考又喂了回去——错误被迭代强化只用批准过的锚点;坏图永不回喂
双人相框里出现两个新郎/拼接脸竖框比例不适合横向双人照,模型自己裁剪重组先检查镜框几何;真实照片优先后期贴入空框
古装片里烟花一切景回到现代只写了"放烟花",没有绑定主片世界观绑定尾帧、全员身份和场景,只喂本镜出镜角色
同样的 6 张参考,有时成功有时失败其他参数(工作流/时长)其实不同记录完整配方;不把一次成功写成无条件支持
高清整片只完成了"烟花测试片"覆盖范围没核对完整时间轴逐片检查范围/顺序/帧数/总时长
片段尾部突然一切景变"灰色摄影棚"身份参考的风格污染了场景——照片被模型当成全场景参考prompt 连写三遍"照片只在镜框内 + NEVER grey studio";锚点锁场景
双竖窄框里放横版合照=裁剪灾难(被读成"两个男人")镜框比例与照片比例冲突,模型自行裁剪重组双槽喂同一张照片;真实照片优先后期透视贴入空框
看这 8 条的共同规律:AI 影视翻车从来不是"模型不够强",而是流程没有把错误拦在便宜的环节——错误的参考图、坏掉的中间产物、没绑定的世界观,一旦进了生成环节,就要花真金白银重来。

一部真实成片的数字账(全流程实测)

空谈流程不如上账本。这是一部真实交付的婚礼短片——从 11 个镜头到最终成片——的全部真实数字:

环节实测数字
成片规模11 镜 / 5 段 + 4 条 3 秒 AI 过渡;最终 76.208 秒、24fps、1829 帧、高清 2880×1664
单条视频生成(H3)¥0.064 / 条(10.1 秒,墙钟约 329 秒);5 条 10s 批量约 ¥0.32
AI 过渡段3 秒过渡 ¥0.02–0.04 / 条
整片高清(FlashVSR)切成 10 片逐片处理,全片约 ¥0.785
试错量累计生成 106 条视频,其中 34 条被否归档(修复后重生成)——成品率约为 2/3
交付包全片 348MB(含字幕版)
这份账本能说明两件事:① 一条专业观感的 AI 短片,硬成本可以低到几块钱(视频生成+高清合计不足 ¥2);② 真正的成本大头是试错——106 条里 34 条废掉,这还没算人工。所以流程的价值就是把废片率压下来:预演拦掉结构错误、锚点拦掉身份漂移、验收拦掉坏素材进下游。

生产现场:一次真实短片从 0 到交付经历了什么

再说一个真实场景——《天喜金卷》婚礼祝福短片(为家人做的 60 秒片子,5 段 / 11 镜,3D 国漫仙侠风)。这是流程第一次跑全链,过程全部留在工作记录里,照原样给你看:

阶段现场发生了什么
① 资产与提示词11 镜分镜转成 11 条结构化 H3 生成提示词(自动生成器产出 35.9KB 的 prompt JSON),每一条绑定锚点、出镜角色脸部裁切、对白音频
② 先做小规模验证不直接批量——先跑两轮 PoC:1:1 画幅验证 三人脸锁 100% 守住;16:9 画幅验证分辨率与表情变化(弟弟张口、侄媳笑)→ 16:9 解锁,确认可用才进入批量
③ 遇到配额墙云端视频配额是有限的(每 5 小时 3 条)——11 镜单镜跑会卡死。策略调整:按段落合并成 3 次生成(前 3 段 1 次、第 4 段 1 次、第 5 段 1 次),用配额换进度
④ 上游服务挂了锁脸环节的首选服务商突然 502(云服务端故障,重试依然挂)→ 自动切换备用服务商,一次成功。这就是 fallback 链在实战里救命的样子
⑤ 一个动作的歧义"拱手作揖贺喜"被模型理解成了"拜佛"——动作描述的词序差异,产出完全不同的画面。这类问题只能靠验收环节抓住
⑥ 首段门禁批量前先出第一段给你看——你拍板后,才批量生成剩余 4 段,避免 5 段一起翻车重做
这一趟下来就长出了好几条新规则:动作描述的歧义词清单("作揖"类)、fallback 链的自动切换条件、配额受限时的段落合并策略、首段门禁……流程不是设计出来的,是被真实生产打出来的。这些规则现在都写在 Skill 里,你拿到就是别人踩过坑的版本。

生图阶段:模型怎么选

资产和首帧全部走统一的生图路由,按场景复杂度切换档位,不需要自己反复试错:

场景特征用什么为什么
单人物大头 / 三视图 / 单人单道具默认主力模型性价比最高、锁脸最稳
多人同框(全家福等)升级档模型默认档容易「崩脸」,多人必须升级
多光源 / 复杂光影(烛光夜戏)光影特化档默认档容易糊
中文纹饰(印章、牌匾细节)光影特化档默认档容易把纹饰生成成乱码字
最终首帧 / 四宫格交付4K 档最终画面分辨率要求

价格参考:常规 1–2K 成图每张约 ¥0.03–¥0.3(按档位不同);交付级 4K 约 ¥0.4/张级。一部 16 镜短片的前期资产+首帧总成本通常在一杯咖啡的预算内。

视频阶段:为什么是「按段生成」而不是整片一次出

当前所有主流视频模型都有一个共性缺陷:时长越长、镜头越多,崩得越厉害。金鱼流程的做法是——把视频按故事情节切成 8–12 秒的「段」,每段内部包含 2–4 个镜头,一段一次生成:

  • 输入 = 该段分镜脚本 + 已批准的首帧锚点 + 全员脸裁切 + 该段对白参考音频 + 结构化 prompt;
  • 对白用专用标记写进 prompt,模型直接原生生成口型;
  • 段与段之间用「同场景过渡生成」衔接(叠化/声音桥/AI 过渡段),禁止硬切产生跳变;
  • 前一段验收通过后才生成下一段,避免批量出废片。
按段生成:一段 = 一段完整情节,一次生成调用(段内 2–4 镜) segment 01 · 10s 镜 1 镜 2 镜 3 首帧锚点来自节点 ⑩ 叠化 声音桥 segment 02 · 10s 镜 1 镜 2 与上段末帧对齐衔接 叠化 声音桥 segment 03 · 10s 镜 1 镜 2 镜 3 尾段接完整落幅 输入 = 段分镜脚本 + 已批准锚点 + 全员脸部裁切 + 段对白音频 + 结构化 prompt 对白原生生成口型 · 段间禁止硬切 · 前段验收通过才做下一段
段与段之间用 AI 过渡衔接(叠化 / 声音桥 / 过渡段),拒绝硬切造成的跳变

成本参考:海外云端生成一条 10 秒段约 ¥0.06(按实际任务计价);一部 1 分钟短片的视频生成总成本约 ¥0.3–0.5。真正的时间成本在「挑参」和「复检」,而不在生成费用。

后期阶段:决定成片「专业感」的三步

  1. 剪辑 + 修音:以原生对白构建时间轴;只修局部错音,不用整片 TTS 覆盖;先检查每段原生环境音再决定要不要补音乐。
  2. 整片高清(FlashVSR):按帧覆盖整片放大,分片处理、按序拼接、恢复批准音轨,逐项检查尺寸、帧数和接缝。
  3. 字幕 + 交付:从最终音轨识别字幕并逐句校对,从无字幕高清母版压制;交付包含完整文件名、时长、尺寸、大小与校验值。

常见问题

没有剪辑基础能做吗?能。流程里每个节点的产出物都是标准化的,剪辑与字幕有固定规范,不需要专业剪辑背景;难点主要在「按流程执行、不跳步」。

要做多长的片子?流程本身不限时长,实践中 1–5 分钟的短片最合适(1 分钟约 6–8 个视频段)。

要花多少钱?生图按张(¥0.03–¥0.4/张)、视频按段(约 ¥0.06/条 10 秒)、高清按整片时长计费。一部 1 分钟短片完整制作通常在人民币个位数到几十元的云成本区间,具体取决于重跑次数。

可以商用吗?可以,但需遵守所用模型平台的服务条款;涉及真人肖像的(如婚礼项目)需取得本人授权。

关于本文与说明

文中成本数字为当前时点的实测参考,不作为报价承诺。

主页:aizhuozhi.com。

蜀ICP备2026060052号-1