Skip to content

端到端生产管线

这是多份创作者教程交叉验证出来的主流工作流。核心判断:先出图,再出视频,不要直接文生视频。

原因很简单——直接文生视频,每一镜的角色长相都会变。先把角色定死在图上,再让图动起来,脸才不会崩。

剧本 → 角色定妆照 → 分镜脚本 → 分镜图 → 图生视频 → 剪辑合成
步骤 干什么 用什么
1. 剧本 写出单集剧本,拆出人物档案和场景清单 DeepSeek / 豆包 / Claude
2. 角色定妆照 给每个角色生成一张「身份证」照片 即梦图片生成
3. 分镜脚本 剧本转成镜号+景别+画面+台词的表格 大模型 + 人工调整
4. 分镜图 每个镜头出一张静帧,全部垫角色卡 即梦图片生成
5. 图生视频 静帧动起来 即梦视频生成 / Vidu / 可灵
6. 剪辑合成 配音、字幕、音效、BGM、成片 剪映

创作者给的工期参考是三天一集:第一天剧本和分镜,第二天出图和出视频,第三天剪辑。

单集时长建议:第一集 2–3 分钟,后续每集约 1 分钟。单集剧本控制在 2500 字以内,AI 处理更精准。

要产出三样东西:

  • 剧本正文
  • 人物档案:年龄、性格、穿着、外形——这是后面所有生图的唯一标准
  • 场景清单:标注内景/外景、白天/夜晚

现成的指令模板见剧本与分镜指令

第 2 步:角色定妆照(最关键的一步)

Section titled “第 2 步:角色定妆照(最关键的一步)”

提示词公式:风格 + 人物完整形象 + 纯色背景 + 无光影

2D日漫风格国漫质感,25岁亚洲男性半身正面立绘,短碎黑发额前微乱,
单眼皮细长眼,下颌线清晰,浅灰色衬衫袖口挽到小臂,神情疲惫警觉,
纯灰色背景,均匀平光无强烈光影,单人独立构图

要点:

  • 纯色背景、无强烈光影——干扰元素越少,模型提取特征越准
  • 按官方要求再单独出一张只有头部的大头照,用于锁脸
  • 不要出三视图,官方明确说会加剧 ID 漂移和双胞胎问题
  • 满意的那张超清导出存好,这就是全剧的角色卡

详见角色卡制作

让大模型把剧本改写成分镜表,字段见分镜脚本怎么写

人工必须过一遍:AI 写的分镜经常一个中景怼到底,你要手动把景别打散,插入远景和特写。

提示词公式:风格前缀 + 景别 + 场景 + 人物动作表情

三条铁律:

  1. 风格前缀一字不差地重复,全剧统一
  2. 每张图都垫角色卡(角色特征/角色参考),有创作者给的参考强度经验值是 70%——高于 80% 姿势僵硬,低于 50% 五官变形。这是单一来源的经验值,自己试
  3. 删掉抽象描述。AI 不理解“指尖微微颤抖”,要么删掉,要么换成情绪对照表里的具体动作

提示词公式:风格 + 人物动作/情绪 + 镜头运动 + 自然动态

  • 动作写具体动词:「转头看向窗外」优于「思绪万千」
  • 微动态优先:头发飘动、衣角摆动、镜头缓推,比大幅动作稳定得多,伪影少
  • 对话镜头按每秒 2.5 个字估算时长
  • 配音:每个角色固定一个音色。如果用 Seedance 2.0 的 {} 台词功能,这步可以省
  • 音效:脚步声、开门声、耳光声能极大提升沉浸感
  • BGM 音量务必压低,不能盖过人声——这是被反复提及的坑
  • 口型对不上的补救:补一个点头或沉思的镜头盖过去。漫画风有这个容错空间,不用死磕对口型

用便宜模型抽卡,用贵模型定稿。 Seedance 1.0 pro fast 官方标称速度快 3 倍、价格降 72%,拿它试构图,满意了再上 pro。

能一条多分镜就别拆成多条。 Seedance 2.0 支持一条提示词写多个镜头,一次 15 秒出三个镜头,比生成三次便宜,而且角色一致性和轴线连续性都更好。

有创作者实测反馈:做 5 集 15 秒的片子,中途因积分不足被终止

AI 漫剧真正的门槛不是技术,是抽卡成本。一个镜头抽三五次是常态,按这个量级去估算你的预算。