端到端生产管线
这是多份创作者教程交叉验证出来的主流工作流。核心判断:先出图,再出视频,不要直接文生视频。
原因很简单——直接文生视频,每一镜的角色长相都会变。先把角色定死在图上,再让图动起来,脸才不会崩。
剧本 → 角色定妆照 → 分镜脚本 → 分镜图 → 图生视频 → 剪辑合成| 步骤 | 干什么 | 用什么 |
|---|---|---|
| 1. 剧本 | 写出单集剧本,拆出人物档案和场景清单 | DeepSeek / 豆包 / Claude |
| 2. 角色定妆照 | 给每个角色生成一张「身份证」照片 | 即梦图片生成 |
| 3. 分镜脚本 | 剧本转成镜号+景别+画面+台词的表格 | 大模型 + 人工调整 |
| 4. 分镜图 | 每个镜头出一张静帧,全部垫角色卡 | 即梦图片生成 |
| 5. 图生视频 | 静帧动起来 | 即梦视频生成 / Vidu / 可灵 |
| 6. 剪辑合成 | 配音、字幕、音效、BGM、成片 | 剪映 |
创作者给的工期参考是三天一集:第一天剧本和分镜,第二天出图和出视频,第三天剪辑。
每步的关键点
Section titled “每步的关键点”第 1 步:剧本
Section titled “第 1 步:剧本”单集时长建议:第一集 2–3 分钟,后续每集约 1 分钟。单集剧本控制在 2500 字以内,AI 处理更精准。
要产出三样东西:
- 剧本正文
- 人物档案:年龄、性格、穿着、外形——这是后面所有生图的唯一标准
- 场景清单:标注内景/外景、白天/夜晚
现成的指令模板见剧本与分镜指令。
第 2 步:角色定妆照(最关键的一步)
Section titled “第 2 步:角色定妆照(最关键的一步)”提示词公式:风格 + 人物完整形象 + 纯色背景 + 无光影
2D日漫风格国漫质感,25岁亚洲男性半身正面立绘,短碎黑发额前微乱,单眼皮细长眼,下颌线清晰,浅灰色衬衫袖口挽到小臂,神情疲惫警觉,纯灰色背景,均匀平光无强烈光影,单人独立构图要点:
- 纯色背景、无强烈光影——干扰元素越少,模型提取特征越准
- 按官方要求再单独出一张只有头部的大头照,用于锁脸
- 不要出三视图,官方明确说会加剧 ID 漂移和双胞胎问题
- 满意的那张超清导出存好,这就是全剧的角色卡
详见角色卡制作。
第 3 步:分镜脚本
Section titled “第 3 步:分镜脚本”让大模型把剧本改写成分镜表,字段见分镜脚本怎么写。
人工必须过一遍:AI 写的分镜经常一个中景怼到底,你要手动把景别打散,插入远景和特写。
第 4 步:分镜图
Section titled “第 4 步:分镜图”提示词公式:风格前缀 + 景别 + 场景 + 人物动作表情
三条铁律:
- 风格前缀一字不差地重复,全剧统一
- 每张图都垫角色卡(角色特征/角色参考),有创作者给的参考强度经验值是 70%——高于 80% 姿势僵硬,低于 50% 五官变形。这是单一来源的经验值,自己试
- 删掉抽象描述。AI 不理解“指尖微微颤抖”,要么删掉,要么换成情绪对照表里的具体动作
第 5 步:图生视频
Section titled “第 5 步:图生视频”提示词公式:风格 + 人物动作/情绪 + 镜头运动 + 自然动态
- 动作写具体动词:「转头看向窗外」优于「思绪万千」
- 微动态优先:头发飘动、衣角摆动、镜头缓推,比大幅动作稳定得多,伪影少
- 对话镜头按每秒 2.5 个字估算时长
第 6 步:剪辑合成
Section titled “第 6 步:剪辑合成”- 配音:每个角色固定一个音色。如果用 Seedance 2.0 的
{}台词功能,这步可以省 - 音效:脚步声、开门声、耳光声能极大提升沉浸感
- BGM 音量务必压低,不能盖过人声——这是被反复提及的坑
- 口型对不上的补救:补一个点头或沉思的镜头盖过去。漫画风有这个容错空间,不用死磕对口型
两条省钱建议
Section titled “两条省钱建议”用便宜模型抽卡,用贵模型定稿。 Seedance 1.0 pro fast 官方标称速度快 3 倍、价格降 72%,拿它试构图,满意了再上 pro。
能一条多分镜就别拆成多条。 Seedance 2.0 支持一条提示词写多个镜头,一次 15 秒出三个镜头,比生成三次便宜,而且角色一致性和轴线连续性都更好。
已知的现实瓶颈
Section titled “已知的现实瓶颈”有创作者实测反馈:做 5 集 15 秒的片子,中途因积分不足被终止。
AI 漫剧真正的门槛不是技术,是抽卡成本。一个镜头抽三五次是常态,按这个量级去估算你的预算。