分镜时序——一条提示词写多个镜头
这是整份指南里最有价值的一条,也是绝大多数教程没讲的。
模型的内部建模是空间和时间解耦的。因此,一个复杂视频的提示词,最理想的形态是时间轴化分镜:把视频拆成几个分镜,按事件发生顺序动态描述每个分镜:谁 + 在哪 + 做什么 + 镜头怎么动。
具体规则(官方原文):
使用镜头1、镜头2、镜头3等标识,按事件发生顺序(先主后次)组织内容。
Seedance 1.0 文档也确认了同样的能力:
支持在同一 prompt 里包含多个切镜,这些切镜会根据提示词的内容,保持主体/风格/场景的延续性。
这意味着你不需要一镜一条提示词。 一条提示词就能出一段带剧情、镜头有变化、角色还不崩的连续片段。
官方给的正反例
Section titled “官方给的正反例”反面案例(官方原文):
男人在街头紧张地奔跑,画面很有电影感。正面案例(官方原文):
镜头 1:街巷侧拍,男人缓慢起跑,带有急促的呼吸感。镜头 2:男人撞翻水果摊,镜头快速摇动并给到男人惊恐的特写。镜头 3:男人翻过矮墙消失,镜头缓慢拉远定格在空荡的街道。差别一目了然:反面例子只有一个模糊的情绪形容,正面例子把时间顺序、空间位置、动作、运镜全部交代清楚了。
每个镜头按什么顺序写
Section titled “每个镜头按什么顺序写”官方给了明确的组织逻辑:
每个镜头推荐按以下逻辑组织:
- 运镜或镜头切换方式:如“全景缓慢推近”“固定机位”“镜头切至…“等
- 主体动作与表情:描述核心角色/物体的关键动作、神态变化
- 位置或空间变化:说明主体所处的场景、位置或空间关系
- 音频信息:描述对应镜头的音效、人声或背景音乐等
顺序是:怎么拍 → 谁在做什么 → 在哪 → 什么声音。
两条硬性约束
Section titled “两条硬性约束”官方原文:
不强制限制每段时长,优先让模型根据剧情自然生成节奏。
说明:模型对精确时间(如 0–3 秒)的支持不稳定,强行限制时长可能导致生成结果异常。
所以只写“镜头1/镜头2/镜头3”,不要写“镜头1(0-3秒)”。节奏交给模型,你只控制顺序。
别把整个剧本贴进去
Section titled “别把整个剧本贴进去”官方在「双胞胎问题」那节里明确警告:
请勿直接将完整剧本作为提示词使用,文案内容过度冗余易造成模型理解混乱,需精简无关表述、保证指令清晰聚焦。
一条提示词里三到四个镜头是舒适区,再多就该拆成两条生成了。
什么时候该拆、什么时候该合
Section titled “什么时候该拆、什么时候该合”官方给了一条判断标准:
| 情况 | 做法 | 官方原文 |
|---|---|---|
| 文戏 | 用视频延长做连续长镜头 | 「适用于单一场景内的’文戏’,如长对话、情绪递进、单一路径移动,以实现沉浸式、连贯的一镜到底效果」 |
| 武戏 | 分段生成再剪辑拼接 | 「适用于剧情转折或复杂、快速的’武戏’,如追逐、打斗、蒙太奇等,可通过独立生成片段再剪辑组合,保证节奏与视觉冲击力」 |
翻译成漫剧场景:对话戏、情绪戏用一条多分镜搞定;打戏、追逐、快速蒙太奇老老实实分开生成再剪。
漫剧实战模板
Section titled “漫剧实战模板”一个 15 秒三镜头的完整结构:
【风格前缀】
镜头1:【运镜】,【谁在哪做什么】,【光影】。镜头2:【镜头切换方式】,【动作/表情变化】,【空间关系】。镜头3:【运镜】,【高潮动作】,{台词},【落幅画面】。
<音效><音效>(背景音乐)【约束词】填好之后大概长这样:
2D日漫风格国漫质感,赛璐璐上色,冷蓝与暖橙对比色调。
镜头1:中景平稳右移,晚高峰地铁车厢内,男人靠在扶手杆旁低头看手机,周围乘客面无表情,车厢顶灯冷白,窗外隧道灯光拉成流动光带。镜头2:镜头缓慢推近至面部特写,男人猛然抬头,瞳孔收缩,喉结滚动,手指攥紧背包带,冷蓝光从侧面打在脸上。镜头3:镜头切至车厢全景并缓慢环绕,每个乘客头顶悬浮着半透明的橙色数字,对面座位女孩头顶的数字转为刺目的红,男人压低声音说{那是……倒计时?},镜头最后定格在闪烁的红色数字上。
<地铁行驶的低频轰鸣><耳鸣般的尖锐嗡声>(低沉悬疑的弦乐,逐渐升调)人物面部稳定不变形,动作自然流畅,无卡顿无闪烁。保持无字幕,避免生成任何文字、水印或Logo。注意每个镜头只用了一种运镜(右移 / 推近 / 环绕),这是官方铁律。