先记住一句话
多人对话可以做,但要拆成“一次只让一个人说话”的镜头。
如果一个镜头里同时站着两三个人,你希望 AI 自动判断“左边的人说这句、右边的人闭嘴、下一句换右边的人说”,目前不稳定。更稳的做法是把对话切成多个镜头:A 的近景说一句,B 的近景回一句,中间穿插反应镜头。
什么情况最稳
最稳的是这种结构:
- 角色 A 的单人镜头,说第一句;
- 角色 B 的单人镜头,说第二句;
- 两人同框反应,但这段不说话;
- 需要继续对白时,再切回正在说话的人。
这样系统每次只需要处理一个说话人,口型、声音和画面都会更容易对上。
LTX:更适合单人主体的原生音画
LTX 的特点是画面和声音一起生成,单人说话时可以很自然。但它不适合拿来做“多人同框精确对白音频”。
使用 LTX 时要特别注意:
- 它更适合画面里只有一个主要说话人的镜头;
- LTX 原生音频无法保证声音长期稳定绑定到某个角色;
- 多人同框时,AI 不一定知道哪张脸该说这句;
- 同一段里有多个人轮流说话,容易出现错人动嘴、多人一起动嘴、声音不稳定、台词漏读。
所以,LTX 可以用来做单人主体对白;多人对话时,建议改成交替近景,而不是把所有角色留在同一画面里。
怎么选择
| 你想要的效果 | 建议 |
|---|
| 两个人轮流说台词 | 按说话人拆镜头 |
| 角色必须使用指定声音 | 先生成画面,后期在剪辑软件里单独处理音轨 |
| 近景对白,要尽量对口型 | 让画面里只有当前说话人最突出 |
| 只是远景、画外说明,口型不重要 | 可以生成普通画面,后期再处理音轨 |
| 单人主体说话,想要 LTX 的原生音画感 | 可以用 LTX |
| 多人同框,必须精确指定谁说话 | 不建议直接生成,先拆镜头 |
| 两个人同时说话或抢话 | 暂不建议自动生成,后期剪辑和混音更可靠 |
写分镜时怎么写
推荐写法:
镜头1:林砚近景,压低声音说:“你怎么会在这里?”
镜头2:苏晚晴近景,停顿一下说:“我一直都在等你。”
镜头3:两人同框,林砚看向她,没有说话。
不推荐写法:
林砚和苏晚晴同框站在走廊里。
林砚说:“你怎么会在这里?”
苏晚晴说:“我一直都在等你。”
第二种写法看起来省事,但视频生成时很容易变成“谁在说话不清楚”。把对白拆到不同镜头里,成片会更稳,也更像真正剪辑过的影视对话。
多人同框必须保留怎么办
如果剧情必须保留多人同框,可以这样处理:
- 让多人同框镜头只承担反应、站位、气氛,不承担关键台词;
- 说台词时切到当前说话人的近景;
- 用肩越镜头表现对话关系,比如从 A 肩后看 B 说话;
- 对口型不重要的远景,可以接受只拼音轨,不强求嘴型;
- 特别重要的多人同框对白,建议生成后进剪辑软件里手动调音轨、补字幕或重做镜头。