先想清楚:你想控制到什么程度
一个简单的判断:你给 AI 的越多,它自由发挥的越少,画面越可控。从「只给文字」到「给首尾帧」,可控度一路递增。选模式,本质是在「省事」和「可控」之间找平衡——下面几种从自由到可控排开。
文生视频:只给文字,AI 全权构思
只写一段提示词,画面、运镜、节奏都交给 AI 构思。
- 适合:还没有参考图、想快速看个感觉、对具体画面没硬要求的镜头(空镜、氛围镜头)。
- 代价:最自由,也最「抽卡」——同一段文字每次结果都不一样,人物长相和场景很难保证一致。
图生视频:给一张图,让它动起来
上传一张图作为首帧(或尾帧),AI 从这张画面开始生成动态。
- 适合:已经有满意的画面(比如分镜参考图),想让视频严格贴着它来。这是保证角色、场景一致性最常用的模式,也是日常主力。
- 关键:这张首帧图就是参考图,它的质量直接决定视频质量——务必先把它调满意。
首尾帧:给起点和终点,AI 补中间
同时给首帧和尾帧两张图,AI 生成从首帧过渡到尾帧的过程。
- 适合:需要精确控制镜头的起止画面——比如表情从 A 变到 B、镜头从近景推到远景、一个明确的转场。
- 注意:首尾差异太大时,中间过渡容易不自然;尽量让两张图在逻辑上连得上。
全能参考:给多张图,AI 综合
提供多张参考图(角色、场景、风格等),AI 综合它们来生成一个镜头。
- 适合:一个画面要同时锁定多个元素——这个角色 + 那个场景 + 某种风格。
- 注意:只有部分模型支持。如果选生成模式时没看到「全能参考」,就说明当前模型不支持,换一个能用的模型即可。
自有算力的 LTX:MSR 多参考方式
如果你用「我的算力」里的 LTX,系统会按多参考图或时间线参考方式:使用主体参考图、地点背景和可选首帧引导生成镜头。你不用手动处理工作流,按提示生成就行。
选不准时,照这个来
- 手上有满意的画面图 → 图生视频(一致性最好,日常首选)。
- 只有文字、先看感觉 → 文生视频(快,但做好多抽几次的准备)。
- 要精确卡住开头和结尾 → 首尾帧。
- 要同时锁角色 + 场景 + 风格 → 全能参考(需模型支持)。
提醒:模式不是越「高级」越好,选最匹配当前镜头需求的那个就行。不同模型支持的模式不一样——换模型后能用的模式会跟着变,没看到想要的那种,换个模型试试。