字节跳动 发布了新一代视频创作模型 Seedance 2.5。对做视频的人来说,这次变的不只是画质:一条视频能装下一整场戏,一次能同时指挥几十份参考素材,改片子的时候还能定位到第几秒。
支持纯文本生成,也支持同时参考图片、视频和音频进行创作,并可对已有视频进行编辑。]
相比 2.0,Seedance 2.5有主要突破:

字节跳动给发布了一份官方提示词指南:从一句话生成,到 50 份参考素材怎么调度、30 秒长片怎么分段、改片子怎么只动一处,每类任务都配了能直接抄用的模板。对用即梦或 API 做视频的人,这是第一份成体系的官方写法手册…
基础撰写技法
文本指令的基础公式
提示词可以按照下面的公式灵活组合:
五个成分各自负责什么
画面呈现<视觉风格>。
镜头采用<景别、机位、运镜或切镜>。
声音包括<对白、环境声、音效或音乐>。
窗外柔和晨光照入室内,湿润陶土呈现细腻光泽,工作台保持整洁。
镜头先以中景记录拉坯动作,再缓慢推近陶杯表面的纹理,最后切到木架正面。
保留转盘低沉转动声、陶土摩擦声和轻微室内环境声。
不需要的部分可以省略。生成参数不需要写进提示词;可调参数由生成页面或接口设置。
有参考素材时,先准备素材并明确职责
素材数量与选择
可以组合使用最多 50 份参考素材。不同类型素材分别遵循下面的输入范围,推荐范围用于提高生成稳定性,不代表能力上限。
四类素材的输入范围与推荐范围
输入范围
推荐范围
输入范围
推荐范围
输入范围
推荐范围
输入范围
推荐范围
主体图可扩展至 9 至 12 个主体,主体音视频可扩展至 6 至 10 个主体,视频编辑参考图可扩展至 6 至 8 张;素材越多,稳定性越容易下降。
主体图超过 5 个主体且仍需要多视角时,建议把不同视角拆成多张图片;多张独立视角图通常比把多个视角拼在一张图中更稳定。
逐份说明素材职责
上传参考素材后,需要说明每份素材具体提供什么。素材中的人物、背景或构图容易被误带入成片时,再写明不采用什么。
不要只依赖图片中的文字标注,也不要让模型自行判断多份素材分别对应哪个人物、道具或场景。
@视频1用于<动作、运镜或节奏>。
@音频1用于<角色或声音类型>的<音色、台词、环境声或音乐>。<主体>在<场景>中完成<主要动作或事件>。
画面呈现<视觉风格>,镜头采用<镜头表达>。
@图片2用于<陶艺工作室>的木质工作台、窗户位置和晨间光线,不采用图中人物。
@视频1用于双手拉坯、托起陶杯和放置陶杯的动作节奏,不采用视频中的人物身份、服装和场景。<陶艺师>在清晨的<陶艺工作室>完成一只浅蓝色陶杯,将它从转盘上取下并放到木架中央。
镜头先以中景记录拉坯动作,再缓慢推近陶杯表面的纹理;保留转盘转动声、陶土摩擦声和室内环境声。
如果多张图片是同一个人物或商品的不同视角,可以明确写成:
@图片2定义同一盏折叠台灯的左侧结构。
@图片3定义同一盏折叠台灯的右侧结构。
@图片4定义同一盏折叠台灯的背面结构。
四张图片共同定义同一盏折叠台灯,成片中始终只有一盏折叠台灯。
当参考视频已经准确给出动作、运镜和顺序时,提示词只需说明继承哪些内容,不必逐动作复述;重复描述可能与素材本身冲突。白模视频主要提供运动和空间骨架,仍需要写清希望生成的主体、场景、动作和风格。
声音与文字的特殊字符
提示词可以直接使用自然语言。需要进一步区分音乐、音效、台词和字幕时,可以使用下面的特殊字符:
四种符号
需要控制字幕或声音时,可以直接写明保留和不采用的声音类别。画面内容仍优先使用正向描述,只有素材职责、编辑范围和容易误带入的内容需要明确限制。
不要字幕。
不要任何声音。
台词语言强化
台词不是中文时,建议在台词前明确语言:
当台词文本是英语,但模型说成中文,或者需要控制地区语言习惯时,可以在台词前进一步明确语言。推荐公式:
亮点技法
多素材创作:让模型知道每个场景该使用什么
可以组合使用图片、视频和音频。素材较多时,提示词的重点不是把全部素材都写进同一句话,而是明确人物、道具、场景、动作和声音之间的对应关系。
推荐按照下面的顺序组织:
为不同主体逐一命名
不同人物、商品和道具需要分别绑定素材:
<人物B>对应@图片2,只采用外貌、发型和服装。
<道具A>对应@图片3,只采用结构、材质和颜色。
<场景A>参考@图片4,只采用空间布局、建筑和光线,不采用图中人物。
这种写法没有明确哪张图片对应哪个角色。
按类型整理素材
<修复师>对应@图片1,只采用外貌、发型和服装。
<记录员>对应@图片2,只采用外貌、发型和服装。
<布展员>对应@图片3,只采用外貌、发型和服装。
<讲解员>对应@图片4,只采用外貌、发型和服装。
四人的外貌、服装、动作、站位和台词不互相交换。【道具】
<样本盒>对应@图片5,只属于<修复师>。
<记录板>对应@图片6,只属于<记录员>。【场景】
<修复室>参考@图片7,只采用空间、材质和光线。
<展厅>参考@图片8,只采用空间、材质和光线。【动作与声音】
@视频1用于<修复师>打开样本盒的动作,不采用视频中的人物和场景。
@音频1用于<讲解员>的音色和指定台词。
集中描述重要主体
当同一人物需要跨场景使用多份素材时,可以增加主体设定:
外貌与服装:@图片1。
固定道具:@图片5中的<样本盒>。
出现地点:<修复室>和<展厅>。
动作参考:@视频1的开盒动作、@视频2的放置样本动作。
不采用:其他人物的服装,不持有<记录板>或讲解设备。
按场景调用素材
使用:<修复师>、<样本盒>、<修复室>和@视频1的开盒动作。
事件:<修复师>在工作台前打开样本盒并检查内部样本。
结束时:<修复师>停在工作台内侧,样本盒始终位于<修复师>自身右手旁,也就是位于画面左侧。场景二|展厅登记
使用:<记录员>、<记录板>和<展厅>。
事件:<记录员>在展柜旁核对记录板上的编号。
结束时:记录板仍由<记录员>双手持有,其他人物不进入展柜区域。
多素材创作的目标是让模型在当前场景中选择正确素材,不要求所有素材同时出现在画面中。
30 秒长视频:用阶段和结束状态组织事件
事件较多时,建议把故事拆成连续阶段。每个阶段只安排一个主要状态变化,并写清楚该阶段结束时画面中可以直接看到的状态。
生成一段<视频类型>。核心主体是<主体>,主要事件是<故事概要>。【阶段一】
开始时:<人物、道具和场景的初始状态>。
主要事件:<一个主要动作或事件>。
结束时:<人物位置、道具归属或画面状态>。【阶段二】
承接上一阶段:<需要保持的状态>。
主要事件:<一个主要动作或事件>。
结束时:<可观察状态>。【阶段三】
主要事件:<收束事件>。
结束时:<最终画面状态>。
【保持一致】
保持<人物身份、数量、服装、道具归属、空间方向和声音关系>稳定。
花店订单包装流程
生成一段花店订单包装流程说明视频。<花艺师>和<店员>共同完成花束整理、包装和交付。
保持<花艺师>和<店员>的身份、服装、工作台方向、剪刀位置和花束归属稳定。
时间戳与节奏控制
普通叙事优先使用“阶段”。只有关键交接、进出场、转场或明确节拍需要控制时,再使用以 1 秒为单位的时间表达。时间区间适合分配剧情节奏,时间点适合指定一次关键事件,相对时间适合描述事件之间的等待关系。
5-10秒:移走白色陶盘,再放下透明玻璃杯;结束时展示台中央只有透明玻璃杯。
10-15秒:移走透明玻璃杯,再放下绿色陶瓶;结束时展示台中央只有绿色陶瓶。
时间段应连续、不重叠。时间段表示事件的时间预算,不是精准剪辑点,动作可能在边界附近提前或延后。一个时间段中的内容过少会增加模型的发挥空间,内容过多则可能造成过度切镜或剧情遗漏。
编辑 / 首尾帧 / 延长任务类型参数规则
视频编辑、首帧或首尾帧生视频、视频延长会根据输入素材自动锁定部分生成参数,具体规则如下。
三类任务的比例与时长规则
画幅比例
时长
画幅比例
时长
画幅比例
时长
这些任务中被自动锁定的参数不能在生成页面或接口中另行指定,其余参数以当前可用选项为准。
视频编辑:明确母版、修改范围和保持内容
编辑已有视频时,先把原视频定义为唯一母版,再说明编辑对象、作用范围、目标素材和保持内容。编辑任务的输出比例自动保持输入视频比例,输出时长自动基本保持输入视频时长,这两项不支持另行设置;受输入帧处理影响,输出时长可能存在最大约 0.3 秒的差异;差异通常来自过渡帧处理,整体内容和事件顺序仍基本保持。
通用编辑写法
编辑@视频1,在<全片或明确时间段>对<画面对象、区域或声音类别>进行<增加、移除、替换或调整>。【原视频职责】
@视频1是唯一编辑母版,负责<人物、场景、动作、构图、镜头、遮挡关系、声音和事件顺序>。【目标素材职责】
@图片1或@音频1用于<目标对象或声音的指定属性>。【编辑范围】
只处理<对象、区域、时间段或声音类别>。
【保持内容】
保持@视频1中的<不应变化的画面、动作、声音和时间关系>。
编辑@视频1,只在4-7秒把画面右侧墙面的冷蓝色灯光调整为暖橙色灯光。【原视频职责】
@视频1是唯一编辑母版,负责人物、房间布局、动作、构图、镜头运动、声音和事件顺序。【编辑范围】
只调整右侧墙面及其照亮区域的光线颜色;人物肤色随环境光自然变化。【保持内容】
人物身份、服装、表情、位置、动作、房间结构、镜头运动、对白和环境声保持@视频1。
主体替换
编辑@视频1,只把<原对象>修改为<目标对象>。【原视频职责】
@视频1是唯一编辑母版,负责原始场景、机位、镜头运动、动作轨迹、遮挡关系和事件顺序。【目标素材职责】
@图片1用于<目标对象>的<外观、结构或材质>,不采用<无关背景、人物或构图>。【编辑对象与范围】
只修改<明确对象和区域>。全片目标对象数量为<数量>。不修改<需要保持的内容>。
【时间线继承】
<目标对象>继承<原对象>每次出现、运动、遮挡和离开的时点、持续时长、路径与速度变化。
除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。
编辑@视频1,只把视频中的黄色折叠台灯替换为@图片1中的白色折叠台灯。【原视频职责】
@视频1是唯一编辑母版,负责书桌、书本、手部动作、机位、镜头运动、遮挡关系和事件顺序。【目标素材职责】
@图片1只用于白色折叠台灯的外观、结构和材质,不采用图片中的背景、构图或其他物体。【编辑对象与范围】
全片始终只有一盏白色折叠台灯。只替换原黄色折叠台灯,不修改书本、书桌、手部和背景。
【时间线继承】
白色折叠台灯继承原黄色折叠台灯每次出现、转动灯臂、被手遮挡和离开画面的时点、路径与速度变化。
除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。
背景替换
编辑@视频1,只把<原背景区域>替换为@图片1中的<目标环境>。【原视频职责】
@视频1是唯一编辑母版,负责人物、前景物体、动作、构图、镜头运动和事件顺序。【目标素材职责】
@图片1只用于<目标环境>的空间布局、材质、景深、环境色和光线方向,不采用图片中的人物或前景物体。【编辑对象与范围】
只修改<主体轮廓之外的背景区域>。不修改<主体身份、五官、发型、服装、表情、位置、大小和动作>。
【时间线继承】
人物动作与遮挡关系保持@视频1。除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。
@图片1只提供日间玻璃温室的空间布局、景深、环境色和光线方向,不采用图片中的人物。只把@视频1中人物轮廓之外的浅灰色背景替换为@图片1中的日间玻璃温室。
人物身份、五官、发型、服装、表情、位置、大小和抬手动作保持@视频1。
除以上明确修改对象或区域外,@视频1中的其他人物、道具、场景内容、镜头运动、镜头切换和事件顺序保持原样。
声音编辑
对白、语言、音色、背景音乐和音效可以分别处理。提示词需要写清说话人或声音类别、目标变化,以及其他声音是否保持。
视频延长:先对齐边界画面,再描述前置或后续内容
视频延长是在原视频边界之外继续创作。输出比例自动保持输入视频比例,延长时长由用户设置。
两个方向的边界画面
原视频向前延长向后延长首帧尾帧边界画面必须连续
向后延长时,延长片段的第一个画面需要承接原视频尾帧;向前延长时,延长片段的最后一个画面需要衔接原视频首帧。除了边界画面,还要保持人物、道具、背景、运动趋势和声音连续。
向后延长
先描述原视频尾帧的连续状态,再描述尾帧之后发生的内容。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
向后延长:有其他参考素材时
先逐一说明其他素材负责什么,再明确原视频负责延长边界。其他素材可以提供人物、道具或声音,但不能替代原视频尾帧对起始画面的控制。
@图片2定义<人物A>的服装。
@图片3定义<关键道具>的结构与材质。
@视频1是需要向后延长的原视频。向后延长@视频1。延长片段的第一个画面直接承接@视频1尾帧:保持<边界画面与声音状态>连续。随后,<人物A使用关键道具完成的新动作或事件>。延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
@图片2定义<园艺师>的浅绿色工作围裙。
@图片3定义<藤编花篮>的结构与材质。
@视频1是需要向后延长的原视频。向后延长@视频1。延长片段的第一个画面直接承接@视频1尾帧:保持温室工作台、<园艺师>的站位和<藤编花篮>的位置连续。随后,<园艺师>双手提起<藤编花篮>并把它放到身后的木架中层。延长过程中保持<园艺师>的面部、围裙、温室布局和镜头方向连续。
向前延长
先描述原视频开始之前发生的内容,再把原视频首帧写成延长片段的明确结束状态。只写“随后承接原视频”可能使模型提前引入后续人物或特效,或者到达目标状态后再次改变画面。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
向前延长:有其他参考素材时
逐一声明素材职责,并说明哪些素材在向前延长片段中使用、哪些只在原视频开始后使用。这样可以减少后续人物、道具或特效被提前带入前置片段。
@图片2定义<人物A>的服装。
@图片3定义<关键道具>的结构与材质。
@视频1是需要向前延长的原视频。向前延长@视频1。在原视频开始之前,<人物A完成前置动作或事件>。延长片段的最后一个画面自然衔接@视频1首帧:<人物A的姿态与朝向>,<关键道具的位置与状态>,<其他人物的站位>;保持<背景与空间关系>、<机位与构图>、<光线>、<声音状态>和<运动趋势>与@视频1首帧一致。延长过程中保持<人物身份与服装>、<关键道具>、<背景布局>、<摄影轴线>和<原有声音环境>连续。
同一主体始终保持为同一个连续对象,不重复、不分裂;人物外形或物体部件数量保持稳定。
<只在原视频开始后出现的素材>不在向前延长片段中提前出现。
@图片2定义<策展员>的深蓝色工作外套。
@图片3定义<木质展示盒>的结构与材质。
@图片4定义两名<布展助理>的灰色工作服。
@图片5定义<展陈准备室>的空间和光线。
@视频1是需要向前延长的原视频。向前延长@视频1。在原视频开始之前,<策展员>走到工作台前,拿起闭合的<木质展示盒>并打开盒盖。延长片段的最后一个画面自然衔接@视频1首帧:<策展员>站在画面中央,双手托住打开的<木质展示盒>;两名<布展助理>分别站在其身后左右两侧。保持竖屏正面中景、工作台位置、准备室背景和左侧晨光与@视频1首帧一致。
边界画面应追求视觉上的自然衔接,不应理解为逐像素完全相同。
延长结果的音量可能与原视频存在轻微变化;使用同代模型生成的视频继续延长时,画面与声音通常更容易自然衔接。验收时需要同时检查边界前后的画面、声音和完整延长片段。
进阶玩法
关键帧、分镜与白模参考
首尾帧与参考素材
在多模态参考模式中,可以直接在提示词首句写明@图片1作为首帧、@图片2作为尾帧,不必切换到单独的首尾帧模式。系统会以首帧画幅锁定输出比例,时长由生成页面或接口设置;首帧与尾帧应使用相同画幅,比例不一致时尾帧可能出现拉伸。其余参考图仍可分别定义人物、道具、场景和材质。
@图片2作为尾帧,定义视频结束时的构图、主体位置、姿态、道具状态、场景和镜头方向。
@图片3用于<主体A>的<外貌、服装、结构或材质>,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
@图片4用于<主体B、道具或场景>的<指定属性>,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。<描述一个连续动作或事件>。
画面从@图片1定义的首帧自然开始,经过连续动作后到达@图片2定义的尾帧。
首尾之间保持<人物身份、道具结构与归属、场景布局和镜头方向>连续。
@图片2作为尾帧,定义视频结束时香水工坊的构图、人物位置、姿态、桌面道具状态和镜头方向。
@图片3用于<调香师>的面部、发型和深绿色围裙,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。
@图片4用于<玻璃香水瓶>的造型、材质和标签位置,不改变@图片1定义的首帧构图,不改变@图片2定义的尾帧构图。<调香师>从首帧姿态开始,拿起滴管和<玻璃香水瓶>,把琥珀色香精滴入瓶中,轻轻摇匀并盖好瓶塞,再把成品放到桌面中央,最后自然到达@图片2定义的尾帧。
首尾之间保持<调香师>的身份与服装、香水瓶数量与结构、木桌布局、暖色侧光和镜头方向连续。
不要合并成“图片1和图片2作为首尾帧”。首帧和尾帧应使用相同画幅。其他参考图只提供指定属性,不替代首尾帧的构图。
多关键帧顺序控制
当多张独立图片分别定义过程中的不同阶段时,提示词第一句先写“以@图片1至@图片N的顺序作为关键帧”,再逐张说明每张图对应的关键状态。独立关键帧通常比把多个画面拼在一张宫格图中更容易对齐,但它控制的是阶段顺序和关键状态,不等于逐帧复刻。
@图片2定义第二个关键帧:<第一阶段结束时的可见状态>。
@图片3定义第三个关键帧:<第二阶段结束时的可见状态>。
@图片N作为尾帧,定义<结束时的构图、主体位置、姿态、道具状态和镜头方向>。画面依次经过@图片1、@图片2、@图片3至@图片N定义的状态,各阶段之间使用连续动作自然过渡。
全过程保持<主体身份、道具结构与归属、场景布局、光线和摄影轴线>连续。
@图片2定义第二个关键帧:同一架橙色纸飞机被一只手从桌面托起,机头方向不变。
@图片3定义第三个关键帧:同一架橙色纸飞机从窗边掠过,窗帘向右轻微摆动。
@图片4作为尾帧,定义同一架橙色纸飞机落在右侧书架中层,机头仍朝向画面右侧。画面依次经过@图片1、@图片2、@图片3和@图片4定义的状态,各阶段之间保持飞行方向和速度连续。
全过程保持纸飞机的橙色材质、大小与折痕,教室布局、午后侧光和镜头轴线连续。
宫格分镜与故事板
宫格分镜用于给出整体故事、镜头顺序和大致构图,不适合要求每格细节严格复刻。建议控制在15 格以内,使用简洁线稿或干净示意图并减少文字标注。提示词应明确读取顺序,再写出每格的主体动作、景别或运镜、最终画风和声音。
@图片2定义<主体A>的<外貌与服装>。
@图片3定义<关键道具或场景>的<结构、材质或光线>。镜头1:<景别、主体动作、场景状态>。
镜头2:<景别、主体动作、运镜或切换方式>。
……
镜头N:<结束动作和结束画面状态>。最终画面采用<视觉风格>,声音包括<对白、环境声、动作音效或音乐>。
@图片2定义<陶艺师>的面部、短发和深灰色围裙。
@图片3定义<蓝釉杯>的杯身比例、釉面颜色和弧形杯把。镜头1:广角呈现安静的陶艺工作室,<陶艺师>坐在拉坯机前。
镜头2:中景侧拍<陶艺师>双手扶住旋转的湿陶坯,杯身逐渐成形。
镜头3:特写手指修整杯口与杯把连接处,泥浆沿指尖缓慢滑落。
镜头4:中近景呈现烧制完成的<蓝釉杯>被放上木架,<陶艺师>收回双手。最终画面采用写实纪录片质感,保留拉坯机转动声、湿泥摩擦声和工作室环境声。
白模参考与渲染
白模参考分为粗粒度白模和细粒度白模。粗粒度白模主要提供动作、动线、站位、运镜、切镜、光影和声音等时序信息;细粒度白模已经具有完整结构,主要用于材质、色彩、人物、场景和视觉风格的重渲染。先判断白模负责运动骨架还是完整建模,再选择对应写法。
两类白模的分工
适合情况
素材要求
提示词重点
适合情况
素材要求
提示词重点
粗粒度白模
粗粒度白模适合锁定动作轨迹、运动方向、人物站位、进出场、机位路径、切镜位置、光影变化和声音节奏。白模中的每个几何体都应单独映射到最终主体或道具;人物、道具和场景外观可以由其他参考图片定义。
白模信息 → 需要说明的内容
优先使用关系清楚的简单几何体。手臂、翅膀等附属结构只有在动作序列完整时才适合作为白模信息,否则容易造成动作僵硬或结构误判。
@视频1中的<白模主体A>对应<主体A>。
@视频1中的<白模主体B或几何道具>对应<主体B或关键道具>。
@图片1定义<主体A>的<外貌、服装或结构>。
@图片2定义<主体B、关键道具或场景>的<指定属性>。<主体>在<场景>中完成<主要动作或事件>。
保持@视频1中的<动作路径、站位、运镜、切镜、光影或声音节奏>。
最终画面采用<人物、场景、材质和视觉风格>,声音包括<对白、环境声或动作音效>。
@视频1中的高圆柱体对应<讲解员>。
@视频1中的长方体对应<移动展车>。
@图片1定义<讲解员>的面部、蓝色制服和胸牌。
@图片2定义<移动展车>的白色金属框架和透明展罩。
@图片3定义科技展厅的弧形墙面、灰色地面和顶部条形灯。<讲解员>推着<移动展车>沿弧形墙面前进,在中央展台前停下并打开透明展罩。
保持@视频1中的行走路径、主体站位、推镜方向和切镜位置。
画面采用明亮写实的展馆纪录片风格,保留脚步声、车轮声和展厅环境声。
细粒度白模
细粒度白模已经具备完整人物、道具或场景结构,适合更换材质、色彩、人物形象、场景和整体视觉风格。白模画面应尽量干净,不要保留轨迹线、坐标轴、控制器或相机锥体等制作标记。
@图片1定义<主体>的<人物形象、材质、颜色或表面细节>。
@图片2定义<场景>的<空间、材质、光线或视觉风格>。将@视频1中的<主体>重渲染为<最终主体>,场景重渲染为<最终场景>。
保持@视频1中的<结构、动作、镜头和空间关系>,画面呈现<材质、色彩和风格>,声音包括<环境声、音效或音乐>。
@图片1定义装置外环的拉丝黄铜材质。
@图片2定义内层叶片的半透明蓝色玻璃材质。
@图片3定义当代艺术展厅的白色曲面墙、深灰地面和顶部柔光。将@视频1中的环形装置重渲染为黄铜与蓝色玻璃组成的动态雕塑,场景重渲染为当代艺术展厅。
保持@视频1中的结构、转动节奏、环绕运镜和切镜,保留装置低沉转动声与安静的室内环境声。
一键成片
一键成片适合把多张图片,或图片与风格参考视频,组织成具有统一节奏和包装风格的完整视频。提示词需要说明每份素材的职责、图片顺序、画面动态、剪辑节奏、视觉包装和声音;不要只写“把这些素材做成视频”。
@图片1用于<人物、商品、场景或开场画面>。
@图片2用于<人物、商品、场景或过程画面>。
@图片3用于<人物、商品、场景或结尾画面>。
@视频1仅用于<剪辑节奏、转场、字幕包装或音乐风格>,不采用其中的人物身份和场景(可选)。【编排方式】
图片按照<上传顺序、指定顺序或主题自由编排>出现。
<说明需要保持的人物、商品、地点和事件关系>。【画面动态】
每张图片采用<轻微Live动效、视差、推拉、横移或局部动作>。
保持<主体外观、商品结构、文字或背景关系>稳定。【成片风格】
采用<剪辑节奏、转场方式、字幕或图形包装、色彩风格>。
【声音】
包括<对白、环境声、音效或音乐>。
夜市旅行短片
@图片2用于<旅行者>沿街行走的画面。
@图片3用于灯笼摊位和手工艺细节。
@图片4用于三位朋友围桌用餐。
@图片5用于河边夜景和倒影。
@图片6用于三人在桥边合影的结尾画面。
@视频1仅用于轻快剪辑节奏、手绘贴纸和转场方式,不采用其中的人物身份与地点。
保持三位朋友的外貌与服装稳定,不互相混合。
保持摊位结构、餐桌位置和桥边栏杆稳定。
图片顺序重要时,应逐张写明出现顺序;允许模型自由编排时,也要明确写出“可按主题自由编排”。涉及多个人物或多个商品时,仍需逐一命名并绑定素材。
视频无缝转场
视频无缝转场是在两段视频之间生成连续的过渡内容。提示词需要先说明哪一段是转场前视频、哪一段是转场后视频,再写清触发动作、镜头运动、画面如何变化、最终到达的状态和声音衔接。
五种转场方式的写法重点
@视频2是转场后片段,采用其<开头主体、构图、镜头方向和声音>。
保持@视频1和@视频2原有片段中的<人物身份、商品结构、场景和主要动作>稳定。在@视频1尾部,<主体或前景物>通过<动作>触发转场。
镜头<运动方向和速度变化>,画面中的<形状、材质、光线或空间>逐渐变化为@视频2开头的<对应元素>。
转场结束时自然到达@视频2的开头构图,并保持<主体位置、镜头方向和运动趋势>连续。
声音从<前段声音>平滑过渡到<后段声音>。
@视频2是转场后片段,采用展厅圆形天窗、向上抬升的镜头和安静室内混响。
保持两段原视频中的人物、街道、展厅结构和主要动作稳定。在@视频1尾部,红色雨伞靠近镜头并逐渐覆盖整个画面,触发转场。
镜头继续向前推进,雨伞的圆形边缘逐渐变成展厅天窗的金属圆环,红色伞面逐渐过渡为天窗透入的白色天光。
转场结束时自然到达@视频2开头的仰拍构图,镜头由向前推进平滑转为向上抬升。
雨声逐渐减弱,并平滑过渡为展厅内的脚步回声。
无缝转场的目标是让画面与声音自然衔接。提示词可以要求保持两段原视频的主要内容,但不能把生成式过渡理解为逐像素不变的剪辑拼接。
情绪方向与可观察表现
只写“紧张、温馨、压抑”等情绪词,模型可以理解整体方向,但具体表演方式会有更多发挥空间。如果希望稳定控制人物演技,建议写明眼神、眉头、嘴角、呼吸、视线和手部动作等能够直接看到或听到的表现。
不必罗列所有面部细节。单次情绪转折通常选择 2 至 4 个最明确的表现即可;只有当情绪包含多次转折时,才需要按触发事件分阶段描述。
单次情绪转折:默认写法
发生<触发事件>后,<主体>先出现<即时可观察反应>。
随后,<眼神、眉头、嘴角、呼吸、视线或手部动作>逐渐发生<变化>。
最终,<主体>以<克制或明确的外在表现>表达<目标情绪>。
多阶段情绪:按触发事件递进
当<第二个触发事件>出现后,<主体的表情、视线或呼吸发生的变化>。
确认<关键信息>后,<主体试图克制或掩饰的情绪>通过<可观察表现>逐渐显现。
最终,<主体的最终动作、表情或说话方式>。
确认谢幕后,她先轻轻呼出一口气,肩膀逐渐放松,嘴角浮现克制的微笑,眼眶慢慢湿润,但始终没有转身离开。
专业摄影术语
基础镜头语言和热门运镜方式可以直接写进提示词。术语较少见、可能存在多种理解,或需要精确控制画面变化时,应同时说明术语作用于谁、画面如何变化,以及希望看到的结果。
基础镜头语言
七种热门运镜的建议写法
以下热门的运镜方式可以直接使用;若画面中有多个主体,仍需说明运镜围绕谁、从哪里开始、到哪里结束。
过于小众的摄影术语
过于小众、行业含义不统一或模型可能不熟悉的术语,应保留术语名称,同时把它翻译成可以直接观察的画面变化。
涉及精确转场时,还要写清触发时刻、遮挡物、镜头运动方向、切换方式,以及切换后需要保持的构图或运动趋势。
摄影表达示例
光圈、焦距和快门数值可以写入提示词,但最终画面的可见结果通常比单独写一个数值更明确。
提交前检查
使用边界
九条能力边界
指南声明
本指南中的示例仅用于说明提示词写法。实际生成效果可能受到输入素材、任务复杂度和生成参数影响。
本文由作者@小互AI,原创/授权发布于平台,未经许可禁止转载。

