指南

Wan 3.0 提示词指南:把想法写成可执行的导演简报

系统学习 Wan 3.0 文生视频、图生视频与参考生视频提示词结构,包含原创案例、时间线写法、声音设计和单变量迭代方法。

Wan 3.0 编辑团队
Wan 3.0 提示词指南:把想法写成可执行的导演简报

好的 Wan 3.0 提示词,不是把形容词写得越多越好,而是把一条视频中真正需要执行的制作决定写清楚:谁在什么空间里做什么,镜头如何观察,声音何时进入,画面最后停在哪里。

这套方法适用于 文生视频图生视频参考生视频。三种模式的重点不同,但都需要先消除冲突,再增加细节。

先记住三条公式

文生视频可以从这条结构开始:

主体 + 场景 + 主要动作 + 运镜 + 画面处理 + 声音 + 结束画面

图生视频不必重复图片里已经确定的主体、构图与风格,重点改为:

主要运动 + 次要运动 + 运镜 + 必须保留的细节 + 结束状态

参考生视频则要先说明每份素材的职责:

参考素材角色 + 新场景中的动作关系 + 运镜 + 声音 + 结束状态

公式的意义不是保证结果,而是让你在生成前发现遗漏:动作有没有完成路径?镜头会不会与人物抢运动?参考图到底控制人物还是环境?

第一步:先写清楚镜头任务

在进入提示词之前,先完成一句话:

“看完这条视频,观众应该理解或感受到 __。”

产品展示可能需要观众看懂一个结构如何打开;人物短片可能需要表现犹豫逐渐变成决心;旅行画面可能只需要建立空间尺度和氛围。

如果一句话里塞进追车、回忆、三个人的对白和跨城市转场,这通常不是一条视频,而是几条视频。先拆开,再写细节。

把导演简报分成八层

1. 用可持续识别的特征描述主体

选择运动中仍然看得见的特征:轮廓、年龄段、服装颜色、材质、发型、产品结构或关键道具。

模糊写法:

一个女人穿过市场。

更清楚的写法:

一位穿苔绿色围裙的中年花艺师,端着装有白色芍药的浅木托盘,穿过清晨的室内花市。

后者不是单纯增加形容词,而是确定了人物、道具、主色和空间。

2. 只写会影响镜头的场景信息

优先描述空间尺度、前后景、时间、天气和真实光源,而不是列一串不会参与画面的装饰。

玻璃顶棚下有薄雾,窄窄的晨光穿过花摊,远处顾客缓慢移动,保持柔焦。

3. 选择一个主要动作

“感到希望”无法直接拍摄;“她停下脚步,注意到第一束晨光,抬起视线并露出克制的微笑”可以。

单镜头中,一个完整动作往往比连续堆叠动作更可靠。如果确实需要多个节拍,用时间线分配,而不是不断写“然后”。

4. 给运动建立层级

  • 主要运动: 花艺师停步并抬眼。
  • 次要运动: 围裙系带和松散花瓣被微风轻轻带动。
  • 背景运动: 顾客保持缓慢、柔和,不抢主体。

所有元素同时高速运动,画面就失去主次。次要运动应该证明空间是活的,而不是再讲一个故事。

5. 选择一种核心运镜

运镜适合表达可用写法
固定镜头观察、克制、产品结构“机位固定,不平移、不变焦”
缓慢推进注意力、亲密、顿悟“从中景稳定推进到近景”
缓慢拉远揭示空间、尺度、孤独“镜头逐渐后退,完整露出环境”
横向跟拍人物与空间共同移动“与人物同速侧向跟拍,距离不变”
小幅环绕展示形体或产品细节“保持主体居中,小幅顺时针环绕”

除非你刻意制造混乱,不要在一条短片里同时要求升降、环绕、手持摇晃、快速推进和甩镜。

6. 用可执行的画面语言替代空泛词

“电影感、大片、顶级、震撼”没有解决具体问题。更有效的是:

  • 阴天柔光,还是正午硬光;
  • 冷色阴影搭配暖色实景灯,还是高饱和霓虹;
  • 浅景深突出主体,还是深景深交代空间;
  • 纪实观察式构图,还是精确的产品广告构图。

只写真正改变画面的选择。

7. 把声音写进场景

Wan 3.0 支持原生音画生成。声音应当像画面一样分层:

  • 人声: 谁说、说什么、语言、情绪、语速、音色;
  • 音效: 脚步、布料、机械、雨声、物体接触;
  • 音乐: 是否需要、何时进入、承担什么情绪作用。

例如:

无对白。保留花市空间底噪、远处推车滚轮声和包花纸轻响。前段无配乐,最后两秒只进入一个温暖的大提琴长音。

如果不需要对白或音乐,直接说明。“安静”也是制作决定。

8. 定义可停留的结束状态

不要只写“视频结束”。写清最后的姿态、物体位置、视线或构图:

一片松散花瓣落在托盘上,镜头停在稳定近景,最后保持一秒。

明确的落点能让叙事完整,也方便后续剪辑。

一条完整的文生视频提示词

单一连续镜头。一位穿苔绿色围裙的中年花艺师,端着装有白色芍药的浅木托盘,穿过清晨的室内花市。玻璃顶棚下有薄雾,窄窄的晨光穿过花摊。她朝镜头走来,看见第一束阳光后放慢脚步,抬起视线,露出克制的微笑。镜头以她的步速稳定后退;她停下时,只做一次非常缓慢的推进。远处顾客保持柔焦和缓慢移动,围裙系带与松散花瓣被微风轻轻带动。冷色自然晨光照亮空间,花朵上保留温暖高光,材质真实,浅景深。无对白,只有花市底噪、远处滚轮声和包花纸轻响;最后两秒进入一个温暖的大提琴长音。结尾一片花瓣落在托盘上,镜头停在近景并保持一秒。

它的顺序清晰:主体、空间、动作、运镜、次要运动、画面处理、声音、结尾。任何一层出现问题,都能单独修改。

长视频要用时间线管理节奏

更长时长给了场景发展空间,也放大了节奏不明确的问题。15 秒或 30 秒视频可以按可读节拍组织:

  1. 0–5 秒:建立主体、地点和镜头关系;
  2. 5–12 秒:发展主要动作或信息;
  3. 12–18 秒:转折情绪、方向、尺度或声音发生变化;
  4. 18–24 秒:收束动作完成,画面开始简化;
  5. 24–30 秒:停留落在可以自然剪切的结束画面。

不是每条 30 秒视频都需要五段。连续表演可能只需要开场、发展和停留。时间线应减少歧义,而不是制造忙乱。

图生视频要换一个写法

图片已经是批准过的美术和构图。重复描述画面里的所有内容,反而可能把生成结果拉离原图。

保留原图中的面部比例、发型、深灰外套和构图。人物缓慢呼吸,先把视线转向窗外,再轻轻放松肩膀。窗帘边缘被微风带动,其余室内元素保持静止。机位固定,不推进、不变焦。保持原图色彩和光线方向。结尾人物视线停在窗外。

重点是运动、克制和需要保护的细节。完整方法见 Wan 3.0 图生视频指南

参考素材必须有明确职责

先在项目笔记中写一份素材清单:

  • @image1:人物身份和服装;
  • @image2:空间布局和色彩;
  • @video1:步态和肩部运动;
  • @audio1:只作为节奏参考。

然后描述素材之间的关系:

让 @image1 的人物走进 @image2 的走廊,保持 @image1 的深灰外套和 @image2 的绿色瓷砖结构。只采用 @video1 的步速与肩部节奏,不复制其中的人物、服装和地点。@audio1 只控制动作节拍,不复现人声。

无法用一句话说明用途的素材,通常应该删除。

一次只修改一个变量

问题第一轮修改保持不变
动作太弱写清速度、路径和幅度主体、场景、运镜、风格
人脸或产品漂移减少转身、环绕和大幅动作光线、时长、核心动作
画面太乱删除背景动作主体和结束画面
镜头抢动作多个运镜改成一个人物动作和空间
结尾突兀增加明确结束状态和停留前段节拍
声音拥挤分开人声、音效、音乐职责视觉方向

每次都重写整条提示词,就无法判断哪项改变真正有效。保留已经成立的部分,修改第一个失败层。

生成前检查

  • 镜头只有一个清楚任务;
  • 主体可以被快速识别;
  • 主要动作是可见、可完成的;
  • 运镜服务动作,而不是与动作竞争;
  • 声音分别说明人声、音效和音乐;
  • 每份参考素材只有一个主要职责;
  • 结尾是明确的视觉状态;
  • 不存在互相冲突的速度、情绪、地点和运镜;
  • 时长与画幅符合最终发布渠道。

确认后进入 Wan 3.0 视频生成器,并把提示词、参数、参考素材和输出结果保存在一起。只有能复盘的提示词,才会变成真正可重复的工作流。

官方资料

Wan 3.0 提示词指南:实用导演简报写法