好的 Wan 3.0 提示词,不是把形容词写得越多越好,而是把一条视频中真正需要执行的制作决定写清楚:谁在什么空间里做什么,镜头如何观察,声音何时进入,画面最后停在哪里。
这套方法适用于 文生视频、图生视频 和 参考生视频。三种模式的重点不同,但都需要先消除冲突,再增加细节。
先记住三条公式
文生视频可以从这条结构开始:
主体 + 场景 + 主要动作 + 运镜 + 画面处理 + 声音 + 结束画面
图生视频不必重复图片里已经确定的主体、构图与风格,重点改为:
主要运动 + 次要运动 + 运镜 + 必须保留的细节 + 结束状态
参考生视频则要先说明每份素材的职责:
参考素材角色 + 新场景中的动作关系 + 运镜 + 声音 + 结束状态
公式的意义不是保证结果,而是让你在生成前发现遗漏:动作有没有完成路径?镜头会不会与人物抢运动?参考图到底控制人物还是环境?
第一步:先写清楚镜头任务
在进入提示词之前,先完成一句话:
“看完这条视频,观众应该理解或感受到 __。”
产品展示可能需要观众看懂一个结构如何打开;人物短片可能需要表现犹豫逐渐变成决心;旅行画面可能只需要建立空间尺度和氛围。
如果一句话里塞进追车、回忆、三个人的对白和跨城市转场,这通常不是一条视频,而是几条视频。先拆开,再写细节。
把导演简报分成八层
1. 用可持续识别的特征描述主体
选择运动中仍然看得见的特征:轮廓、年龄段、服装颜色、材质、发型、产品结构或关键道具。
模糊写法:
一个女人穿过市场。
更清楚的写法:
一位穿苔绿色围裙的中年花艺师,端着装有白色芍药的浅木托盘,穿过清晨的室内花市。
后者不是单纯增加形容词,而是确定了人物、道具、主色和空间。
2. 只写会影响镜头的场景信息
优先描述空间尺度、前后景、时间、天气和真实光源,而不是列一串不会参与画面的装饰。
玻璃顶棚下有薄雾,窄窄的晨光穿过花摊,远处顾客缓慢移动,保持柔焦。
3. 选择一个主要动作
“感到希望”无法直接拍摄;“她停下脚步,注意到第一束晨光,抬起视线并露出克制的微笑”可以。
单镜头中,一个完整动作往往比连续堆叠动作更可靠。如果确实需要多个节拍,用时间线分配,而不是不断写“然后”。
4. 给运动建立层级
- 主要运动: 花艺师停步并抬眼。
- 次要运动: 围裙系带和松散花瓣被微风轻轻带动。
- 背景运动: 顾客保持缓慢、柔和,不抢主体。
所有元素同时高速运动,画面就失去主次。次要运动应该证明空间是活的,而不是再讲一个故事。
5. 选择一种核心运镜
| 运镜 | 适合表达 | 可用写法 |
|---|---|---|
| 固定镜头 | 观察、克制、产品结构 | “机位固定,不平移、不变焦” |
| 缓慢推进 | 注意力、亲密、顿悟 | “从中景稳定推进到近景” |
| 缓慢拉远 | 揭示空间、尺度、孤独 | “镜头逐渐后退,完整露出环境” |
| 横向跟拍 | 人物与空间共同移动 | “与人物同速侧向跟拍,距离不变” |
| 小幅环绕 | 展示形体或产品细节 | “保持主体居中,小幅顺时针环绕” |
除非你刻意制造混乱,不要在一条短片里同时要求升降、环绕、手持摇晃、快速推进和甩镜。
6. 用可执行的画面语言替代空泛词
“电影感、大片、顶级、震撼”没有解决具体问题。更有效的是:
- 阴天柔光,还是正午硬光;
- 冷色阴影搭配暖色实景灯,还是高饱和霓虹;
- 浅景深突出主体,还是深景深交代空间;
- 纪实观察式构图,还是精确的产品广告构图。
只写真正改变画面的选择。
7. 把声音写进场景
Wan 3.0 支持原生音画生成。声音应当像画面一样分层:
- 人声: 谁说、说什么、语言、情绪、语速、音色;
- 音效: 脚步、布料、机械、雨声、物体接触;
- 音乐: 是否需要、何时进入、承担什么情绪作用。
例如:
无对白。保留花市空间底噪、远处推车滚轮声和包花纸轻响。前段无配乐,最后两秒只进入一个温暖的大提琴长音。
如果不需要对白或音乐,直接说明。“安静”也是制作决定。
8. 定义可停留的结束状态
不要只写“视频结束”。写清最后的姿态、物体位置、视线或构图:
一片松散花瓣落在托盘上,镜头停在稳定近景,最后保持一秒。
明确的落点能让叙事完整,也方便后续剪辑。
一条完整的文生视频提示词
单一连续镜头。一位穿苔绿色围裙的中年花艺师,端着装有白色芍药的浅木托盘,穿过清晨的室内花市。玻璃顶棚下有薄雾,窄窄的晨光穿过花摊。她朝镜头走来,看见第一束阳光后放慢脚步,抬起视线,露出克制的微笑。镜头以她的步速稳定后退;她停下时,只做一次非常缓慢的推进。远处顾客保持柔焦和缓慢移动,围裙系带与松散花瓣被微风轻轻带动。冷色自然晨光照亮空间,花朵上保留温暖高光,材质真实,浅景深。无对白,只有花市底噪、远处滚轮声和包花纸轻响;最后两秒进入一个温暖的大提琴长音。结尾一片花瓣落在托盘上,镜头停在近景并保持一秒。
它的顺序清晰:主体、空间、动作、运镜、次要运动、画面处理、声音、结尾。任何一层出现问题,都能单独修改。
长视频要用时间线管理节奏
更长时长给了场景发展空间,也放大了节奏不明确的问题。15 秒或 30 秒视频可以按可读节拍组织:
- 0–5 秒:建立主体、地点和镜头关系;
- 5–12 秒:发展主要动作或信息;
- 12–18 秒:转折情绪、方向、尺度或声音发生变化;
- 18–24 秒:收束动作完成,画面开始简化;
- 24–30 秒:停留落在可以自然剪切的结束画面。
不是每条 30 秒视频都需要五段。连续表演可能只需要开场、发展和停留。时间线应减少歧义,而不是制造忙乱。
图生视频要换一个写法
图片已经是批准过的美术和构图。重复描述画面里的所有内容,反而可能把生成结果拉离原图。
保留原图中的面部比例、发型、深灰外套和构图。人物缓慢呼吸,先把视线转向窗外,再轻轻放松肩膀。窗帘边缘被微风带动,其余室内元素保持静止。机位固定,不推进、不变焦。保持原图色彩和光线方向。结尾人物视线停在窗外。
重点是运动、克制和需要保护的细节。完整方法见 Wan 3.0 图生视频指南。
参考素材必须有明确职责
先在项目笔记中写一份素材清单:
@image1:人物身份和服装;@image2:空间布局和色彩;@video1:步态和肩部运动;@audio1:只作为节奏参考。
然后描述素材之间的关系:
让 @image1 的人物走进 @image2 的走廊,保持 @image1 的深灰外套和 @image2 的绿色瓷砖结构。只采用 @video1 的步速与肩部节奏,不复制其中的人物、服装和地点。@audio1 只控制动作节拍,不复现人声。
无法用一句话说明用途的素材,通常应该删除。
一次只修改一个变量
| 问题 | 第一轮修改 | 保持不变 |
|---|---|---|
| 动作太弱 | 写清速度、路径和幅度 | 主体、场景、运镜、风格 |
| 人脸或产品漂移 | 减少转身、环绕和大幅动作 | 光线、时长、核心动作 |
| 画面太乱 | 删除背景动作 | 主体和结束画面 |
| 镜头抢动作 | 多个运镜改成一个 | 人物动作和空间 |
| 结尾突兀 | 增加明确结束状态和停留 | 前段节拍 |
| 声音拥挤 | 分开人声、音效、音乐职责 | 视觉方向 |
每次都重写整条提示词,就无法判断哪项改变真正有效。保留已经成立的部分,修改第一个失败层。
生成前检查
- 镜头只有一个清楚任务;
- 主体可以被快速识别;
- 主要动作是可见、可完成的;
- 运镜服务动作,而不是与动作竞争;
- 声音分别说明人声、音效和音乐;
- 每份参考素材只有一个主要职责;
- 结尾是明确的视觉状态;
- 不存在互相冲突的速度、情绪、地点和运镜;
- 时长与画幅符合最终发布渠道。
确认后进入 Wan 3.0 视频生成器,并把提示词、参数、参考素材和输出结果保存在一起。只有能复盘的提示词,才会变成真正可重复的工作流。


