文生视频拥有最大的创作自由,也缺少现成画面的保护。没有首帧替你固定人物、构图、服装和空间,文字必须先建立这些基础,再让动作真正发生。
因此,专业的 Wan 3.0 文生视频流程不是“写一段漂亮描述然后碰运气”,而是:确定镜头任务,删除互相竞争的想法,设计时间线,选择交付参数,生成一版用于诊断的草稿,再只修改失败的部分。
你可以一边阅读,一边打开 Wan 3.0 文生视频工作区 实践。
什么情况下适合从文字开始
以下场景优先选择文生视频:
- 不需要复现某个现成人物、产品、地点或构图;
- 希望围绕同一创意探索多种视觉方向;
- 动作与叙事比还原特定画面更重要;
- 正在制作概念片、氛围测试、建立镜头或前期预演;
- 能够明确描述主体与环境。
如果开场画面必须保持,选择 图生视频;如果人物身份、运动、声音或地点需要来自多份批准素材,选择 参考生视频。
1. 把创意压缩成一句场景承诺
先用普通语言写一句话:
夜班面包师在城市苏醒前发现,今天清晨的第一只面包发酵得恰到好处。
这还不是提示词,而是一把筛子。后面的角色、光线、动作、运镜和声音,都应该服务“安静的发现”和“夜晚转入清晨”。
如果又加入追逐、童年闪回、三个顾客对白和屋顶日出,你已经写成了几条视频。先拆分,再组织镜头。
2. 选择叙事形态
Wan 3.0 支持最长 30 秒视频,但时长应该服从可读动作数量。
单一连续镜头
适合手工动作、人物表演、产品展示或一个情绪变化。空间和人物不在每次切镜时重新建立,复核也更直接。
最简单的结构是:
- 主体开始行动;
- 一个有意义的变化发生;
- 镜头停在变化后的结果。
有时间线的多节拍场景
只有故事确实需要不同阶段时,才使用时间段。尽量保持地点和核心人物稳定。
- 0–6 秒: 建立烘焙坊、黎明前的蓝色窗光,面包师打开烤箱;
- 6–14 秒: 蒸汽散出,面包师检查表皮并听见细微裂响;
- 14–22 秒: 面包被放到工作台,暖灯与第一缕天光交汇;
- 22–30 秒: 面包师松一口气,轻轻微笑,镜头停在面包与窗外刚苏醒的街道。
时间线的目的,是管理节奏和因果,不是每几秒强行换一次地点。
3. 用运动中看得见的特征设计人物
优先写:
- 轮廓与年龄段;
- 一两个服装锚点;
- 关键道具;
- 姿态和运动质感;
- 人物与空间的关系。
例如:
一位五十岁左右、略显疲惫的面包师,衬衫袖子卷到沾有面粉的前臂上,穿深蓝围裙,在狭窄的木制工作台旁安静而精确地工作。
这些特征在中景与运动中仍然成立,比一长串可能看不清的面部形容词更有价值。
4. 把情绪写成可拍摄动作
“他获得满足感”是解释;“他听见面包表皮裂响,放松一直屏住的呼吸,露出很轻的笑”是动作。
检查人物是否有足够时间完成。10 秒内同时要求走过房间、揉面、开烤箱、取出面包、说两句话、再望向窗外,模型只能压缩或放弃部分指令。
按重要性排序:
- 观众必须看懂的主要动作;
- 赋予动作意义的反应;
- 一个环境反馈。
5. 交代关键空间关系
当人物搬动物体、穿过前后景或与家具互动时,位置关系比更多风格词更有效。
烤箱在人物身后、画面左侧;工作台沿画面向右侧窗户延伸。整个镜头保持人物、面包和窗户在同一视觉轴线上。
空间关系清楚,人物行动和运镜才有共同坐标。
6. 只选一个核心运镜
让运镜服从场景承诺:
- 固定广角能表现日常劳动的真实感;
- 缓慢推进能放大小小的发现;
- 横向跟拍适合交代完整工序;
- 缓慢拉远能揭示人物与城市的关系。
面包坊案例可以写:
从固定中广景开始。面包落到工作台后,只做一次缓慢推进,靠近人物的双手与表情。不环绕,不突然切换手持摇晃。
少量排除语句可以保护镜头语法,但不要写成冗长的负面清单。
7. 描述光源与材质如何反应
文生视频需要从零建立画面,因此要写清真实光源和关键材质:
冷蓝晨光从街边窗户进入,暖色钨丝灯柔和照过磨旧木台、拉丝钢材、空气中的面粉和焦褐面包表皮。蒸汽保持半透明,不遮挡人物双手。
它确定了冷暖关系、质感和可见性,比“高级电影质感”更容易执行。
8. 像混音一样安排声音
把声音拆成三轨:
- 人声: 准确台词、人物、语言与表达;没有对白也要说明;
- 音效: 与画面动作对应的材质和接触声;
- 音乐: 是否存在、何时进入、承担什么情绪。
无对白。近距离保留烤箱铰链、布料摩擦、面包落在木台和表皮裂响;窗外只有低声城市底噪。最后五秒才进入稀疏、安静的钢琴动机。
不必让每件物体都发出夸张声音。声音也需要主次。
9. 把输出参数当成交付决定
当前 Wan 3.0 工作流支持 2–30 秒、480P/720P/1080P,以及自适应或固定画幅。不要因为某个数字最大就默认选择它。
| 决定 | 先问什么 | 实用方向 |
|---|---|---|
| 时长 | 有多少动作必须被看清? | 用足以完成主要节拍的最短时长 |
| 画幅 | 最终出现在哪里? | 尽早按最终渠道设计构图 |
| 分辨率 | 这是探索稿还是可能交付的版本? | 先验证方向,再为通过的方案选择合适高精度输出 |
| 音频 | 声音是否参与叙事? | 只有当提示词给声音明确职责时才保留 |
具体可选项和积分消耗,以生成器提交前显示的当前信息为准。
完整提示词示例
黎明前,一条连续镜头发生在狭窄的社区烘焙坊。一位五十岁左右、略显疲惫的面包师,衬衫袖子卷到沾有面粉的前臂上,穿深蓝围裙,动作安静而精确。烤箱位于人物身后、画面左侧;磨旧的木工作台延伸到右侧街边窗户。人物打开烤箱,取出一只焦褐面包,放到工作台,听见表皮裂响后松开屏住的呼吸,露出很轻的笑。始终保持人物、面包和窗户在同一视觉轴线上。从固定中广景开始;面包落到工作台后,只做一次缓慢推进,靠近双手与表情。冷蓝晨光从窗户进入,暖色钨丝灯照亮面粉、木头、拉丝钢材和半透明蒸汽。无对白,保留烤箱铰链、布料、面包落木和表皮裂响,窗外是很低的城市底噪。最后五秒进入稀疏钢琴。结尾保持人物轻微微笑,面包在前景清晰,窗外街道柔焦,画面停留。
虽然细节丰富,但每个细节都属于同一个场景承诺。
第一版的任务是诊断
第一版不需要证明项目已经完成,只需要回答:
- 关闭声音后,动作是否仍然能看懂?
- 人物从开头到结尾是否保持可识别?
- 运镜是在解释动作,还是遮挡动作?
- 关键材质和接触是否达到用途要求?
- 声音是否确实来自可见空间?
- 最后一帧是否可以自然剪接?
用时间码写问题。“感觉不对”无法指导下一次生成;“00:11 推进突然加速,遮住面包落台动作”可以。
只修改失败的那一层
动作正确、镜头错误,就只改运镜段;故事成立、声音拥挤,就保留视觉并简化声轨;人物在大幅转身时漂移,先缩小转身幅度,不要立刻替换整个美术方向。
建议每一版记录:
- 提示词版本;
- 模型与模式;
- 时长、画幅、分辨率和音频设置;
- 原始输出;
- 三条带时间码的观察;
- 下一版只改变的一个变量。
这样做,文生视频才会从“抽提示词盲盒”变成可以复盘的制作过程。
最终检查
- 场景承诺适合一条视频;
- 人物有运动中仍可识别的视觉锚点;
- 动作能在时长内完成;
- 运镜只有一套连贯计划;
- 光线写清来源,并保护重要细节;
- 人声、音效、环境声和音乐职责分明;
- 结尾到达明确状态并停留;
- 第一轮迭代只修改失败层。
准备好后进入 Wan 3.0 文生视频。如果需要一套随时复用的写作框架,把 Wan 3.0 提示词指南 放在项目记录旁边。


