参考生视频不是上传素材越多越好,而是一套素材管理系统:每张图片、每段视频、每份音频、文档或网页,都必须承担清楚、可检查的职责。
Wan 3.0 官方参考工作流支持最多 10 张图片、5 段视频和 5 份音频,也可以使用文档或网页信息。但容量不等于控制力;只有当素材对人物、空间、运动和声音的定义彼此一致时,多素材才真正有价值。
本指南将帮助你建立参考清单、选择最小有效素材组、写清素材关系,并按职责复核输出。可以配合 参考生视频工作区 使用。
先判断是否真的需要参考素材
当结果必须继承以下批准信息时,适合使用参考模式:
- 人物、角色、生物或产品身份;
- 服装、材质、包装或道具细节;
- 地点、空间布局、界面或视觉系统;
- 动作模式、表演节奏或摄影机路径;
- 声音、空间氛围、音色或音乐脉冲;
- 受支持文档或公开网页中的事实和结构。
创意可以自由发明时使用 文生视频;一张开场图或首尾两张图已经能定义镜头时使用 图生视频。只有多份不同来源必须协作时,参考模式才体现优势。
上传前先建立参考清单
在项目记录里写一个简单表格:
| 标签 | 素材 | 主要职责 | 必须保留 | 可以忽略 |
|---|---|---|---|---|
| 图片 1 | 主角肖像 | 人物身份 | 脸型、发型、藏蓝外套 | 原图背景 |
| 图片 2 | 车站内景 | 空间布局 | 绿色瓷砖、拱门间距、钟的位置 | 原图人物 |
| 视频 1 | 行走参考 | 表演节奏 | 稳重步速、肩部重心 | 表演者身份、服装与地点 |
| 音频 1 | 环境录音 | 空间声 | 列车刹车质感、站台混响 | 远处广播的具体内容 |
清单把“素材内容”与“素材职责”拆开。视频 1 可以出现另一个人和另一个地点,因为你只采用动作;提示词若不说明,系统就只能猜哪些部分应当迁移。
执行“一份素材,一个主要任务”
有效职责包括:身份锚点、服装或材质锚点、环境布局、构图、运动节奏、运镜路径、人声或环境声、事实来源。
“作为灵感”“做得像这个”“全部都用上”无法被客观检查。每份素材当然会自然携带多个信息,但你的方向必须明确优先级。如果两份素材承担相同职责,保留更清楚的一份。
上传前消除五类冲突
身份冲突
两张肖像可能在年龄、发际线、妆容、脸部比例或服装上不一致。明确它们是同一人物的不同角度,还是两个不同角色,并指定哪张图是身份权威。
空间冲突
地点图片可能对门、窗、层高和光线方向给出不同答案。选择一张作为布局权威,另一张只控制一个被点名的细节。
运动冲突
缓慢、有重量感的表演与高速手持运镜可能产生相反节奏。分别指定主体运动和摄影机运动;仍然冲突时删除次要素材。
声音冲突
对白、环境声、音乐和音效会互相竞争。说明哪一份提供内容,哪一份只提供节拍,哪些内容绝不能被照搬。
风格冲突
写实人物图、平面动画、商业产品光和纪实视频不会自动组成统一美术。明确最终画面处理,并指出由哪份素材控制。
使用稳定标签,并把职责写在标签旁边
在 wan-3.ai 工作流中,使用界面插入的 @image1、@video1、@audio1 等标签,并让标签紧邻它控制的对象。
模糊写法:
用这些图片和视频,让他们以相同感觉走过车站。
更清楚的写法:
让 @image1 中的人物走过 @image2 的车站。保留 @image1 的脸部、发型和藏蓝外套;@image2 只用于绿色瓷砖拱门、中央时钟位置和冷色顶光。采用 @video1 的稳定步速与肩部节奏,但不要复制其中的表演者、服装和地点。@audio1 只提供站台环境与列车刹车质感,不复现可辨认的广播内容。
边界能避免一份素材影响它不该控制的部分。
提示词要写“关系”,而不是列库存
可以采用这条结构:
[身份素材] 在 [环境素材] 中执行 [由运动素材指导的动作],[音频素材] 控制 [声音职责]。保留 [关键细节],忽略 [无关内容]。镜头 [运镜与构图],最后停在 [结束状态]。
完整示例:
@image1 的人物进入 @image2 的车站,并停在时钟下方。保留 @image1 的脸部比例、短黑发、藏蓝羊毛外套和银色领针。以 @image2 作为布局权威,保留绿色瓷砖拱门、中央时钟、站台边缘和冷色顶光,移除原图中的人群。只采用 @video1 的稳重步速和轻微肩部重心,不采用其中的表演者与户外背景。摄影机在胸口高度与人物并行跟拍,人物抬头看钟时停止。@audio1 提供低沉站台混响与远处列车制动质感,无可辨认广播、无音乐。结尾停在人物中景侧面,时钟位于上方,并保持画面。
这段文字较长,是因为它同时承担了“素材合同”的作用。
首尾帧与参考模式要先选清楚
当前 Wan 3.0 工作流把首尾帧控制与多模态参考输入视为不同路径。开场或结尾构图不可妥协时选帧模式;需要组合身份、地点、运动、声音、文档或网页信息时选参考模式。
不要默认所有控制都能混在一次请求里。先根据界面的兼容组合和当前限制确定模式,再写提示词。
文档和网页只作为信息来源
文档或公开网页不同于人物身份图,它们提供事实、步骤、术语或解释结构。使用前要:
- 明确观众和唯一沟通目标;
- 提取必须准确的名称、数字、顺序和观点;
- 决定哪些内容进入旁白、画面或被删除;
- 移除敏感、保密、过时和无关信息;
- 生成后逐项回到原始来源人工核对。
不要要求“把整份报告做成视频”。应限定章节与任务,例如:
上传的报告只用于三阶段维护顺序和部件名称。按时间顺序面向新操作员解释,不编造性能数据或安全阈值;每次提到部件时才显示对应简洁字幕,最后提醒遵循已批准维护手册。
有来源并不意味着生成出的文字、图表和旁白自动准确。
给音频参考设边界
音频可能承担人声特征、表达节奏、环境声、音效质感或音乐情绪。必须说明采用什么、不采用什么:
使用 @audio1 的平静语速与温暖音色,但必须逐字使用新的批准台词;不要复现原音频中的背景音乐和房间噪声。
或:
@audio2 只作为动作重拍的节奏参考,不生成任何人声,也不复现可辨认旋律。
清晰边界也更有利于版权和授权审查。
生成前精简素材包
逐份回答:
- 我能否用一句话说出它的职责?
- 是否已有更清楚的素材承担同一职责?
- 它是否与人物、空间、运动或声音权威冲突?
- 目标动作会不会暴露它没有提供的信息?
- 我是否拥有本项目所需的使用许可?
第一题答不出来就删除;第三题冲突就先解决;第五题不确定则不能进入生产。
按职责检查参考一致性
| 职责 | 检查问题 | 重点时间点 |
|---|---|---|
| 身份 | 脸部、服装、产品或角色特征是否稳定? | 转侧脸、遮挡、接触、高速动作 |
| 地点 | 空间布局是否持续清楚? | 出入口、转向、背景结构线 |
| 运动 | 节奏与重量是否迁移,同时排除无关内容? | 起步、动作峰值、恢复 |
| 运镜 | 镜头是否按计划移动并保持主体可见? | 加速、环绕、重新构图 |
| 音频 | 人声、节奏、环境或音效是否在正确时间出现? | 对白、瞬态音效、场景变化 |
| 信息 | 名称、数字、步骤和可见文字是否准确? | 字幕、旁白、图表、结尾 |
记录第一次失败的时间码,再修改对应职责边界、删除冲突素材,或缩小引发问题的动作。不要笼统地说“没有参考感”。
参考素材检查表
- 每份素材只有一个主要任务;
- 每项关键身份或布局都有一份权威素材;
- 重复与矛盾素材已删除;
- 提示词中的界面标签稳定一致;
- 同时写清需要保留与需要忽略的内容;
- 没有意外混用帧模式和参考模式;
- 文档与网页事实有人工核对计划;
- 音频明确区分人声、节奏、环境、音效与音乐;
- 每份上传素材都确认权利和授权;
- 复核按每份素材的指定职责进行。
素材清单整理好后进入 Wan 3.0 参考生视频。如果一张静态图已经包含镜头所需全部信息,较简单的 图生视频工作流 更适合作为第一次测试。


