Wan 3.0 的提示词不只用来“从零生成一条视频”。换一个角度,它也可以是一份 AI 后期修改单:保留已经拍好的表演,只改一个制作层,并提前写清修改从哪里开始、最后停在哪里。
下面整理了 9 套全新模板,覆盖环境重构、局部替换和整片包装。先说清边界:提示词可以提高可控性,却不能承诺逐像素不变。人物身份、口型、产品形状、时间点和文字,都必须由人复核。
上传前也请确认,你有权编辑素材中的人脸、声音、商标、产品和参考内容。
一条视频编辑提示词的六段结构
先别急着堆风格词。按这个顺序写,后面更容易排错:
素材职责 → 保护对象 → 修改目标 → 时间线 → 画面与声音规则 → 验收项
1. 先给每份素材分工
不要让模型猜素材为什么会出现在任务里。
Video 1:负责人物表演、时序、机位和原始声音;Image 1:负责目标空间、配色和实景灯位置;Image 2:负责人物或产品身份;Audio 1:只负责节奏,不复现其中的人声。
如果一份素材无法用一句话说明职责,就先删掉。更多素材编号和冲突处理方法见 Wan 3.0 参考生视频指南。
2. 划定“不能乱动”的边界
只列真正影响交付的内容:脸、服装、双手、产品标签、机位、台词时间或空间结构。“其他全部不变”很难验收;“保留同一位说话人、构图、上衣、麦克风、手势和原声节奏”更具体。
3. 每轮只提一个主要修改
换房间、从白天改到黄昏、加雨、换产品,可以分别做。首轮同时要求四件事,一旦失败就很难知道问题出在哪。
4. 给变化安排开始、发展和落点
如果特效必须卡一句台词或一个鼓点,直接写时间段。最后还要留出一个稳定状态,方便检查和剪辑。
5. 把画面、运动和声音分开
改画面并不等于要重做声音。明确说明保留原声、增加环境音、生成音乐,还是保持安静。
6. 最后写一份短验收表
只检查看得见、听得到的项目:人脸是否稳定、口型是否同步、手指数目、标签形状、雨从哪里来、背景是否闪烁、结尾是否停稳、有没有乱码。
第一组:保留表演,重建环境
这类任务以已有视频为锚点。人物和时序是常量,环境才是变量。

玩法 1:把口播人物搬进新演播间
适合: 人物表现可用,但拍摄空间不理想。
素材: 一条固定机位口播视频 + 一张目标空间参考图。
模板:
Video 1 是主持人、构图、手势、说话节奏和原声的唯一来源。Image 1 只定义新的陶艺工作室:石灰质感浅墙、木制层架、左侧大面积北窗和暖色实景灯。替换主持人周围的房间,保留同一人物、服装、桌面麦克风、机位高度和完整表演。新主光从画面左侧进入,在脸、服装、桌面和背景上形成方向一致的阴影。禁止运镜、在人物前方新增道具、字幕、Logo 或其他人物。最后一秒,新空间完全稳定。验收人脸、口型、手部边缘、麦克风形状、接触阴影和背景闪烁。
为什么这样写: 视频负责表演,图片负责美术。重打光把人物与新空间接在一起,避免出现“人物贴在背景上”的感觉。
玩法 2:同机位完成时间与季节变化
适合: 构图不动,只让气氛随时间变化。
素材: 一条空间关系稳定的室内或外景视频。
模板:
保留 Video 1 中的人物、家具、构图、原始运动和声音。八秒内只改变温室窗外景色与进入室内的光。0–2 秒:偏冷的春日清晨,玻璃有轻微凝结水汽。2–5 秒:暖色夕阳划过地面,在人物轮廓形成一条窄边光。5–7 秒:窗外叶片变为铜色,天空进入蓝调时刻。7–8 秒:室内实景灯成为主要暖光,画面停稳。保持植物与窗框结构稳定。禁止曝光跳变、人物出现延时运动、室内落叶、运镜和新音乐。
验收: 光线轨迹连续、阴影方向一致、人物面部曝光稳定、结尾有清楚落点。
玩法 3:加入真正与空间互动的天气特效
适合: 不想要一层“雨素材贴图”,而是希望风雨影响现场物体。
素材: 源视频;人物一致性要求高时,再加一张已确认的人物参考图。
模板:
Video 1 负责时序与人物表演。保持工作间、主持人、操作台、服装和机位不变。0–1.5 秒:房间干燥,画面完全不变。1.5–4 秒:一股夹着细尘的风从画面右侧门口进入,纸张边角和围裙系带产生克制、有重量的响应。4–7 秒:门外开始细雨,少量雨水越过门槛,只让入口附近地面逐渐变深。保留人脸、发际线、说话、双手和麦克风。雨向、布料运动、水花、反射与阴影必须一致。禁止全屏雨纹理、室内暴雨、闪电、镜头水滴、机位摇晃和重生台词。
验收: 特效只有一个物理入口,不遮脸,只在真正接触的位置改变材质。
玩法 4:把真人视频做成混合媒介拼贴
适合: 保留真人动态,但把周围空间改成平面设计或手工质感。
素材: 一条短口播或产品演示视频。
模板:
保留 Video 1 中的动态人物,把她作为具有原始脸部、说话、手势、服装和真实照片纹理的剪贴。人物轮廓之外全部替换为旅行手账拼贴:再生米白纸、褪色蓝色地图碎片、铅笔路线、无可读文字的邮票形状、半透明胶带和浅层纸张投影。人物背后增加一圈窄窄的撕纸衬底,跟随运动,但不能盖住脸和手。背景只安排三个动作:地图展开、一张胶带照片转入位置、一条虚线沿页面绘出。保留原声。机位固定;禁止把皮肤画成插画、增加肢体、漂浮文字或塑料 3D 材质。
验收: 逐帧检查头发与手部边缘;人物内部仍是真人影像,拼贴清楚位于她身后。
第二组:只修改一个制作元素
这类任务可能避免重拍,但人物、产品和声音的连续性压力更大。先截取最难的几秒做小样,不要一上来就跑完整片。

玩法 5:换产品,同时改一句台词
适合: 短广告需要更新道具和一段明确文案。
素材: 原广告、已确认的产品参考图、替换后的准确台词。
模板:
Video 1 负责演员、机位、剪辑时序、地点、服装、手部路径和环境音。Image 1 负责一瓶虚构气泡茶的瓶型、瓶盖、颜色与标签版式。只把演员右手里的易拉罐替换成这只瓶子,匹配握持位置、比例、反射、运动模糊和遮挡。只替换 00:03.2–00:05.1 的一句话:“最让我记住的是柑橘回味。”保持同一说话人特征与语速,其余原声全部保留。不要改变脸、身体、背景、镜头顺序和音乐。除 Image 1 中已确认的简单标识外,不新增标签文字。
验收: 产品结构、手指接触、标签稳定、音色连续、口型同步,以及替换句放回上下文后是否自然。如果产品和台词有一项失败,下一轮拆开测试。
玩法 6:生成可后期加字的模块化片头
适合: 想让 AI 负责节奏和动效,准确人名与片名在剪辑软件里完成。
素材: 可选一张美术方向参考图;最终文字不要依赖模型生成。
模板:
生成一条 12 秒、16:9 的片头,视觉来自二十世纪中叶的交通线路图。扁平纸片形状,藏蓝、暖白、朱红和苔绿配色,俯拍构图,克制的定格抖动,禁止 3D。0–3 秒:打票钳依次闭合,孔洞连接成虚线路线。3–6 秒:路线穿过三个站点圆形,纸箭头逐个折开。6–9 秒:时刻表网格向两边滑开,露出车窗剪影。9–12 秒:路线收束成一块大面积空白标题区,最后保持一秒。声音为干燥纸张轻敲、一次机械铃声和低频刷奏节拍。所有标题区保持空白,不生成人名、Logo 或乱码。
验收: 节奏、转场、配色和留白是否成立。准确演职员表交给后期排版。
第三组:一次设计完整的短片包装
当交付物是预告片、PV 或情绪片时,提示词需要“全局规则 + 分段时间线”。风格可以统一,但镜头必须有快慢和信息差。

玩法 7:黑色电影档案预告片
适合: 需要统一图形系统、声音母题和逐步升高的悬疑感。
模板:
生成 15 秒黑色电影档案预告片,共 10 个短镜头。全局视觉:高反差黑色与暖单色;钴蓝只用于手绘证据标记;明显 16mm 胶片颗粒;不生成可读文字。转场复用形状:蓝色圆圈变为钟面,档案边缘变成走廊,胶片灼烧变成港口雾气。0–4 秒:档案抽屉、戴手套的手、被圈起的照片。4–8 秒:空档案室、晃动吊灯、逐渐加速的盘式磁带。8–12 秒:雨后的港口台阶、消失在转角的风衣、一把慢动作落下的钥匙。12–15 秒:仓库灯下的孤独人影,最后 0.5 秒声音全部停止。声音:压低的大提琴脉冲、抽纸声、磁带机咔哒和远处雾笛。预留三块干净区域,供后期加标题。
验收: 钴蓝是否始终是唯一强调色、转场是否共享物体、标题安全区是否足够干净。
玩法 8:手绘舞蹈 PV
适合: 动作、配色和卡点比写实感更重要。
模板:
生成一条 15 秒、16:9 的手绘舞蹈 PV,带有限动画质感。人物是一名年轻成年舞者:青绿色短发、宽松米白外套、黑色长裤和红色运动鞋。视觉为墨线轮廓、珊瑚色与青色平涂、可见套色抖动和图形背景,禁止写实渲染。音乐为 132 BPM 电子流行,重拍清楚。不要堆大量无关镜头,只设计五组动作:入场肩部律动、两步配手部 wave、半转身剪影、break 段安静近景、最后一个重拍落在全身定格。分格擦除和墨迹飞溅只出现在强拍。禁止歌词、Logo 和可读字幕。
验收: 每段中发型与服装是否一致、动作是否卡拍、剪影是否清楚、最后姿势能否稳定停留。
玩法 9:情绪化记忆蒙太奇
适合: 用碎片传达一种情绪,而不是在 15 秒里讲完复杂剧情。
模板:
生成一条 15 秒、有同步声音的海边告别蒙太奇。视觉语言:夏末 35mm 质感、浅青色阴影、暖阳、被风压弯的草、克制光晕。两名大学年龄的朋友主要以背影、侧脸、双手或远处剪影出现,所有镜头保持服装一致。使用八个片段:海堤上的自行车轮、交接折叠地图的两只手、渡轮窗户、湿台阶上的鞋、被风卷起的围巾、没有得到回应的挥手、站在码头两端的人、空无一人的海平线。用相同运动方向和光线衔接,不用炫技转场。声音始终保留风和渡轮引擎,5 秒后进入稀疏钢琴,13 秒后音乐退出。无对白、无生成字幕、无品牌标记,清楚正脸单次不超过半秒。
验收: 情绪是否只有一条发展线、人物运动方向与服装是否连续、反复物件是否有效、声音是否留有空间、结尾不靠解释也能成立。
别一次烧完预算:用阶梯测试
- 先截一段诊断片。 选 5–8 秒,必须包含最难的脸部角度、手部接触或特效起点。
- 每轮只改一个变量。 其他提示词与参数保持不变。
- 正常速度和逐帧各看一遍。 第一眼合理,不代表没有单帧脸漂或标签变形。
- 先锁定修改逻辑。 确认可用后,再提高时长、分辨率或参考素材数量。
- 确定性内容留给后期。 准确片名、法规文案、产品卖点和逐帧音频编辑,应在剪辑软件中完成。
先修第一个失败层
| 问题 | 第一轮怎么改 | 哪些内容先不动 |
|---|---|---|
| 人脸或服装漂移 | 减少运镜和特效与人物的直接接触 | 时序、空间、声音 |
| 产品像浮在手上 | 写清握持点、比例、遮挡和运动模糊 | 演员与机位 |
| 新背景像贴图 | 指定主光方向与接触阴影 | 表演与构图 |
| 天气像覆盖层 | 写清入口、前中后景和表面互动 | 原片曝光 |
| 蒙太奇没有关系 | 让转场复用一个物体、方向或声音 | 配色与时长 |
| 生成文字错误 | 删除文字,改成预留干净排版区 | 动效设计 |
| 声音太挤 | 分开台词、音效、环境与音乐职责 | 画面修改 |
每轮只动一层。整条重写,就失去了判断“到底是哪句话起作用”的证据。
生成前检查
- 已获得所有人脸、声音、Logo、产品和参考素材的编辑权限;
- 每份输入只有一个明确职责;
- 保护边界简短,而且能够验收;
- 当前提示词只有一个主要修改目标;
- 定时特效有开始、发展和稳定结尾;
- 原声与生成声音的职责已写清;
- 准确文字会在后期制作,不交给模型碰运气;
- 已经选好首轮测试的 5 秒片段。
准备好后,进入 Wan 3.0 视频生成器,只上传职责清楚的参考素材,并把提示词和结果一起保存。最终交付前,再用 AI 视频质量检查清单 完整过一遍。


