生成视频的核心不是“把画面描述得越长越好”,而是让模型清楚理解:谁在做什么、在哪里、怎么拍、画面如何变化,以及哪些内容绝不能变。
建议按下面顺序写:
主体 + 动作 + 场景 + 镜头 + 光线/风格 + 节奏 + 约束
例如:
一位穿深蓝色风衣的女性站在雨后的东京街头,缓慢抬头看向霓虹灯。镜头从中景缓慢推进到面部特写,浅景深,路面有倒影,冷蓝与洋红色电影灯光,细密雨丝自然飘落,动作克制、节奏舒缓,人物五官和服装在整个镜头中保持一致,不出现文字或多余人物。
视频模型通常更擅长生成短而明确的片段。一个提示词里塞入“人物走路、回头、上车、爆炸、转场到太空”等多个事件,容易出现动作混乱、人物变形或镜头跳变。
更稳妥的方式是拆镜头:
镜头 1:人物走进咖啡馆
镜头 2:人物坐下,窗外下雨
镜头 3:手部特写,端起咖啡杯
再通过剪辑拼成完整叙事。
想要结果更可控,应明确镜头表达方式:
景别:远景、全景、中景、近景、特写
运动:固定镜头、缓慢推进、横向跟拍、环绕、俯拍、航拍
焦段感受:广角有空间感,长焦更压缩、更电影化
焦点:浅景深、背景虚化、焦点从物体转移到人物
节奏:缓慢、自然、快速、充满张力
例如,把“一个人在海边”改成:
日落时,一名冲浪者站在海边礁石上。低机位中景,镜头从左向右缓慢跟拍,海浪在前景拍打礁石,金色逆光,电影感,人物动作自然。
人物容易在不同帧或不同片段间变化。提示词中应固定最有辨识度的特征:
年龄范围、发型、肤色、服装颜色
明显配饰,如红色围巾、银框眼镜
情绪状态,如平静、坚定、疲惫
不变要求,如“服装和面部特征保持一致”
不要在同一段里频繁切换服装、年龄、发型或情绪,除非这是有意的变身效果。
“跳舞”“奔跑”这类动作比较宽泛。更清晰的动作描述会提升效果:
不佳:女孩在跳舞
更好:女孩轻轻旋转半圈,裙摆随动作自然摆动,随后停下并望向镜头
动作过于复杂时,拆成多个片段生成。手部、多人互动、快速物体接触等场景尤其适合拆分。
风格词可以帮助建立视觉方向,但不要无意义堆叠“电影感、8K、超清、史诗级、获奖摄影”。
更有效的写法是说明风格的具体来源:
35mm 胶片质感,轻微颗粒,低饱和暖色调,柔和侧光,现实主义电影风格。
如果要模仿某类审美,可描述其特征,不必依赖单一风格标签。
在结尾明确排除常见问题,例如:
不出现字幕、文字、水印、畸形手指、额外肢体、人物闪烁、服装突变、镜头抖动或快速变形。
但负面要求不宜过长。优先写最影响成片的 3—6 条即可。
推荐三轮迭代:
先锁定主体与场景 确认人物、服装、地点是否正确。
再优化镜头和动作 调整景别、运动、动作幅度、节奏。
最后加强氛围和风格 加入光影、天气、色彩、胶片感、音效氛围等。
每次只改少量变量。这样才能知道结果变好或变差的真正原因。
[主体外观] 在 [具体场景] 中进行 [单一、明确的动作]。 [景别],[镜头运动方式],[构图/焦点]。 [光线、时间、天气、色彩与风格]。 [动作节奏与情绪]。 保持 [人物/服装/物体] 一致,不出现 [需避免的问题]。
把提示词写得像你在给摄影师、演员和灯光师下指令:
摄影师需要知道怎么拍;
演员需要知道怎么动;
美术需要知道场景和道具;
灯光师需要知道时间、色彩和氛围;
剪辑师需要知道节奏和镜头重点。
越具体、越有层次,生成结果就越稳定。