把一条视频压缩到十秒,反而更考验表达。十秒容不下复杂剧情,却足够展示一个有力的动作、一段明确的镜头运动,或一个有记忆点的转变。提示词的任务,是把这十秒拆成模型能执行的画面说明。

先确定“一个主体,一个动作,一个结果”
初稿只保留一个主角和一个动作。例如“咖啡师将拉花完成后抬头微笑”,而不是“咖啡师做咖啡、顾客进门、镜头绕场一周、窗外下雨”。元素越多,模型越容易丢失动作主线。
用时间轴写清节奏
| 时间段 | 该交代什么 | 示例 |
|---|---|---|
| 0—2 秒 | 起始构图 | 中近景,人物已站在吧台前 |
| 2—7 秒 | 核心动作 | 缓慢倾倒奶泡,形成清晰拉花 |
| 7—10 秒 | 结束画面 | 镜头停在完成的杯面,人物轻微退后 |
一个可用的提示词骨架
时长:10 秒。
主体:[人物或物体],外观锚点:[服装/材质/颜色]。
场景:[地点、时间、光线]。
镜头:从[景别]开始,镜头[平移/推进/静止]。
动作:主体只完成[一个关键动作],动作速度[快慢]。
结尾:停留在[最后一帧的画面]。
保持:人物、场景和光线连续;无多余角色、无字幕、无品牌标识。先做“动作版”,再做“美术版”
第一轮先不追求电影感,只检查动作和镜头是否成立。若动作不完整,减少镜头移动或缩短动作链。动作稳定后,再加入光线、材质、色彩等美术要求。把这两件事混在一次生成里,往往会让你不知道哪里出了问题。
失败画面如何修订
若主体突然变形,先删掉不必要的动作描述;若镜头晃动,改为固定镜头或只指定一种运动;若结尾不能用,明确“最后两秒定格在……”。每次只改一个变量,并保留上一版提示词,才能快速找到有效调整。
十秒视频最重要的是可控。能稳定完成一个动作,再扩展到连续镜头,效率远高于一开始就追求复杂大片。




