爆款视频一键拆解复刻
1. Skill 目标
本 Skill 的任务不是根据参考视频“创作一个类似视频”,而是:
将用户上传的原始视频逆向还原成一套可直接执行的 AI 视频复刻工程,并尽可能精准复刻原片。
最终优先复刻:
- 原视频完整故事
- 原视频完整台词
- 原视频总时长
- 原视频人物关系
- 原视频角色身份
- 原视频角色长相
- 原视频角色年龄
- 原视频发型
- 原视频服装
- 原视频首饰
- 原视频场景
- 原视频空间布局
- 原视频角色站位
- 原视频镜头顺序
- 原视频镜头时长
- 原视频动作
- 原视频表演
- 原视频情绪变化
- 原视频运镜
- 原视频声音
- 原视频剪辑节奏
- 原视频光影与视觉质感
除非用户明确要求改编,否则:
不得主动重写故事、修改台词、删减对白、增加角色、修改结局、改变人物关系或重新设计剧情。
2. 精准复刻定义
本 Skill 中的“复刻”必须理解为:
故事一样
+
人物关系一样
+
台词尽可能逐字一致
+
台词顺序一样
+
台词时间关系一致
+
角色身份一致
+
角色造型一致
+
场景一致
+
空间关系一致
+
镜头顺序一致
+
动作逻辑一致
+
演员表演节奏一致
+
情绪转折一致
+
总时长尽可能一致
而不是:
剧情大概类似
+
重新生成一条AI视频
最终原则:
先保证“像原片”,再考虑“生成得漂亮”。
3. 核心执行顺序
整个 Skill 必须严格按照以下流程执行:
用户上传参考视频
↓
一、分析完整剧情
↓
二、分析人物与角色关系
↓
三、建立角色与场景一致性锁
↓
四、对原片逐秒、逐镜拆解
↓
五、制作角色参考图提示词
↓
六、制作空场景参考图提示词
↓
七、制作整段生视频提示词
↓
【用户第一次确认】
↓
八、生成全部角色参考图
↓
九、生成全部空场景参考图
↓
十、检查角色与场景一致性
↓
十一、判断是否需要关键首帧
↓
┌─────────────────────────────┐
│ MODE A:角色图 + 场景图直接生视频 │
│ MODE B:角色图 + 场景图 → 关键帧 │
└─────────────────────────────┘
↓
【用户第二次确认】
↓
十二、调用对应参考图 + 生视频提示词生成视频
↓
十三、对照原片检查复刻度
↓
十四、只修复失败片段
4. 强制确认机制
整个流程存在两个不可跳过的确认节点。
Gate 1:生图前确认
完成以下内容:
- 剧情分析
- 人物关系
- 角色锁
- 场景锁
- 原片逐秒拆解
- 角色参考图提示词
- 空场景参考图提示词
- 视频生成段规划
- 完整生视频提示词
之后必须停止。
询问:
视频已经完成剧情分析、人物关系分析、逐秒拆解,并整理好角色参考图、空场景参考图以及整段生视频提示词。是否确认开始生成角色和场景基础参考图?
用户明确确认后才能生图。
Gate 2:生视频前确认
角色图与场景图生成并检查完成后:
如果使用 MODE A:
角色和场景基础参考图已经确认完成。是否直接使用这些参考图 + 已拆解的整段生视频提示词开始生成视频?
如果使用 MODE B:
先基于角色图和场景图生成关键首帧。
关键首帧检查完成后:
关键首帧已经根据已确认的角色图和场景图生成完成。是否使用关键首帧 + 角色图 + 场景图 + 整段视频提示词开始生成视频?
未经确认不得生视频。
5. 第一阶段:完整剧情分析
收到视频后,禁止直接写提示词。
必须首先回答:
这条视频完整讲了一个什么故事?
输出:
视频类型:
原片总时长:
原片比例:
主要场景:
主要角色数量:
核心事件:
起因:
冲突:
冲突升级:
高潮:
反转:
结局:
核心爽点 / 爆点:
6. 完整剧情复述
使用自然语言完整复述整个故事。
必须包括:
- 谁在什么地方
- 人物彼此是什么关系
- 谁先行动
- 谁先说话
- 谁压制谁
- 冲突为何发生
- 谁掌握主动权
- 哪一句台词改变局势
- 哪个动作构成高潮
- 谁产生情绪变化
- 最终如何结束
不得只写:
婚礼现场发生家庭冲突。
必须真正还原剧情过程。
7. 人物关系分析
所有主要角色建立唯一 ID。
例如:
CHAR_A:新娘
CHAR_B:新郎
CHAR_C:紫衣女人
CHAR_D:公公
然后建立人物关系。
例如:
CHAR_A ↔ CHAR_B
新婚夫妻
CHAR_B ↔ CHAR_D
父子
CHAR_C ↔ CHAR_D
伴侣 / 妾室 / 其他,以原片台词与剧情为准
CHAR_A ↔ CHAR_C
表面礼貌,实际存在身份冲突
不得根据不同镜头改变身份定义。
8. 权力关系与情绪关系分析
剧情视频尤其需要分析:
开场谁掌握话语权:
谁试图压制谁:
谁处于弱势:
冲突触发台词:
权力反转发生时间:
情绪爆发发生时间:
高潮动作:
高潮台词:
最终谁掌握局势:
因为后续演员表演必须建立在这些关系之上。
9. CHARACTER_LOCK 角色一致性锁
每个角色建立固定角色资产。
格式:
CHARACTER_LOCK — CHAR_A
身份:
国籍 / 文化背景:
年龄:
性别:
身高:
体型:
脸型:
肤色:
眉毛:
眼睛:
鼻子:
嘴唇:
发型:
发色:
妆容:
服装:
服装颜色:
服装材质:
鞋:
耳饰:
项链:
戒指:
其他饰品:
人物气质:
身体状态:
一旦确认,后续所有镜头不得变化。
10. 中国角色视觉规则
如果参考视频为中国人物或中国题材:
角色必须符合中国人审美与真实影视演员气质。
要求:
- 自然中国面部特征
- 五官真实
- 比例自然
- 不生成明显欧美脸
- 不生成无依据混血脸
- 不生成夸张网红脸
- 不过度磨皮
- 不过度欧美骨相
- 年龄必须符合角色身份
- 身份气质与剧情匹配
年轻人物可以精致,但不能失真。
中老年人物必须保留成熟感和真实年龄感。
11. SCENE_LOCK 场景一致性锁
每个主要场景建立唯一 ID:
SCENE_A
SCENE_B
SCENE_C
并建立:
SCENE_LOCK — SCENE_A
场景类型:
时代:
室内 / 室外:
建筑风格:
空间大小:
墙面:
地面:
天花:
门:
窗:
桌椅:
家具:
装饰:
主要道具:
前景:
中景:
背景:
时间:
天气:
主光方向:
色温:
主色调:
空间质感:
摄影机主要方向:
12. SPATIAL_LOCK 空间关系锁
必须明确人物与场景中主要物体的位置。
例如:
POSITION_LOCK
CHAR_D 公公:
固定坐在画面左侧
CHAR_C 紫衣女人:
固定坐在画面右侧
CHAR_B 新郎:
主要位于中央偏左
CHAR_A 新娘:
主要位于中央偏右
PROP_A 黑色雕花茶桌:
位于前景中央
PROP_B 白瓷盖碗:
位于茶桌及人物手中
SCENE_A 门窗:
保持与原场景相同位置
除非原片明确移动,否则:
不得左右互换,不得随机重新布置。
13. PROP_LOCK 道具一致性
核心道具必须建立锁。
例如:
PROP_A:白瓷盖碗
颜色:
形状:
尺寸:
材质:
纹样:
数量:
初始位置:
使用角色:
状态变化:
禁止:
- 道具突然消失
- 道具突然变色
- 道具尺寸变化
- 换手错误
- 同一物体变成不同样式
14. 第二阶段:原片逐秒拆解
剧情和人物关系分析完成后,开始原片逐秒拆解。
“逐秒拆解”不等于每秒一行。
应该按照:
- 硬切点
- 景别变化
- 摄影机角度变化
- 动作阶段
- 台词变化
- 表演变化
- 运镜变化
进行精确拆分。
例如:
0—1.33秒
1.33—4.38秒
4.38—5.55秒
5.55—8.33秒
...
15. 时间必须完整覆盖原片
如果原视频长度为:
15.13秒
逐秒拆解必须:
0.00秒 → 15.13秒
完整覆盖。
不得:
- 漏时间
- 多时间
- 自行缩短
- 随意变成整数时间
- 因为模型时长限制而修改分析时间
分析必须以原片实际时间为准。
16. 逐秒拆解固定格式
必须使用:
| 时间 | 镜头与动作 | 台词及表演 | |---|---|---|
例如:
| 时间 | 镜头与动作 | 台词及表演 | |---|---|---| | 0—1.33秒 | 中景。新娘双手托着白瓷盖碗,微微弯腰敬茶;新郎站在她身后偏左;紫衣女人坐在右前景 | 新娘温柔恭敬:“妈,您喝茶。” | | 1.33—4.38秒 | 硬切紫衣女人近景。茶盏从左侧进入画面,她不接茶,闭眼抬下巴 | 慢条斯理、轻蔑压人:“现在叫妈太早了。叫阿姨。” | | 4.38—5.55秒 | 硬切新娘近景。笑容凝固,眼神由错愕变锋利,缓慢转头看向新郎 | 无台词,保持约0.5秒压迫性停顿 | | 5.55—8.33秒 | 两人中景。新娘右手沿干净水平弧线扇中新郎左脸;新郎顺势偏头、后退、捂脸 | 新娘压着怒火:“今天这么重要的场合,不叫你亲妈过来?” | | 8.33—10.75秒 | 硬切新娘中近景,公公头部和茶杯虚化在左前景 | 冰冷质问:“今天这么重要的场合……” | | 10.75—12.38秒 | 硬切公公特写,盖碗僵在半空,双眼骤然睁大 | 新娘画外音:“怎么不叫正妻,叫了个妾?” | | 12.38—13.58秒 | 紫衣女人反应特写,睁眼怒视,眉头紧锁 | 无台词,恼羞成怒但强行维持体面 | | 13.58—15.13秒 | 对称大全景,四人僵持 | 音乐重音后戛然而止 |
17. 每一个镜头必须分析
至少分析:
时间
景别
焦段感
摄影机高度
摄影机角度
摄影机方向
构图
角色位置
前景
中景
背景
人物动作
手部动作
身体重心
人物视线
人物表情
人物停顿
台词
说话角色
语气
语速
重音
画外音
硬切
连续镜头
运镜
环境运动
动作音
环境音
音乐
剧情作用
18. 台词精准复刻规则
台词属于最高优先级资产。
必须尽可能逐字还原。
例如原片:
“现在叫妈太早了。叫阿姨。”
不得改成:
“现在还不能叫妈,你还是叫我阿姨吧。”
即使语义相同也不允许。
19. 禁止修改台词
除非用户明确要求改编,否则不得:
- 润色
- 同义替换
- 缩短
- 概括
- 添加台词
- 删除台词
- 调换顺序
- 修改人物说话内容
- 自行增加爽点对白
20. 台词时间锁
每句台词尽量记录:
说话角色:
开始时间:
结束时间:
完整台词:
语速:
语气:
停顿:
重音:
声音大小:
画内 / 画外:
例如:
CHAR_C 紫衣女人
1.33—4.38秒
“现在叫妈太早了。叫阿姨。”
语速:
偏慢。
语气:
居高临下、轻蔑。
停顿:
“太早了”后短暂停顿。
重音:
“阿姨”明显加重。
21. 画外音必须明确
如果人物继续说话,但画面已经切走:
必须写:
新娘画外音继续:
“怎么不叫正妻,叫了个妾?”
并明确:
当前画面中的公公不说话,嘴巴保持闭合。
避免错误对口型。
22. 口型排他规则
所有对话镜头都必须明确:
当前只有指定角色开口。
其他角色:
嘴巴闭合,
只进行相应表情和身体反应。
不得多人同时对口型。
23. 演员表演必须具体化
禁止只写:
她很生气。
必须转化成:
礼貌笑容迅速消失,
嘴唇收紧,
下颌绷紧,
眼神先短暂错愕,
随后变得锋利,
胸口轻微起伏,
说话时声音压低,
保持克制但明显有怒意。
24. 表演四层模型
每个关键表演至少考虑:
Face
- 眉毛
- 眼睛
- 鼻翼
- 嘴唇
- 下颌
Eyes
- 看向谁
- 是否转移视线
- 是否回避
- 是否直视
Body
- 身体重心
- 肩膀
- 手部
- 后退
- 前倾
- 转身
- 呼吸
Timing
- 微反应
- 停顿
- 情绪积累
- 爆发
- 恢复
25. 动作必须符合因果
所有动作按:
准备
→
发力
→
动作
→
接触
→
对方反应
→
结束状态
描述。
例如耳光:
新娘右肩先发力,
右手沿水平弧线快速挥出,
手掌掠过新郎左脸,
以短暂运动模糊和清脆掌声表现接触。
新郎在掌声出现后才偏头,
随后后退半步,
用左手捂住左脸,
瞳孔放大,
嘴巴微张。
26. 第三阶段:角色参考图提示词
角色参考图只负责:
锁定人物身份。
不是视频首帧。
每个重要角色单独生成。
例如:
REF_CHAR_A
REF_CHAR_B
REF_CHAR_C
REF_CHAR_D
27. 角色定妆图负责锁定
- 长相
- 年龄
- 五官
- 脸型
- 发型
- 发色
- 身材
- 妆容
- 服装
- 鞋
- 首饰
- 人物气质
不负责:
- 视频剧情动作
- 多人站位
- 视频构图
- 镜头切换
28. 角色图提示词标准
格式:
角色:
CHAR_A / 新娘
参考要求:
严格依据原视频中的人物视觉特征重新设计该角色定妆参考图。
人物身份:
...
年龄:
...
中国人物视觉特征:
...
脸型:
...
五官:
...
肤色:
...
发型:
...
发色:
...
身材:
...
妆容:
...
服装:
...
服装材质:
...
鞋:
...
首饰:
...
人物气质:
...
身体状态:
...
拍摄要求:
单人角色定妆参考图,
清晰展示人物完整身份特征,
人物面部无遮挡,
服装完整,
光线清楚,
背景简洁,
真实影视人物质感。
禁止:
不得出现其他角色,
不得改变服装,
不得增加无关配饰,
不得欧美化脸型,
不得夸张网红脸。
29. 第四阶段:空场景参考图
场景图只负责:
锁定环境与空间。
默认使用:
空场景参考图。
也就是尽量不出现主要人物。
30. 空场景图负责锁定
- 建筑
- 房间结构
- 门窗
- 桌椅
- 家具
- 道具
- 材质
- 时间
- 光线
- 光线方向
- 色温
- 主色调
- 空间大小
- 摄影机方向
31. 为什么默认使用空场景
因为带人物的场景图容易导致:
- 原人物被复制
- 多出人物
- 角色融合
- 模型锁死旧动作
- 新角色与原人物重叠
所以:
Scene Reference
=
Empty Scene Reference
优先保持纯净。
32. 场景图提示词标准
场景:
SCENE_A
根据参考视频精准重建该场景的空场景参考图。
建筑与时代:
...
空间结构:
...
墙面:
...
地面:
...
天花:
...
门窗:
...
桌椅:
...
家具:
...
道具:
...
前景:
...
中景:
...
背景:
...
时间:
...
主光:
...
光线方向:
...
色温:
...
主色调:
...
材质:
...
摄影机主要方向:
...
要求:
保持原视频中的空间比例、家具位置、门窗位置、
主要道具位置、光线方向和视觉风格。
默认不出现主要人物。
禁止:
不得重新设计空间,
不得改变桌椅布局,
不得改变门窗位置,
不得增加无关人物。
33. 第五阶段:视频生成段划分
必须严格区分:
逐秒拆解层
和:
视频生成层
逐秒拆解可以存在很多镜头。
视频生成不能机械地一个镜头生成一条视频。
34. 15秒以内视频:强制整段生成
如果原视频:
≤15秒
默认且强制:
整个原视频
=
一个视频生成任务
禁止:
拆成多个视频
→
分别生成
→
再拼接
35. 15秒以内可以包含多个镜头
例如:
15秒视频有8个镜头。
分析层:
Shot 01
Shot 02
Shot 03
Shot 04
Shot 05
Shot 06
Shot 07
Shot 08
生成层必须是:
CLIP_01
0—15秒
包含8个镜头
通过同一个视频 Prompt 内部的:
- 时间轴
- 硬切
- 景别切换
- 摄影机位置变化
来完成。
36. 15秒以内禁止拆分规则
禁止:
0—5秒
5—10秒
10—15秒
分别生成再合成。
因为容易造成:
- 人脸变化
- 发型变化
- 衣服变化
- 情绪断裂
- 台词断裂
- 场景漂移
- 道具漂移
- 光线变化
- 拼接感
- 人物状态重置
37. 15秒以内整体表演原则
15秒以内剧情视频应该被理解为:
一个完整表演单元。
尤其需要保护:
- 台词上下文
- 情绪积累
- 冲突升级
- 反应镜头
- 人物状态
- 角色空间关系
因此:
宁愿同一条视频中包含多个硬切镜头,也不要拆成多个生成视频。
38. 只有长视频才允许多段生成
如果:
原片 >15秒
才能进入:
MULTI_CLIP MODE
39. 长视频默认12—15秒一段
优先:
12秒
13秒
14秒
15秒
尽量保持:
每段约12—15秒。
例如45秒:
CLIP_01 0—15秒
CLIP_02 15—30秒
CLIP_03 30—45秒
40. 长视频不得机械每15秒切
分段必须优先考虑剧情自然节点:
- 一句完整台词说完
- 一个动作完成
- 一轮对话结束
- 一个情绪阶段结束
- 一个反转发生后
- 场景转换
- 人物离场
- 新事件开始
41. 禁止截断台词
绝对不能:
CLIP_01:
“今天这么重要的场合……”
CLIP_02:
“不叫你亲妈过来?”
如果原片是同一句连续对白:
必须尽可能放在同一个生成段。
42. 禁止截断关键动作
错误:
CLIP_01:
新娘抬手
CLIP_02:
巴掌打中新郎
正确:
抬手
→
挥手
→
接触
→
新郎反应
尽量保持在同一段。
43. 4—10秒短段只属于例外
长视频中,只有以下情况才允许使用:
4—10秒短生成段。
情况A:极关键高潮
例如:
- 扇耳光
- 爆炸
- 枪战
- 坠落
- 变身
- 巨物出现
- 复杂打斗
- 强特效
情况B:场景彻底变化
例如:
豪宅
→
医院
情况C:时间明显跳跃
例如:
白天
→
三年后
情况D:人物阵容巨大改变
例如:
2人场景
→
10人场景
情况E:模型稳定性要求
例如原本13秒同时包含:
- 复杂对话
- 高难动作
- 多人表演
- 大幅运镜
- 特效
确实无法稳定完成时才允许拆。
44. 分段决策顺序
必须使用:
第一判断:
原片≤15秒?
是:
一段完整生成
否:
优先12—15秒一段
只有特殊情况:
4—10秒
正确原则:
优先整段
→
优先长段
→
必要时才短段
45. 长视频连续性锁
所有长视频生成段建立:
STORY_CONTINUITY_LOCK
每段记录:
上一段结束的人物位置
人物朝向
人物表情
人物手中道具
人物受伤状态
服装状态
门窗状态
场景状态
最后一句台词
最后一个动作
下一段从哪个状态继续
46. 段与段必须连续
例如上一段结尾:
新郎左手捂着左脸,
身体后退半步,
震惊看向新娘。
下一段不能:
新郎双手自然垂下,
面无表情站立。
必须:
新郎继续保持左手捂脸状态,
身体仍然略微后退,
震惊情绪延续。
47. 第六阶段:整段生视频提示词
每个视频生成段必须包含完整时间轴。
基础结构:
视频基础设置
↓
角色参考锁
↓
场景参考锁
↓
角色空间位置
↓
允许出现的人
↓
禁止出现的人
↓
逐秒时间轴
↓
动作与演员表演
↓
摄影机
↓
硬切
↓
声音
↓
角色一致性
↓
场景一致性
↓
负向限制
48. 标准整段视频 Prompt 开头
例如:
生成一条15秒、9:16竖屏、24fps、高清写实的剧情短视频。
强参考提供的新娘、新郎、紫衣女人、公公四张角色定妆参考图,
以及已经确认的中式婚礼内堂空场景参考图。
四人的脸型、年龄、五官、发型、发色、身材、服装、鞋子、
首饰和妆容从第一帧到最后一帧完全固定,不得发生身份漂移。
严格继承场景参考图中的空间结构、门窗位置、桌椅位置、
道具、光线方向、空间大小、材质和整体色调。
公公固定坐画面左侧;
紫衣女人固定坐画面右侧;
新郎主要位于中央偏左;
新娘主要位于中央偏右。
除非原片动作要求角色移动,否则不得左右交换。
画面只允许原视频实际出现的四名角色。
新郎亲妈和“正妻”等只在对白中提到但原片没有出镜的人物,
绝不出现在画面。
按照以下真实原片时间轴完成多个镜头,
使用硬切完成镜头切换,
不是一镜到底。
49. 视频时间轴必须完整
例如:
0—1.33秒:
...
1.33—4.38秒:
...
4.38—5.55秒:
...
5.55—8.33秒:
...
8.33—10.75秒:
...
10.75—12.38秒:
...
12.38—13.58秒:
...
13.58—15秒:
...
50. 每段镜头描述格式
建议每段包含:
时间:
镜头:
焦段感:
景别:
构图:
角色位置:
动作:
表情:
台词:
语气:
摄影机:
声音:
结束状态:
51. 角色一致性专用规则
所有生视频 Prompt 必须增加:
【角色一致性】
所有角色从第一帧到最后一帧保持同一身份。
每个角色必须保持:
同一张脸、
同一年龄、
同一脸型、
同一五官、
同一发型、
同一发色、
同一身材、
同一服装、
同一鞋子、
同一首饰、
同一妆容。
硬切改变的只能是:
摄影机位置、
景别、
角度、
构图。
不得因为硬切而重新生成角色身份。
禁止:
换脸、
年龄变化、
发型变化、
服装变化、
服装互换、
饰品互换、
不同角色脸部融合、
角色复制。
52. 场景一致性专用规则
【场景一致性】
如果多个镜头发生在同一地点,
所有镜头必须继承同一个场景。
保持:
建筑结构、
房间大小、
门窗位置、
桌椅位置、
主要家具、
主要道具、
墙面、
地面、
光线方向、
时间、
色温、
整体色调。
硬切只改变摄影机,
不得重新设计场景。
禁止:
家具瞬移、
门窗改变、
桌椅互换、
空间大小随机改变、
光线方向突然变化。
53. 未出镜人物禁止生成
如果台词提到:
- 亲妈
- 正妻
- 前妻
- 父亲
- 姐姐
- 朋友
但原片没有出现:
必须加入:
这些角色只存在于对白信息中,
不进入画面,
不得生成新人物。
54. 声音设计
整段 Prompt 最后增加:
【声音设计】
对白:
严格按照原视频人物、顺序和时间完成。
环境音:
按照原场景还原。
动作音:
与动作真实同步。
音乐:
按照原视频情绪节点控制音量与节奏。
只有当前指定说话角色开口。
其他角色嘴巴闭合,
不得多人同时对口型。
画外音镜头中,
画面角色不得误说画外音台词。
55. 第七阶段:生成角色图和场景图
Gate 1 确认后:
生成顺序必须是:
角色图
↓
角色图一致性检查
↓
空场景图
↓
场景一致性检查
56. 先生成角色图
先完成:
REF_CHAR_A
REF_CHAR_B
REF_CHAR_C
REF_CHAR_D
...
角色图完成后检查:
身份
长相
中国人物视觉特征
年龄
发型
发色
身材
服装
首饰
人物之间是否容易区分
57. 再生成空场景图
角色确定后,再生成:
REF_SCENE_A
REF_SCENE_B
...
检查:
空间结构
门窗
桌椅
家具
道具
光线
色调
时代
装修风格
摄影机方向
58. MASTER REFERENCE SET
所有基础参考图生成完成后建立:
MASTER REFERENCE SET
CHAR_A = 新娘参考图
CHAR_B = 新郎参考图
CHAR_C = 紫衣女人参考图
CHAR_D = 公公参考图
SCENE_A = 婚礼内堂空场景图
这些资产后续全片复用。
59. 第八阶段:判断是否需要关键首帧
关键首帧:
不是必选项。
正确逻辑:
角色图
+
场景图
↓
判断视频模型能力与镜头复杂度
↓
MODE A / MODE B
60. MODE A:角色图 + 场景图直接生成视频
如果当前模型支持:
- 多图参考
- Character Reference
- Scene Reference
- Omni Reference
- 多主体参考
- 多图一致性控制
并且当前镜头不是特别复杂:
优先:
角色图
+
场景图
+
完整视频 Prompt
↓
直接生视频
这是默认优先模式。
61. MODE A 适用情况
优先不使用关键帧:
- 单人视频
- 双人简单对话
- 场景固定
- 人物站位容易描述
- 模型支持多图
- 15秒内存在大量硬切镜头
- 关键帧只能控制第一镜,对后面帮助有限
62. MODE B:关键帧增强
只有在以下情况才建议制作关键首帧:
- 多人复杂站位
- 首镜构图非常重要
- 左右关系是剧情关键
- 前后景遮挡复杂
- 起始动作复杂
- 模型直接使用角色图和场景图时经常站位错误
- 需要强制锁定第一镜构图
63. 关键帧必须后生成
关键帧必须使用:
已经生成并确认的角色图
+
已经生成并确认的场景图
作为强参考。
禁止:
在角色图和场景图生成之前制作关键帧。
64. 关键帧职责
三种资产职责必须严格区分:
角色定妆图
=
Identity Anchor
身份锚点
空场景图
=
Environment Anchor
环境锚点
关键首帧
=
Composition Anchor
构图锚点
65. 关键帧 Prompt 固定开头
必须加入:
强参考已经确认的所有对应角色定妆图和空场景参考图。
所有角色的长相、年龄、脸型、五官、发型、发色、
身材、服装、鞋子、首饰和妆容严格继承角色定妆图,
不得重新设计人物。
严格继承空场景参考图中的空间结构、门窗、
家具、桌椅、主要道具、材质、光线方向和整体色调。
只在这些已经锁定的基础资产上,
按照原视频对应时间点重新构建人物站位、动作和摄影机构图。
66. 关键帧不替代角色图与场景图
如果模型允许:
MODE B 生视频时应优先同时使用:
关键首帧
+
角色图
+
场景图
+
视频 Prompt
而不是只使用关键帧。
因为关键帧本身可能存在轻微身份误差。
67. 15秒以内使用关键帧仍禁止拆视频
即使使用 MODE B:
原片15秒
仍然必须:
一个15秒生成任务
不能因为制作了关键帧就变成:
3个5秒视频
68. 长视频关键帧规则
长视频如果确实需要关键帧:
最多:
每一个生成段
≈
一个主要关键首帧
不要:
每一个Shot
=
一张关键帧
避免资产爆炸和流程过度复杂。
69. 第九阶段:生视频
Gate 2 确认后开始生视频。
MODE A:
角色图
+
空场景图
+
整段视频 Prompt
MODE B:
关键首帧
+
角色图
+
空场景图
+
整段视频 Prompt
70. 视频生成必须按照原片顺序
长视频:
CLIP_01
↓
CLIP_02
↓
CLIP_03
生成。
后续 Clip 必须继承上一 Clip 状态。
71. 生成后复刻度检查
如果可以读取生成结果:
必须对照原片检查:
总时长
剧情
完整台词
台词顺序
台词人物
口型
人物关系
角色长相
年龄
发型
服装
首饰
场景
角色站位
道具
镜头顺序
镜头时长
动作
表演
情绪
声音
高潮
结尾
72. 复刻问题分类
问题可以分为:
DIALOGUE
CHARACTER
SCENE
POSITION
ACTION
ACTING
CAMERA
CONTINUITY
PHYSICS
MODEL_LIMIT
REFERENCE_IMAGE
PROMPT
73. 台词失败优先修复
如果出现:
- 漏台词
- 错台词
- 台词顺序错误
- 错角色说话
- 多人一起对口型
优先:
明确台词开始和结束时间
↓
强化说话角色
↓
强化其他角色闭嘴
↓
明确画外音
↓
降低无关动作复杂度
↓
重新生成当前视频段
不得为了方便而直接删除原台词。
74. 角色漂移修复
如果人物变化:
强化角色参考图
↓
减少无关参考素材
↓
强化 CHARACTER_LOCK
↓
减少复杂转身和遮挡
↓
降低无关动作
75. 场景漂移修复
强化空场景参考
↓
强化 SCENE_LOCK
↓
强化 SPATIAL_LOCK
↓
固定门窗
↓
固定家具
↓
明确“硬切只改变摄影机”
76. 动作失败修复
优先:
动作拆成明确步骤
↓
明确发力
↓
明确接触
↓
明确对方反应
↓
减少同时动作数量
长视频特殊复杂段允许缩短至4—10秒。
但:
15秒以内完整视频仍优先整段,不轻易拆分。
77. 表演不足修复
不要只添加:
dramatic
intense
emotional
应该增加:
- 眼神变化
- 嘴唇变化
- 下颌
- 眉毛
- 呼吸
- 停顿
- 身体重心
- 视线
- 情绪爆发时间
78. 工具不可用规则
如果当前环境没有生图工具:
完成:
- 全部分析
- 角色 Prompt
- 场景 Prompt
- 视频 Prompt
并停在 Gate 1。
不得假装已经生成。
如果有生图但没有视频工具:
完成参考图,并停在 Gate 2。
不得假装视频已经生成。
79. 用户只要求拆解
如果用户只要求:
拆解这个视频
则只执行:
剧情
+
人物关系
+
逐秒拆解
+
角色与场景资产分析
+
提示词
不主动生图。
80. 用户要求“一键复刻”
即使用户说:
直接一键生成
仍然必须遵守:
分析
↓
确认
↓
角色图和场景图
↓
确认
↓
视频
两个确认 Gate 不得跳过。
81. 最终固定输出顺序
分析完成以后必须按照以下顺序输出。
一、原片基础信息
总时长:
比例:
类型:
视觉风格:
场景数量:
角色数量:
二、完整剧情分析
起因:
冲突:
升级:
高潮:
反转:
结局:
爆点:
三、人物关系
列出所有角色 ID 与关系。
四、角色一致性锁
分别列出:
CHAR_A
CHAR_B
CHAR_C
...
五、场景与空间一致性锁
列出:
SCENE_A
POSITION_LOCK
PROP_LOCK
六、原片逐秒拆解
必须使用:
| 时间 | 镜头与动作 | 台词及表演 | |---|---|---|
完整覆盖原片。
七、角色参考图提示词
每个角色单独输出。
八、空场景参考图提示词
每个主要场景单独输出。
九、视频生成段规划
如果:
原片 ≤15秒
输出:
CLIP_01
0—原片结束
一次完整生成
禁止拆分
如果:
原片 >15秒
优先:
每段12—15秒
只有必要时:
4—10秒
十、完整整段生视频提示词
为每个 CLIP 输出完整可复制 Prompt。
十一、是否建议关键首帧
输出:
推荐模式:
MODE A / MODE B
原因:
...
注意:
关键帧此时只提供“是否需要”的判断。
真正关键帧必须在角色图和场景图生成完成后才能制作。
十二、第一次确认
停止并等待用户确认生图。
82. 最终项目结构
一个15秒以内视频,最简正确结构可以只有:
角色图若干
+
空场景图若干
+
1条完整15秒视频 Prompt
如果需要关键帧:
角色图若干
+
空场景图若干
+
1张关键首帧
+
1条完整15秒视频 Prompt
83. 最终核心逻辑
必须永久遵守:
先理解故事
↓
再理解人物关系
↓
再锁定角色
↓
再锁定场景
↓
再逐秒还原原片
↓
再制作角色图与场景图
↓
再决定是否需要关键帧
↓
最后生成视频
而不是:
看到镜头
↓
写一堆关键词
↓
每个镜头单独生成
↓
拼起来
84. 最终分段铁律
原片 ≤15秒
=
强制优先整段一次生成
=
禁止拆分后拼接
原片 >15秒
=
允许多段
=
优先12—15秒
只有关键、复杂、场景变化或模型确实无法稳定执行的内容
=
才允许4—10秒
牢记:
能一段完成,就不拆两段。
能15秒完成,就不用8秒。
能保持一句完整台词,就绝不截断。
能保持一次完整情绪爆发,就绝不从中间切开。
能保持一个完整故事单元,就绝不为了模型方便把它拆碎。
85. 最终复刻铁律
整个 Skill 中,最高优先级永远是:
完整剧情
+
完整台词
+
原片时长
+
人物关系
+
角色一致性
+
场景一致性
+
故事连续性
+
情绪连续性
不得以:
- 更电影感
- 更高级
- 更震撼
- 更好看
- 更适合AI
- 更容易生成
为理由擅自改变原视频核心内容。
最终目标:
让 AI 重新生成“原片本身”,而不是重新创作一条受原片启发的视频。
微信扫一扫