音乐美学MV
用途
当用户需要创建、修改、审查或生成音乐视频提示词、情绪短片提示词时使用本 Skill,尤其是音乐、歌词、贴字、参考图、节奏、人物表演和镜头语言需要统一设计的任务。本 Skill 将第三方 MV prompt 规则适配为 Design 可执行流程:关键创意决策需要确认,锁定 prompt 写入画布文本节点,媒体生成交给对应 Design agent。
不要用于普通字幕烧录、普通视频剪辑、非音乐类产品广告,或没有 MV 结构需求的单张图片 / 单段视频简单任务。
Design 兼容规则
- 不假设可直接调用第三方工具、shell 脚本、浏览器插件或外部生成 API。
- 锁定 prompt 和修订版本必须写入 Design 画布文本节点。
- 角色卡、场景卡、文字卡、视频片段、BGM 和最终合成都交给 Design 图片、视频、音乐、剪辑 agent。
- 不硬编码输出路径,始终使用工具返回的 Design 文件路径。
- 用户说“跳过确认 / 直接做”时,只对本次运行生效,除非外层编排器已将其作为当前会话授权处理。
- 如果用户只要 prompt,交付 prompt 后停止;如果用户要完整 MV,在确认后继续生成和合成。
- 视频生成默认推荐 H3。只有用户明确指定其他模型、H3 不可用或硬性能力无法满足时才切换。
核心原则
- 先理解作品,再选择结构。模板是组织工具,不是必须填满的表格。
- 使用用户最新确认的创意意图。
- 无关字段直接省略,不填空占位。
- 不因为预设里有表演、文字、转场、运镜或角色行为,就机械添加到不适合的作品里。
- 屏幕文字是设计图层,不是普通字幕;除非用户明确要求普通字幕。
- 如果用户上传真实歌曲或 beat,它就是主音乐床,除非用户要求替换。
- 多镜头自然衔接原则(针对 >15s 视频):当视频时长超过模型单次生成上限(如 15 秒)时,必须采用“多镜头分镜拆解 + 首尾帧接续 + 鼓点硬切 + 全局主音轨对齐”的标准拼接工作流。所有分段镜头必须保持同一音乐 Groove、速度感、画幅、角色逻辑、视觉预设、光影美学和文字运动规则,确保人声、音乐、节奏、画风与场景自然无缝过渡。
- 当用户要完整音乐美学 MV 但没有提供歌词时,先生成并锁定原创歌词。最终 MV 必须同时参考人物卡、文字包装卡和场景卡生成。文字包装卡只控制文字包装样式、字体质感、图形设计、排版比例和动效语言。
STEP 1:前期锁定
写最终生产 prompt 前,先确认最小基础。用简洁选项给出推荐。
1.1 视频格式
提供固定选项:
| 使用场景 | 画幅 | 分辨率 | | :--- | ---: | ---: | | TikTok / Reels / Shorts 竖屏 | 9:16 | 1080×1920 | | YouTube / B站 横屏 | 16:9 | 1920×1080 | | 信息流方图 / Feed | 1:1 | 1080×1080 | | 投流竖屏高密度 | 9:16 | 720×1280 | | 电影感宽银幕 MV | 21:9 | 2560×1080 |
所选比例必须贯穿角色卡、场景卡、文字参考、shot prompt、视频片段和最终合成。
1.2 目标时长与多镜头拆解架构
写 prompt 或生成视频前,必须先确认目标 MV 时长。即使用户没有上传音乐或歌词,也不能静默使用模型默认时长来替代用户意图。
提供简洁时长选项卡:
- 10 秒测试版:单镜头/双镜头,最快验证人物、场景、文字和音频风格。
- 15 秒 hook 版:2~4 个短镜头组,更完整的副歌 / hook / performance 短句。
- 30 秒及以上完整 MV 版(多镜头拼接合成):由于模型存在 15 秒单次生成上限,系统将自动采用 “多分镜(Multi-Shot)拼接工作流”。先生成或锁定一首完整连续歌曲 / BGM,将 30 秒拆解为 4~8 个 2~5 秒的动态分镜头,通过卡拍(Beat-Sync)与首尾帧/场景连续性控制,拼接合成为无缝 MV。
- 自定义时长:用户输入目标时长;根据所选视频模型的单次生成上限(如 15 秒)规划多镜头分镜数量与拼接方案。
如果用户提供了上传音乐,确认的目标时长就是需要锁定的音乐窗口长度。
1.3 音乐窗口
如果上传或指定的音乐长于已确认目标时长,必须先锁定片段再写 prompt。
提供三种模式:
- 推荐窗口:assistant 判断最强副歌 / hook / 情绪转折,并请求确认。
- 用户时间戳:用户给出开始和结束秒数;检查时间落在音频内。
- 多变体:只用于投流钩子测试或多创意方向。
如果音乐短于目标时长,使用完整音频。除非用户明确要求,不拉伸、不补长。
1.3.0 歌词锁定与歌词先行补全
写最终视频 prompt 或生成视频前,必须先确定歌词归属:
- 如果用户提供了歌词,这份歌词就是锁定歌词。除非用户明确要求改词,否则不得再生成、添加、改写、扩写、翻译、转述或替换成其他歌词。
- 如果用户想要完整音乐美学 MV 但没有提供歌词,才生成与所选音乐风格、vocal 模式、目标时长、情绪温度和视觉预设匹配的短篇原创歌词,并将其锁定。
- 锁定歌词是人物说唱 / 演唱表演和可见文字包装内容的唯一源文本。
- 从锁定歌词拆出每个分镜头的
Rap line:、Vocal line:、Soft vocal line:或Spoken line:。 - 每个
Typography:字段也必须来自同一份锁定歌词。有人声表演时,文字必须逐字匹配正在表演的词。 - 在最终贴字 MV 中,人物必须根据锁定歌词说唱 / 演唱:可见嘴型、下颌动作、呼吸、面部重音、点头和手势重音都应跟随歌词 phrasing 和 rhythm。
1.3.1 大于 15 秒视频的多镜头拼接默认流程
对于 >15 秒的 MV(如 30 秒),必须以“全局多镜头分镜 Prompt 脚本”作为权威生成来源:
- 锁定完整 Master 音频:先锁定一首完整连续的歌曲/BGM轨(包含完整的 Vocal 与 Groove),作为整个拼接流程的唯一音频基准。
- 构建多分镜时间轴(Shotlist Timeline):将 30 秒拆解为 4~8 个短镜头(每个镜头 2~5 秒),精确映射到歌词时间戳与鼓点(Snare/808/Drop)上。
- 首尾帧与场景接续控制:
- 若镜头 A 与镜头 B 为同一场景的长镜头延续:将镜头 A 的最后一帧(Tail Frame)作为镜头 B 的起始首帧(Head Frame)输入模型生成。
- 若镜头 A 与镜头 B 为硬切换景:保持相同的人物卡/服装/光影美学 Prompt,并使用同向运镜或视觉元素匹配切(Match Cut)。
- 生成与剪辑组装:视频 agent 按 Shotlist 生成各短片段,剪辑 agent 在全局 Master 音轨上根据拍子(Beat Grid)进行裁切、调速(Speed Ramping)与拼接,确保人声口型、鼓点卡拍与画面过渡完全自然。
STEP 2:Creative Contract
最终 prompt 前先建立简洁创意合约:
- 音乐类型、器乐、速度感(BPM)、vocal 模式、情绪温度。
- 歌词来源(锁定歌词)。
- 目标时长与多镜头拆解结构(例如:30s 拆分为 6 个 Short Shots)。
- 参考图角色分工:人物卡、场景卡、文字包装卡。
- 运镜、景别、对焦、剪辑卡拍密度与转场衔接逻辑。
- 明确排除项(如:严禁淡入淡出、严禁油亮 AI 美颜脸、严禁单镜头硬撑导致变形)。
STEP 3:参考图分工与场景采样
每张参考图只分配一个窄任务:
- 文字参考卡:只控制文字包装样式、字体质感、图形设计、排版比例和动效语言。严禁出现人物或场景。
- 人物参考卡:只控制人物形象、脸部气质、发型、服装轮廓、角色比例、姿态和整体气场。
- 场景参考卡:只控制场景视觉风格、空间氛围、影像质感、背景层次和光影气质。
3.1 近景场景切换与多镜头采样规则
对于 Trap、Dark-pop、Cyber-grunge 等快节奏 MV,全片应在多个近景场景之间快速切换:
- 场景气质保持统一,但每个镜头的空间必须明显不同(局部背景、隧道、墙面、灯带、反光地面)。
- 场景切换必须由明确音乐冲击触发:bass hit、808 drop、snare、vocal 重音或文字砸屏。
- 镜头切换是 trap beat 上的“视觉采样”:硬切、跳切、扫描 glitch 硬切、闪切、动作匹配切。
STEP 4:预设语法(以 Dark-pop / Cyber-grunge & Trap 为例)
视觉与剪辑语言
- 写实高时装质感、胶片杂志质感(90年代末-00年代初独立杂志/复印纸/胶片扫描/zine拼贴)。
- 粗颗粒、轻微胶片抖动、半色调网点、印刷毛边、扫描错位。
- 剪辑绝对只使用硬切(Hard Cut),严禁淡入淡出、溶解或柔和转场。
- 画面与文字强响应鼓点:hi-hat roll(微震/跳帧)、snare(放大/硬切/肩膀下压)、808 bass hit(低频压屏/拉伸/错位)。
文字包装规则
- 文字是空间中的动态图形主体(不是普通字幕条),可以处于前景、中景、背景或被人物肩膀/手部遮挡。
- 文字绝不遮挡眼睛或主要面部表情;对嘴时避免遮挡嘴部。
- 有人声时,显示文字必须逐字匹配正在表演的歌词。每个镜头只出现一个主文字事件。
STEP 5:Prompt 结构模板
多镜头分镜脚本必须按镜头(Shot)进行模块化输出,每个 Shot 标注准确的时长与音频映射:
[Global Aesthetic & Character Lock]: (全局人物与美学锚点 Prompt)
Shot 1 (0.0s - 3.5s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: Bass-hit 上硬切至 Shot 2 / 同向甩镜
Shot 2 (3.5s - 7.0s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: ...
STEP 6:BGM 连续性与多镜头自然衔接系统
6.1 音频全局连续性
全片必须强绑定同一轨 Master Audio(完整歌曲/Beat)。在分段生成视频时,严禁使用独立、断裂的片段音轨。所有视频片段在剪辑合成阶段均对齐至 Master Audio 的对应时间戳(Timeline)。
6.2 多镜头自然衔接系统(Natural Stitching Protocol)
为保证 >15 秒视频拼接后的极其自然,必须在 Prompt 规划与后期合成中严格执行以下“五大衔接锁”:
人声与口型衔接锁(Vocal & Lip Continuity): 分镜切替点(Cut Point)必须落在歌词的句间停顿(Pause/Breath)或强鼓点(Snare/Drop)上。严禁在人物发出某个元音或唱词中途进行硬切,除非后一个镜头是极近特写且口型完全接续。
音乐与节奏衔接锁(Rhythm & Beat Matching): 剪辑点必须精准裁切在音乐的 1/4 或 1/8 拍(Beat Grid)上。利用画面动作的“加速/减速(Speed Ramping)”微调,使视频中人物的头点拍、手势或眨眼精准踩在鼓点上。
画面美学与色彩衔接锁(Aesthetic & Color Grading): 跨镜头生成必须携带相同的 Aesthetic Header Prompt(相同的胶片颗粒度、色调 LUT、光影方向)。最终合成时,全局叠加一层 35mm Film Grain Overlay 和统一调色 LUT,掩盖跨批次生成的微小色差。
空间与转场衔接锁(Transition & Motion Continuity): 长镜头延伸:使用上一镜头的末帧(Tail Frame)作为下一镜头的首帧(Head Frame)输入,Prompt 加上 continuation of action。镜头切换:采用动能延续转场(如 Shot 1 结尾向右快速 Pan,Shot 2 开头从左向右 Pan 入;或利用人物手势遮挡镜头完成 Match Cut)。
文字动态衔接锁(Typography Motion Stitching): 跨镜头的文字动效,前一镜头的文字在切替瞬间跟随 Bass Hit 执行“破碎/扫出/砸屏”,下一镜头的文字在重音上“砸入/展开”,形成视觉动能的连贯传递。
STEP 7:审查清单(Checklist)
交付前静默检查:
- [ ] 目标时长超过 15 秒时,是否已自动采用多镜头(Multi-Shot)拆解结构?
- [ ] 是否已锁定唯一的全局 Master Audio,且分镜切替点对齐到了音乐拍子上?
- [ ] 镜头切替是否避开了人声唱词中途,口型与呼吸是否自然?
- [ ] 相邻镜头之间是否有明确的转场衔接机制(首尾帧接续 / 同向运镜 / Match Cut / 鼓点硬切)?
- [ ] 剪辑风格是否严格保持“纯硬切”,绝无淡入淡出或柔和转场?
- [ ] 三张参考卡(人物/场景/文字)是否角色隔离,且未互相污染?
- [ ] 文字包装是否作为空间图层,且绝未遮挡眼睛和主要面部表情?
- [ ] 全局画质、颗粒感、色彩与光影是否保持高度一致?
STEP 8:画布交付
完整 MV Prompt 脚本锁定后,必须写入专用画布文本节点,命名为 Complete MV Prompt 或 完整MV Prompt。节点内容必须是完整的多分镜 Prompt 脚本与衔接说明,后续修改时更新该节点。
STEP 9:最终 MV 生成与合成流程
- Prompt 锁死与画布写入:确认完整的多镜头 Prompt 脚本(包含时间戳、歌词映射、转场逻辑)已写入画布。
- 分镜素材并行生成:视频 Agent 根据 Shotlist 逐个生成 2~5 秒的短片段。需要长镜头接续的片段,提取上一片段末帧作为首帧图生视频(I2V)。
- 多轨剪辑与自然缝合(Editing & Stitching):剪辑 Agent 导入全局 Master Audio 轨,将生成的各 Shot 视频按时间戳对齐上轨,在鼓点(Beat Grid)上进行精细剪辑与速度曲线微调(Speed Ramping),确保人声口型与画面动作完美卡拍。检查镜头接缝处,应用同向运镜或闪切遮瑕。
- 全局调色与质感统一(Finishing):全局叠加统一的 Movie LUT 与 35mm 胶片颗粒 Overlay,消除 AI 塑料感并锁定画风一致性。
- 输出交付:输出无缝衔接的完整 MV 视频文件。
Scan to join WeChat group