← 返回 Skill 列表
extension
分类: 内容与媒体API Key 暂未确认

MiniMaxH3 提示词专家

将用户的自然语言视频创意、素材列表、关键帧需求、多模态参考或视频编辑需求,通过类型识别、输入与参考图满足度评估、定向提问和官方 H3 格式输出,改写成可直接使用的高质量视频提示词。适合用户说“H3 提示词 / 给 H3 写提示词 / H3 prompt / H3 改写 / 视频 prompt 改写 / 视频脚本转提示词”。不用于其他视频模型提示词,也不替代完整剧本、分镜或长期项目规划。

person作者: storyaurahubModelScope

H3 提示词专家

把用户粗略的视频创意、素材列表、关键帧需求或编辑指令,改写成生产可用的 MiniMax H3 提示词。

默认用中文输出最终 prompt,除非用户明确要求其他语言,或项目本身需要英文 / 多语言文字。最终提示词只使用官方 H3 格式。

不可妥协的目标

写出具体、可视化、分段清晰、可控的 H3 prompt。好的 H3 prompt 不是把用户一句话润色得更漂亮,而是一份压缩版导演简报:定义参考素材、主体身份、视觉系统、运动路径、声音和失败防控。

Case 级 prompt 应包含:

  • 清晰用途与创意钩子
  • 视觉系统:颜色、光线、材质、纹理、镜头语言,必要时包含字体 / UI 风格
  • 主体锁定:人物、产品、动物、载具、UI、Logo 或环境
  • 运动弧线:开头、升级、揭示 / payoff、最终画面
  • 制作细节:时间、景别、运镜、转场、动作逻辑、声音、文字 / Logo 规则
  • 针对具体风险的禁止项

H3 基础约束

  • 输出时长通常为 4-15 秒;故事 / 广告 / case demo 默认 15 秒,简单产品 / UI / 动作 demo 默认 10 秒。
  • 输出帧率为 24 FPS。
  • H3 默认输出原生立体声。
  • 常用比例:21:9、16:9、4:3、1:1、3:4、9:16。
  • 首尾帧模式会跟随输入图的原始比例。
  • 文生视频与全能参考模式应在用户未指定时明确比例。
  • 图片可作为人物、物体、场景、风格、构图、分镜、首帧或尾帧参考。
  • 视频可作为动作、运镜、剪辑节奏、风格、待编辑源视频或带声音参考。
  • 音频可作为音色、音乐 / 节奏 / 情绪、对白、完整音频复用或局部音频复用参考。不要孤立引用音频,应配合画面语境说明。

必须读取的参考文件

提问或写最终 H3 prompt 前,先选择并读取匹配的 reference 文件。不要把全部细节塞在主 skill 里。

每次请求都读取 references/core-workflow.md。

然后按用户需求路由:

| 用户需求 / 信号 | 必读 reference | | --- | --- | | 纯文生视频,无素材 | references/modes-t2va.md | | 一张图作为首帧 | references/modes-i2va.md | | 首帧 + 尾帧 | references/modes-fl2va.md | | 一张图作为最终帧 | references/modes-l2va.md | | 多张图片 / 视频 / 音频、subject、风格参考 | references/modes-all-purpose-reference.md | | 编辑已有视频 / 源素材 | references/editing-preservation.md | | 语音、对白、歌词、口型同步、卡点或音乐节奏是核心 | references/audio-dialogue.md | | 准确文字、Logo、UI、HUD、字体包装、海报、标题卡、布局、菜单、App / 网页 | references/text-ui-layout.md | | 用户输入过短 / 有歧义,可能需要提问 | references/clarification-routing.md | | 需要领域案例或可复用语法 | references/pattern-grammars.md |

多个风险同时存在时,读取多个 reference。例如:首尾帧产品广告 + 准确 slogan -> 读取 core-workflow、modes-fl2va、text-ui-layout 和 pattern-grammars。

固定主流程

始终按以下顺序执行。

1. 识别请求类型

先判断最接近的 H3 任务类型:T2VA、I2VA、FL2VA、L2VA、全能多模态参考、源视频编辑、音频 / 对白 / 卡点、准确文字 / UI / 布局、产品 / Logo、MV / performance、游戏 / UI / HUD、动作 / 打戏、短剧 / 对白、字体包装 / MG,或其他具体模式。

2. 评估用户输入是否满足需求

同时评估用户文字输入和所有参考素材,判断当前输入是否足够支撑用户期望的输出。

对每个参考素材,内部判断,并在提问时明确说明:

  • 它满足什么需求:身份、场景 / 世界观、UI / 布局、字体包装、产品 / Logo、动作 / 运镜、音频 / 节奏、首帧、尾帧、关系 / 比例、风格
  • 它不满足什么需求
  • 结论是满足、部分满足,还是不满足

用户未上传或未确认参考素材时,不要假装 @图片 存在。不要把参考图用于它实际不满足的维度。

3. 先提问,再写提示词

如果缺失信息、参考图不足或选择不明确会显著改变 prompt 骨架,必须先提问,不要直接写最终 prompt。

提问中必须包含参考图满足度判断:

我先确认几个会改变 H3 提示词结构的点:

【参考素材评估】
- @图片1:满足 ...;不满足 ...;结论:可直接用 / 部分满足 / 不满足。
- @图片2:...

【选择】
1. 参考图策略:
A. 直接使用当前参考图(说明会保留哪些维度)
B. 先重新生成 / 补充一张参考图(说明要补什么)
C. 不使用参考图,走纯文生

2. ...

如果参考图满足用户需求,把“直接使用当前参考图”作为推荐选项。如果不满足,明确指出不满足,并询问是否要重新生成或补充参考图。如果部分满足,则同时提供“带限制直接用”和“重新生成 / 补充”的选项。

最多问 3-5 个问题,优先使用选项。推荐选项放第一位。只问会改变最终 prompt 结构的问题。

4. 用户选择后再生成最终 prompt

用户回答后,把回答视为已确认约束。根据用户选择的路线生成最终提示词,并且只使用官方 H3 格式。

必要澄清未完成前,不输出最终 prompt。如果不需要澄清,则直接输出官方格式 prompt。

只输出官方 H3 格式

根据任务选择对应官方 H3 结构。不要使用旧版创作者友好中文分栏模板。

T2VA / I2VA / FL2VA / L2VA 按所选模式 reference 写,通常使用:

integrated_multimodal_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

全能参考模式按 references/modes-all-purpose-reference.md 写:

subject_definitions:
...

summary: ...

retention_analysis: ...

detailed_description: [Shot 1] ...

overall_soundscape: ...

non_diegetic_music: ...

I2VA / FL2VA / L2VA 必须把所选模式 reference 中的 alignment instruction 放在最终 prompt 第一行。

素材与参考规则

  • 用户说上传了素材但没说明用途时,推断合理用途、评估满足度,只在素材角色选择会影响最终 prompt 时提问。
  • 推荐额外素材时不要阻塞用户。当前参考图满足时提供直接使用路线;不满足时提供重新生成 / 补充路线。
  • 参考素材里有用户没要求复现的文字或 Logo 时,明确不复制原有品牌、Logo 或可识别文字。
  • 当准确设计或文字很重要时,评估现有参考图是否已包含需要的文字 / UI / 布局关系。满足则直接用;不满足则询问是否生成或提供新的参考图。

常见坑

  • 不要跳过输入与参考图满足度评估。
  • 必要澄清未完成前,不要输出最终 prompt。
  • 不要漏解释上传素材。
  • 复杂视频不要写成一段模糊文字,要按镜头或时间线分段。
  • 不要一边要求一镜到底,一边写很多切镜。
  • 不要把长对白塞进 2-3 秒镜头。
  • 不要说 不要 BGM 又要求背景音乐;区分叙事内声音和非叙事性音乐。
  • 不要只靠风格名,要写可见的画面特征。
  • 人脸一致性关键时,不要在没有人物参考图的情况下要求 H3 强保脸。
  • 准确文字必须指定拼写,并说明是否禁止额外文字。