返回 Skill 列表
extension
分类: 内容与媒体无需 API Key

9:16口播短视频制作标准规范

给中文新手的一条真人口播成片包装 Skill:默认保留原声、生成严格同步字幕,并强制避免 UI 遮挡人物脸部、眼镜、嘴部、发际线和关键手势。优先使用 HyperFrames,必要时切换 Remotion,并在交付前检查成片音视频与可解码性。

person作者: Geass369hubModelScope

口播短视频安全包装

把用户提供的真人口播素材直接包装成可发布的中文短视频。目标不是堆特效,而是让字幕、信息卡和动效帮助理解,同时始终让人物保持清楚、自然、可看。

默认交付

  • 成片:1080x19209:16MP430fps
  • 音频:默认保留并封装原始口播音频,不重配音、不静音。
  • 字幕:默认开启;文字必须与当前时间的实际口播一致。
  • 画面:人物主讲优先;只在当前话题需要解释产品、数据、流程或对比时短暂使用前景信息卡。
  • 包装:每段 3--6 个有语义的轻量元素即可,不为“高级感”堆卡片、转场或素材。
  • 素材:没有 Logo、图片或品牌规范时,使用干净的文字、线条、图标和半透明 UI;不要强制生成图片。
  • 时间轴:不要求用户提供或审阅时间轴文档。内部可使用转写时间戳完成同步,但交付只给成片、工程与 QA 结果。

不可突破的规则

  1. 先分离当前视频,再设计包装。 不能把前一段的字幕、卡片或高亮残留到下一段。
  2. 先转写,后设计。 即使用户不需要字幕,也必须转写并确认人名、品牌、数字、单位和缩写;不确定的内容不得臆造。
  3. 人物优先。 小卡片、标签、字幕和浮层不得压住发际线、头发轮廓、眼镜、眼睛、鼻子、嘴部或关键手势。
  4. 字幕只对应当前口播。 每屏 1--2 行,宁可短句切分,也不要提前显示下句、滞后不消失或把多句挤成一团。
  5. 信息卡必须有语义。 卡片应对应当前正在讲的一个产品、数据、步骤、对比或结论;没有明确用途时不加。
  6. 保留原声。 不得用静音、黑屏、错误音轨或无声替换来掩盖渲染问题。
  7. 先验证再交付。 成片必须可解码,包含视频和音频流,并通过人物避让、字幕、残留层和首尾画面检查。

执行流程

1. 明确输入与默认值

至少需要一段真人口播视频。文案、Logo、品牌色、图片、平台要求和特别要强调的观点均为可选输入。

若用户没有指定,使用本 Skill 的默认交付。若素材并非中文、不是竖屏、没有人物或明确要求去除原声,先说明会改变哪些默认项,再继续制作。

2. 素材体检与转写

  • 检查时长、分辨率、帧率、画幅、编码、是否可变帧率、是否有音频、人物位置、脸部大小、手势和已有字幕。
  • 从原始音频生成带时间戳的转写;校正专有名词、数字、货币、百分比和单位。
  • 找到话题切换、数据出现、动作明显、人物移动和停顿的位置。这些是包装切换点,不需要产出给用户的时间轴表。

3. 先画人物安全区

为每个镜头记录脸部框和关键手势区域。先放置人物安全区,再放字幕和 UI,绝不能反过来。

默认从 安全区参考 的 1080x1920 起始值开始;素材人物靠边、低机位、多人、手势多或目标平台 UI 不同,必须重新校准。

4. 选择画面模式

默认使用 人物主讲模式:人物清晰可见,包装只是辅助。

仅在下列情况短暂使用 前景信息卡模式

  • 展示产品或页面;
  • 解释一项关键数据;
  • 对比两个选择;
  • 梳理一个流程或结论。

前景卡结束后应及时回到人物主讲模式。卡片不能只因为“看起来更精美”而出现。

5. 设计字幕和轻量包装

  • 字幕使用高对比文字与轻阴影或描边,不使用压迫人物的大黑底。
  • 顶部支持 UI 保持短小:主题、当前章节、关键数字或流程进度均可;一次只突出一个信息。
  • 卡片进出应平稳、可读、及时清除。切换话题时先退出旧层,再进入新层。
  • 动效以淡入、位移、缩放和进度变化为主;时长短、节奏贴近口播,不使用无意义的频繁闪烁。

6. 选择渲染路径

优先按当前可用环境选择,而不是为工具本身硬撑:

  1. HyperFrames:适合单条口播、HTML/CSS/GSAP 字幕、透明 UI、标题和快速预览。先运行环境检查、lint/inspect 与短片段烟雾渲染。
  2. Remotion:HyperFrames 不可用、烟雾渲染失败,或需要复杂字幕、批量复用、React 组件和逐帧稳定性时切换。
  3. 其他渲染路径:前两者都不可用时,说明原因、预计影响与可用方案后再切换;仍须遵守本 Skill 的人物安全、字幕、音频和 QA 规则。

短视频直接合成出现编码、可变帧率、关键帧或透明层异常时,先将素材转为稳定的 H.264/CFR 中间文件,再重新渲染。不得以删除原声、字幕或人物避让为代价换取“能导出”。

7. 成片 QA

逐段检查以下位置:开场后 0.2--0.5 秒、每个包装稳定段、每个包装退出后 0.2--0.5 秒,以及片尾。

  • 当前字幕、卡片和高亮是否准确对应正在说的话;
  • UI 是否压住脸部、眼镜、嘴部、发际线或关键手势;
  • 是否有黑屏、白闪、旧层残留、幽灵层、跳帧或错位;
  • 人物与 UI 是否仍有足够对比度和可读性;
  • 原声是否从头到尾存在、同步且无异常静音;
  • 输出是否为可解码 MP4,尺寸、帧率、时长和音视频流是否符合约定。

使用本包的检查脚本完成基础交付验证:

python scripts/verify_delivery.py "输出成片.mp4" --expect-width 1080 --expect-height 1920 --expect-fps 30 --decode

该脚本只验证技术交付,不替代人工的人物遮挡和字幕语义检查。

8. 交付

交付以下内容:

  • 最终 MP4 成片;
  • 可继续编辑的项目或源文件;
  • 简短 QA 说明:渲染路径、原声状态、字幕策略、人物安全检查、技术检查结果及已知限制。

不要只交付工程、预览链接或未检查的渲染缓存。

常见请求的处理方式

| 用户请求 | 执行方式 | | --- | --- | | “给这段口播做精美包装” | 默认保留原声和中文字幕,以人物主讲为主,顶部放少量话题和数据 UI。 | | “字幕不要挡住人” | 先标记脸部和手势,再把字幕放入底部安全区;若人物处于底部,改用侧边或动态避让。 | | “HyperFrames 用不了” | 给出失败原因,切换 Remotion;仍不可用时说明其他可用渲染方案后再继续。 | | “做得高级一点” | 提升排版、层级、动效节奏和数据表达,不增加与当前口播无关的装饰。 | | “不要字幕” | 仍完成转写用于包装同步,但不输出字幕层;其余人物安全和 QA 保持。 |

最终回复模板

完成后用简短中文汇报:

已完成:{成片路径}
规格:{分辨率} / {帧率} / {时长}
渲染:{HyperFrames | Remotion | 其他}
音频:原声已保留
字幕:{逐句中文字幕 | 未显示,已用转写同步包装}
QA:已检查人物避让、字幕同步、包装退出和音视频可解码性
限制:{无;或具体说明}