返回 Skill 列表
extension
分类: 数据与分析无需 API Key

抖音内容提取

从抖音视频中提取语音转文字(ASR)和画面文字(OCR),按指定行业(如花生类、美妆、3C)筛选内容,并生成总结性结论。适用于抖音竞品分析、行业内容挖掘、带货选题研究、视频文案提取。当用户需要从抖音作品里挖内容、把视频变成可分析的文本、或按行业批量归纳抖音视频观点时使用。触发词:抖音内容提取、视频转文字、抖音作品分析、行业视频挖掘、提取抖音文案、花生类视频分析。

person作者: user_6cd476e6hubcommunity

抖音内容挖掘 (Douyin Content Miner)

把一条抖音视频变成「可分析的文本 + 行业总结结论」。一键完成:获取视频 → 语音转文字 → 画面文字 OCR → 按行业筛选 → 生成总结结论。

适用场景

  • 按行业(花生 / 美妆 / 3C / 餐饮 …)批量挖掘抖音爆款内容,提炼选题与卖点
  • 竞品 / 达人视频文案提取与观点归纳
  • 把直播切片、口播视频转成结构化文本,再做二次创作

环境依赖(首次运行需安装)

系统工具:

  • ffmpeg(音视频处理)
  • yt-dlp(抖音下载,可选;也可直接传本地视频路径,更稳定)

Python 包(装到隔离环境):

pip install openai-whisper paddleocr openai

whisper / paddleocr 首次运行会下载模型(数百 MB ~ 1GB),请耐心等待;生产环境可改为调用云端 ASR / OCR API 以提速降本。

使用方法

让 Agent 执行:

python scripts/extract.py --input <抖音链接或本地视频路径> --industry 花生 --output result.md

参数说明:

  • --input:抖音视频 URL,或本地 .mp4 路径(推荐本地路径,最稳定)
  • --industry:行业关键词,用于筛选相关片段(如 花生
  • --model:whisper 模型大小 tiny/base/small/medium/large(默认 base
  • --no-ocr:跳过画面文字识别
  • --api-key / --api-base / --llm-model:用于生成「总结结论」的 OpenAI 兼容大模型(留空则只输出提取文本,由 Agent 总结)

输出

生成 Markdown 报告:行业相关片段 + 总结性结论 + 语音全文 + 画面文字。

注意事项

  • 抖音反爬频繁变动,URL 下载可能失效;最稳妥方式是手动保存视频后传本地路径。
  • 自动总结依赖大模型,未配置时 Agent 会基于提取文本自行总结。
  • 仅用于合规的内容分析与研究,遵守平台规则与版权要求。