返回 Skill 列表
extension
分类: 数据与分析无需 API Key

抖音号数据一键导出

抖音作品数据自动抓取。按时间筛选作品列表 → 批量抓取每部作品的播放/互动/完播/流量数据(14项指标)→ 下载封面 → 输出CSV报表。适合创作者做作品数据复盘与运营分析。

person作者: user_3f399cbfhubcommunity

抖音视频数据一键导出

运行环境

  • 需要 Node.js >= 20(WorkBuddy 内置 Node 22 满足;系统 Node 亦可)
  • 首次安装(推荐一键):"$NODE" "$SKILL/scripts/install.js" → 自动检测并安装 playwright 包 + Chromium 浏览器(国内镜像,自动校验)
  • 手动安装(等价):cd <skill目录> && npm install playwright && npx playwright install chromium;Chromium 缺失时脚本输出中文指引
  • profile 与产物默认在当前工作目录(cwd);--profile / --out 可覆盖
  • 首次使用自动打开浏览器扫码(LOGIN_REQUIRED),登录态存 cwd/pw-profile 复用
  • 同 profile 同时仅允许一个浏览器进程;非法参数在启动浏览器前校验并退出,不残留进程
# 统一运行环境(WorkBuddy 内置 Node,无需安装;<你的用户名> 替换为实际 Windows 用户名)
NODE="C:\Users\<你的用户名>\.workbuddy\binaries\node\versions\22.22.2\node.exe"
SKILL="C:\Users\<你的用户名>\.workbuddy\skills\douyin-creator-data__skillhub"

流程(仅一键模式)

单浏览器进程跑完全流程:筛选+列表+抓取+封面+CSV 一条命令完成,只开关一次浏览器、扫码一次。

  1. 选时间:AskUserQuestion 选 1(自定义需追问起止日期) | 选项 | 参数 | |------|------| | 当天 | --range=today | | 前1周 | --range=1w | | 前1个月 | --range=1m | | 前2个月 | --range=2m | | 自定义日期范围 | --range=custom --from=YYYY-MM-DD --to=YYYY-MM-DD(自动校验合法性,--from 不得晚于 --to) |
  2. 一键执行:"$NODE" "$SKILL/scripts/all.js" --range=1m → 筛选+加载全部作品 → 分批并发抓详情(每批自动钳制 1~5,失败自动重试 1 次,批次间默认 3s 间隔缓解风控,可用 --interval 调整)→ 封面并发下载 → 输出 CSV
  3. 交付:present_files 展示 works_final.csv 与封面

可选参数

| 参数 | 说明 | 默认 | |------|------|------| | --batch=N | 每批并发详情页数,钳制到 [1,5] | 3 | | --interval=N | 批次间间隔秒数,钳制到 [1,30];风控严调大、作品多调小 | 3 | | --headless | 静默运行(不弹浏览器窗口);若未登录自动降级为有头模式提示扫码 | 有头模式 | | --profile=路径 | 登录态存放目录(同 profile 同时仅一个浏览器进程) | cwd/pw-profile | | --out=路径 | 产物输出目录 | cwd |

产物(cwd/)

| 文件 | 说明 | |------|------| | works_final.csv | 最终报表(19列):封面/标题/发布日期/视频时长/播放量/点赞量/评论量/分享量/收藏量/完播率/2s跳出率/涨粉量/粉丝播放占比/平均播放时长(纯数字,不含单位)/5s完播率/流量来源(仅第1个来源名,不含占比)/搜索关键词/标题校验(一致/不一致/未校验)/抓取状态(正常/错误信息) | | covers/ | 封面图(mid命名;扩展名按响应 content-type 判定,可能为 webp/png/jpg) |

实现备注(调试)

  • 详情页 URL:/creator-micro/work-management/work-detail/{mid}?enter_from=content
  • 列表滚动容器 [class*="list-scroll"];卡片 [class*="video-card-v2"]
  • 搜索关键词为跨行 CSV 字段,须用支持引号内换行的解析器
  • 共享逻辑集中在 scripts/lib.js(依赖检查/日历交互/指标提取/CSV/封面下载),all.js 单入口复用
  • 抓取稳健性:详情页数据用轮询提取(每 800ms,上限 25s)等待关键字段齐全,替代固定等待;提取后校验关键字段(总览:播放量/完播率/2s跳出率/粉丝播放占比;流量:平均播放时长/5s完播率/流量来源1),缺失记 DATA_INCOMPLETE: 缺 xx 并重试,不静默产出残缺行(慢网络下不误判「正常」)
  • 视频时长提取先剔除「发布时间」文本,避免把时分误当 mm:ss 时长;详情页标题尽力提取并与列表标题比对,一致记「一致」、不一致记「不一致」(防 mid 错位无声错乱)、无法比对记「未校验」;成功行「抓取状态」记「正常」
  • 标题类名实测(2026-08-08):详情页 info-title-text-QsVcuc;列表页 info-title-text-Zob9RV info-title-small-desc-_Odsxj;均以 [class*="info-title-text"] 前缀匹配(CSS Module hash 后缀会变,改版失效时按此重新诊断)
  • 已知脆弱点(2026-08-08,当前页面格式下验证正确,抖音改版时优先排查):
    • fmtKeywords 按「每 3 行一组取中间」解析搜索关键词,3 为按当前页面反推的魔法数字;若改版为 2 行/4 行一组会漏词或抓入占比
    • installMidCollector 接口 URL 正则 /creator|content|manage|aweme|item/i 较宽,可能混入带 mid 的无关接口,靠「标题校验」列兜底发现错位
  • Chromium 在 %LOCALAPPDATA%\ms-playwright\chromium-<rev>,PLAYWRIGHT_BROWSERS_PATH 可改