抖音关键词数据自动采集
围绕一个或多个关键词,自动形成可复核、可去重、可排序的作品样本库。
执行流程
- 确认关键词组、包含/排除词、时间范围、排序方式、目标条数、账号或赛道限制。
- 优先使用已配置的抖音搜索连接器或官方 API;其次使用用户已登录页面;再其次读取用户提供的导出文件。不得自动扩张到用户未授权的私密账号或数据集。
- 采集作品 ID、标题、作者、发布时间、链接、播放/点赞/评论/分享/收藏等可见字段,并记录采集时间和来源。
- 按作品 ID 去重;无 ID 时使用规范化链接。合并重复记录时保留最新采集值和首次发现时间。
- 计算有可靠分母的指标。播放量可用时计算互动率;播放量缺失时仅展示互动总量,不使用粉丝数或点赞数冒充播放量。
- 按用户指定规则筛选样本;缺少规则时同时给出互动总量、互动率、新鲜度和内容相关性四个视角,不强行合成单一“爆款分”。
- 输出作品表、Top 样本、内容结构模式、竞品差异和后续验证清单。
- 检查分页完整性、搜索时间、重复率、缺失率、异常值和链接可访问性。
输出合同
查询条件:关键词、排除词、时间范围、排序、目标条数和数据源。作品明细:作品 ID、标题、作者、发布时间、链接、原始互动指标和采集时间。排行视图:互动总量、互动率、新鲜度和相关性分列展示。爆款样本:入选理由、证据字段、可借鉴结构和不应复制的具体表达。竞品线索:重复出现的卖点、场景、开头、时长、评论反馈和内容空位。数据边界:登录范围、分页上限、字段缺失、搜索偏差和未覆盖内容。
质量门槛
- 保留原始标题和链接,不把搜索摘要当成完整作品文案。
- 每个排行都写明公式、分母、窗口和缺失值处理。
- 不下载或转载超出用户权限的内容,不复制第三方创作者的完整文案。
- 搜索结果是平台分发样本,不等同于全量数据;报告中必须说明。
- 采集失败时保留已完成页和游标,给出可续跑位置,不虚构总量。
字段与排序
需要字段映射、互动率公式和样本筛选规则时,读取 references/field-contract.md。
Scan to join WeChat group