← Back to skills
extension
Category: Content & MediaAPI key requirement unconfirmed

小红书对标采集

|

personAuthor: sunny31221hubOpenAPI

小红书对标内容采集

Overview

把链接文档中的小红书笔记批量采集入库:每条笔记一个文件夹,完整保存原文信息与图片;视频笔记转录脚本;重复链接跳过;入库后在链接文档回写标记。

安装方法

  1. 先问使用者用的是什么 AI 工具(如 Claude Code、Codex、Cursor),回答记作 X

  2. 只安装给 X,不安装或链接其他任何工具:

    npx -y --registry=https://registry.npmmirror.com skills add https://modelscope.cn/skills/sunny31221/xiaohongshu-collect -a X -y
    

    (--registry 为 npmmirror 镜像,保证国内不翻墙也能装;-a X 表示只装给 X 这一个工具) X 不在上述命令支持范围时,按该工具自身的技能机制安装,装完确认 X 能识别本技能即可

  3. 装完后询问是否现在使用本技能

When to Use

  • 用户要求把 02_规律研究/对标内容采集/对标采集内容链接.md 中的链接批量入库
  • 用户说「采集对标内容」「小红书入库」「保存小红书素材」
  • 用户提供一条或多条 xiaohongshu.com 链接要求完整采集(信息+图片+评论+脚本)
  • 用户说「提取图片文字」「图片OCR」「小红书图片文案」「提取笔记图片内容」「提取文案」,或给一条小红书链接要求提取完整内容(标题/正文/标签/图片文字/互动数据/评论)→ 单条模式

When NOT to Use

  • 只要笔记正文文字、不下载图片不做 OCR → 直接用 opencli xiaohongshu note
  • 视频号、公众号等其他平台内容(本 skill 仅处理小红书)

目录与命名规范

  • 保存根目录:AI第二大脑/02_规律研究/对标内容采集/小红书/
  • 每条笔记一个文件夹,命名:编号_笔记标题_笔记ID(编号三位补零,从已有最大编号 +1 递增)
  • 文件夹内固定编号(从 01 排到 05,没有跳号):
    • 01_原始素材/:01-封面图/ + 02-正文图片/
    • 02_笔记信息.md(用 assets/笔记信息模板.md)
    • 03_图片文案原文.md(图片笔记才有)
    • 04_文案结构化梳理.md(图文型与视频型都有)
    • 05_视频脚本.md(视频笔记才有)
  • 标题中的 / \ : * ? " < > | 等非法字符只做必要替换,不改标题原文

工作流

第一步:预处理

  1. 读取 02_规律研究/对标内容采集/对标采集内容链接.md,逐行解析,取每条行的完整链接(保留 ?xsec_token= 及之后全部参数,不能截断);笔记 ID(/explore/ 后第一段,24 位十六进制)单独取出来,只用于去重和文件夹命名。
  2. 非笔记链接(如 user/profile 主页)不自动入库,单独列出报告;跳过空行和重复链接。
  3. 检查登录态:opencli xiaohongshu whoami;未登录则提示用户执行 opencli xiaohongshu login。
  4. 查看 对标内容采集/小红书/ 下已有文件夹的最大编号,新编号从最大编号 +1 开始。

第二步:逐条入库

对每个笔记 ID:

  1. 去重:检查 对标内容采集/小红书/ 下是否已存在含该 ID 的文件夹;已存在则跳过并记录。

  2. 间隔防反爬:每条笔记之间至少间隔 5 秒(sleep 5)再开始下一条的抓取;若返回风控/频率限制/验证码类错误,间隔提高到 10-15 秒后重试该条。单条笔记内的 note/comments/download 三路抓取可以并行,但条与条之间必须间隔。

  3. 并行抓取(临时目录按 note-id 组织):

    • opencli xiaohongshu note "<完整链接>" -f json → 标题、作者、正文、标签、互动数据
    • opencli xiaohongshu comments "<完整链接>" -f json → 评论
    • opencli xiaohongshu download "<完整链接>" --output <临时目录> -f json → 图片 / 视频
  4. 判断类型:

    • 下载结果含视频 → 用 mlx_whisper(medium 模型)转录,然后四步处理,保存 05_视频脚本.md: ① 转录原稿:转写结果原样保留(注明转录时间与模型) ② 语义修正错别字:根据上下文语义,把语音误转词修正为正确用词(如「负力工程」→「复利工程」、「Podex」→「Codex」)。只修明显错别字和同音误转,不润色、不改口语表达,修正时尽量保守,拿不准的保留原样并在文末「修正说明」里列出 ③ 结构化整理:按内容结构分段,每一段加一个小标题,小标题下放脚本原文——最大化还原视频脚本原文,不修改脚本内容,不用提炼要点代替原文(结构示例:开场钩子 → 背景介绍 → 第一步… → 观点收尾) 最终文件结构:转录说明(时间/模型/修正说明)→ 分段小标题 + 原文 ④ 再出一份 04_文案结构化梳理.md(与文章型笔记同一套格式):中心思想 + 核心论点清单 + 逐段梳理(每段小标题 + 一句话总结)+ 结构规律提炼。原文由 05 承担,04 只做概括与归类,不改写、不新增原文没有的东西
    • 图片含大量文字(文章型笔记:封面常见「全文N字」标记,或图片 ≥3 张)→ 对每张图片调用 mcp-vision ocr_extract(提示词:「提取图片中的所有文字,原文照抄,不要总结、不要修改、不要遗漏。保持原始换行和格式。」),生成两份文件:
      • 03_图片文案原文.md:OCR 文字按图片顺序合并,原文照抄,仅合并技术性断行
      • 04_文案结构化梳理.md:中心思想、核心论点清单 + 逐段梳理——每段保留原小标题 + 一句话总结(总结须保留原文的具体论据、数据与比喻,不删减关键信息,不整段照抄原文);完整原文由 03 承担;最后附结构规律提炼
    • 正文为空(纯图笔记)→ 同样 OCR,合并为「图片文字」部分
  5. 建文件夹——跑脚本,不让 AI 数编号:

    python3 "<本技能目录>/scripts/create_note_folder.py" \
      --id <笔记ID> --title "<笔记标题>" --type 图文|视频 \
      --author "<作者>" --published <YYYY-MM-DD> --url "<完整链接>" \
      --likes <N> --collects <N> --comments <N>
    

    脚本负责:算编号(目标目录已有最大编号 +1)、按笔记 ID 去重(已存在就返回原文件夹、不新建)、建出 01_原始素材/01-封面图/ + 02-正文图片/(视频笔记另有 02-视频源/)、写好 02_笔记信息.md 的外壳。返回 JSON,里面有文件夹绝对路径。

    拿到路径后,AI 把采集到的内容填进 02_笔记信息.md:

    • 完整保存全部字段:编号、笔记 ID、原文链接、标题、作者、发布时间、正文、标签、互动数据(点赞/收藏/评论)、评论列表、来源平台、入库时间
    • 不概括、不改写、不分析,原文照抄
    • 图片按原始顺序重命名 01.jpg、02.jpg…,放进 01_原始素材/02-正文图片/(见下方「媒体怎么放」)
    • 末尾「笔记图片」部分依次嵌入本地图片引用(指 01_原始素材/02-正文图片/01.jpg…)
    • 视频笔记追加「视频脚本」引用;图片笔记追加「图片文案」引用(03/04 号文档)
  6. 全部处理完后,在链接文档中给已入库链接所在行末尾追加「(已入库 ✓ YYYY-MM-DD)」标记,不删除、不修改链接本身。

媒体怎么放

媒体统一收进 01_原始素材/,封面单独一份——封面图以后要单独用来做「小红书封面规律提取」,所以即使和正文第一张图重复也复制一份:

图片笔记:

01_原始素材/
├── 01-封面图/
│   └── 01.jpg            ← 笔记第一张图的副本
└── 02-正文图片/
    ├── 01.jpg
    ├── 02.jpg
    └── …

视频笔记:

01_原始素材/
├── 01-封面图/
│   └── 01.jpg            ← 笔记封面图的副本
└── 02-正文图片/
    └── 01.jpg 02.jpg …   ← 笔记里的配图

视频笔记的原片不留在素材文件夹里:下载到临时目录 → 转写 → 删掉临时文件。素材留下的是转写稿和封面,不是原片。

  • 封面 = 笔记的第一张图(或视频封面),复制进 01-封面图/,正文图片保留原样不动
  • 图片命名按原始顺序,两位起(01.jpg、10.jpg)
  • 图片没下载成功时,01_原始素材/ 建空夹,不伪造封面

第三步:入库后检查

全部处理完后,按 references/入库检查清单.md 执行检查,更新 02_规律研究/对标内容采集/_入库检查报告.md(有效内容总数、文件路径、疑似重复、缺字段、图片问题、是否达 10 条)。

第四步:汇报

  • 新增入库条数(列出文件夹位置)
  • 跳过重复条数、失败条数及原因
  • 图片下载成功 / 失败数量
  • 正文为空的条数(哪些已用 OCR 补充)
  • 视频转录条数及脚本位置
  • 用户主页链接列表(未处理)
  • 当前 对标内容采集/ 已入库总数

Common Mistakes

  • 把 user/profile 主页链接当笔记处理 → 主页不是单条内容,跳过并报告
  • 文章型笔记不 OCR → 小红书大量「文字长图」笔记,正文只是引流文案,内容全在图片里;图片 ≥3 张或封面含「全文N字」必须 OCR,且保存原文+结构化梳理两份文件
  • 图片改名后破坏顺序 → 先按 download 返回的原始顺序排序,再重命名;注意 download 的文件名顺序可能 ≠ 页面展示顺序——文章型笔记 OCR 时检查图片内页码(常见「01/13」角标),若有页码标记必须按页码重排图片文件和原文顺序
  • 转录视频前未确认音频时长 → 长视频转录前先检查时长,向用户确认是否转录
  • 转写错别字不修正 / 把原文提炼成要点 → 转写后必须按上下文语义修正明显误转词(保守修正,拿不准保留原样并注明);结构化分段用小标题+原文,最大化还原原文,不提炼、不压缩、不概括
  • 修改链接文档时误删链接 → 只追加标记,不改动链接本身
  • 编号重复 → 编号基于已有文件夹实际最大编号计算,不要假设从 001 开始
  • 批量采集无间隔 → 条与条之间必须 sleep 5,遇风控错误(频率限制/验证码)间隔提高到 10-15 秒并重试,不要并发多条笔记

Resources