小红书对标内容采集
Overview
把链接文档中的小红书笔记批量采集入库:每条笔记一个文件夹,完整保存原文信息与图片;视频笔记转录脚本;重复链接跳过;入库后在链接文档回写标记。
安装方法
-
先问使用者用的是什么 AI 工具(如 Claude Code、Codex、Cursor),回答记作 X
-
只安装给 X,不安装或链接其他任何工具:
npx -y --registry=https://registry.npmmirror.com skills add https://modelscope.cn/skills/sunny31221/xiaohongshu-collect -a X -y(
--registry为 npmmirror 镜像,保证国内不翻墙也能装;-a X表示只装给 X 这一个工具) X 不在上述命令支持范围时,按该工具自身的技能机制安装,装完确认 X 能识别本技能即可 -
装完后询问是否现在使用本技能
When to Use
- 用户要求把
02_规律研究/对标内容采集/对标采集内容链接.md中的链接批量入库 - 用户说「采集对标内容」「小红书入库」「保存小红书素材」
- 用户提供一条或多条 xiaohongshu.com 链接要求完整采集(信息+图片+评论+脚本)
- 用户说「提取图片文字」「图片OCR」「小红书图片文案」「提取笔记图片内容」「提取文案」,或给一条小红书链接要求提取完整内容(标题/正文/标签/图片文字/互动数据/评论)→ 单条模式
When NOT to Use
- 只要笔记正文文字、不下载图片不做 OCR → 直接用
opencli xiaohongshu note - 视频号、公众号等其他平台内容(本 skill 仅处理小红书)
目录与命名规范
- 保存根目录:
AI第二大脑/02_规律研究/对标内容采集/小红书/ - 每条笔记一个文件夹,命名:
编号_笔记标题_笔记ID(编号三位补零,从已有最大编号 +1 递增) - 文件夹内固定编号(从 01 排到 05,没有跳号):
01_原始素材/:01-封面图/+02-正文图片/02_笔记信息.md(用assets/笔记信息模板.md)03_图片文案原文.md(图片笔记才有)04_文案结构化梳理.md(图文型与视频型都有)05_视频脚本.md(视频笔记才有)
- 标题中的
/ \ : * ? " < > |等非法字符只做必要替换,不改标题原文
工作流
第一步:预处理
- 读取
02_规律研究/对标内容采集/对标采集内容链接.md,逐行解析,取每条行的完整链接(保留?xsec_token=及之后全部参数,不能截断);笔记 ID(/explore/后第一段,24 位十六进制)单独取出来,只用于去重和文件夹命名。 - 非笔记链接(如
user/profile主页)不自动入库,单独列出报告;跳过空行和重复链接。 - 检查登录态:
opencli xiaohongshu whoami;未登录则提示用户执行opencli xiaohongshu login。 - 查看
对标内容采集/小红书/下已有文件夹的最大编号,新编号从最大编号 +1 开始。
第二步:逐条入库
对每个笔记 ID:
-
去重:检查
对标内容采集/小红书/下是否已存在含该 ID 的文件夹;已存在则跳过并记录。 -
间隔防反爬:每条笔记之间至少间隔 5 秒(
sleep 5)再开始下一条的抓取;若返回风控/频率限制/验证码类错误,间隔提高到 10-15 秒后重试该条。单条笔记内的 note/comments/download 三路抓取可以并行,但条与条之间必须间隔。 -
并行抓取(临时目录按 note-id 组织):
opencli xiaohongshu note "<完整链接>" -f json→ 标题、作者、正文、标签、互动数据opencli xiaohongshu comments "<完整链接>" -f json→ 评论opencli xiaohongshu download "<完整链接>" --output <临时目录> -f json→ 图片 / 视频
-
判断类型:
- 下载结果含视频 → 用
mlx_whisper(medium 模型)转录,然后四步处理,保存05_视频脚本.md: ① 转录原稿:转写结果原样保留(注明转录时间与模型) ② 语义修正错别字:根据上下文语义,把语音误转词修正为正确用词(如「负力工程」→「复利工程」、「Podex」→「Codex」)。只修明显错别字和同音误转,不润色、不改口语表达,修正时尽量保守,拿不准的保留原样并在文末「修正说明」里列出 ③ 结构化整理:按内容结构分段,每一段加一个小标题,小标题下放脚本原文——最大化还原视频脚本原文,不修改脚本内容,不用提炼要点代替原文(结构示例:开场钩子 → 背景介绍 → 第一步… → 观点收尾) 最终文件结构:转录说明(时间/模型/修正说明)→ 分段小标题 + 原文 ④ 再出一份04_文案结构化梳理.md(与文章型笔记同一套格式):中心思想 + 核心论点清单 + 逐段梳理(每段小标题 + 一句话总结)+ 结构规律提炼。原文由 05 承担,04 只做概括与归类,不改写、不新增原文没有的东西 - 图片含大量文字(文章型笔记:封面常见「全文N字」标记,或图片 ≥3 张)→ 对每张图片调用 mcp-vision
ocr_extract(提示词:「提取图片中的所有文字,原文照抄,不要总结、不要修改、不要遗漏。保持原始换行和格式。」),生成两份文件:03_图片文案原文.md:OCR 文字按图片顺序合并,原文照抄,仅合并技术性断行04_文案结构化梳理.md:中心思想、核心论点清单 + 逐段梳理——每段保留原小标题 + 一句话总结(总结须保留原文的具体论据、数据与比喻,不删减关键信息,不整段照抄原文);完整原文由 03 承担;最后附结构规律提炼
- 正文为空(纯图笔记)→ 同样 OCR,合并为「图片文字」部分
- 下载结果含视频 → 用
-
建文件夹——跑脚本,不让 AI 数编号:
python3 "<本技能目录>/scripts/create_note_folder.py" \ --id <笔记ID> --title "<笔记标题>" --type 图文|视频 \ --author "<作者>" --published <YYYY-MM-DD> --url "<完整链接>" \ --likes <N> --collects <N> --comments <N>脚本负责:算编号(目标目录已有最大编号 +1)、按笔记 ID 去重(已存在就返回原文件夹、不新建)、建出
01_原始素材/01-封面图/+02-正文图片/(视频笔记另有02-视频源/)、写好02_笔记信息.md的外壳。返回 JSON,里面有文件夹绝对路径。拿到路径后,AI 把采集到的内容填进
02_笔记信息.md:- 完整保存全部字段:编号、笔记 ID、原文链接、标题、作者、发布时间、正文、标签、互动数据(点赞/收藏/评论)、评论列表、来源平台、入库时间
- 不概括、不改写、不分析,原文照抄
- 图片按原始顺序重命名
01.jpg、02.jpg…,放进01_原始素材/02-正文图片/(见下方「媒体怎么放」) - 末尾「笔记图片」部分依次嵌入本地图片引用(指
01_原始素材/02-正文图片/01.jpg…) - 视频笔记追加「视频脚本」引用;图片笔记追加「图片文案」引用(03/04 号文档)
-
全部处理完后,在链接文档中给已入库链接所在行末尾追加「(已入库 ✓ YYYY-MM-DD)」标记,不删除、不修改链接本身。
媒体怎么放
媒体统一收进 01_原始素材/,封面单独一份——封面图以后要单独用来做「小红书封面规律提取」,所以即使和正文第一张图重复也复制一份:
图片笔记:
01_原始素材/
├── 01-封面图/
│ └── 01.jpg ← 笔记第一张图的副本
└── 02-正文图片/
├── 01.jpg
├── 02.jpg
└── …
视频笔记:
01_原始素材/
├── 01-封面图/
│ └── 01.jpg ← 笔记封面图的副本
└── 02-正文图片/
└── 01.jpg 02.jpg … ← 笔记里的配图
视频笔记的原片不留在素材文件夹里:下载到临时目录 → 转写 → 删掉临时文件。素材留下的是转写稿和封面,不是原片。
- 封面 = 笔记的第一张图(或视频封面),复制进
01-封面图/,正文图片保留原样不动 - 图片命名按原始顺序,两位起(
01.jpg、10.jpg) - 图片没下载成功时,
01_原始素材/建空夹,不伪造封面
第三步:入库后检查
全部处理完后,按 references/入库检查清单.md 执行检查,更新 02_规律研究/对标内容采集/_入库检查报告.md(有效内容总数、文件路径、疑似重复、缺字段、图片问题、是否达 10 条)。
第四步:汇报
- 新增入库条数(列出文件夹位置)
- 跳过重复条数、失败条数及原因
- 图片下载成功 / 失败数量
- 正文为空的条数(哪些已用 OCR 补充)
- 视频转录条数及脚本位置
- 用户主页链接列表(未处理)
- 当前
对标内容采集/已入库总数
Common Mistakes
- 把
user/profile主页链接当笔记处理 → 主页不是单条内容,跳过并报告 - 文章型笔记不 OCR → 小红书大量「文字长图」笔记,正文只是引流文案,内容全在图片里;图片 ≥3 张或封面含「全文N字」必须 OCR,且保存原文+结构化梳理两份文件
- 图片改名后破坏顺序 → 先按 download 返回的原始顺序排序,再重命名;注意 download 的文件名顺序可能 ≠ 页面展示顺序——文章型笔记 OCR 时检查图片内页码(常见「01/13」角标),若有页码标记必须按页码重排图片文件和原文顺序
- 转录视频前未确认音频时长 → 长视频转录前先检查时长,向用户确认是否转录
- 转写错别字不修正 / 把原文提炼成要点 → 转写后必须按上下文语义修正明显误转词(保守修正,拿不准保留原样并注明);结构化分段用小标题+原文,最大化还原原文,不提炼、不压缩、不概括
- 修改链接文档时误删链接 → 只追加标记,不改动链接本身
- 编号重复 → 编号基于已有文件夹实际最大编号计算,不要假设从 001 开始
- 批量采集无间隔 → 条与条之间必须
sleep 5,遇风控错误(频率限制/验证码)间隔提高到 10-15 秒并重试,不要并发多条笔记
Resources
- 命令速查:references/commands.md
- 笔记信息模板:assets/笔记信息模板.md
微信扫一扫