采集编排器
对标内容采集总指挥。识别链接类型并分流调用对应采集技能,入库后可选沉淀知识卡片与规律。
安装方法
-
先问使用者用的是什么 AI 工具(如 Claude Code、Codex、Cursor),回答记作 X
-
只安装给 X,不安装或链接其他任何工具:
npx -y --registry=https://registry.npmmirror.com skills add https://modelscope.cn/skills/sunny31221/collect-orchestrator -a X -y(
--registry为 npmmirror 镜像,保证国内不翻墙也能装;-a X表示只装给 X 这一个工具) X 不在上述命令支持范围时,按该工具自身的技能机制安装,装完确认 X 能识别本技能即可 -
装完后询问是否现在使用本技能
核心原则
编排器只负责调度,不重复实现采集逻辑。每个平台采集技能独立维护,编排器串联它们形成完整流程。
触发场景
用户说以下任一种表述时使用本技能:
- "采集这条链接" + 具体链接
- "采集链接文档" / "采集链接清单"
- "入库这些内容"
- "采集并提取规律"
- "把这些素材采集下来"
完整流程
0. 目录检查
采集要写入 02_规律研究/ 和 03_知识库/ 下的既定目录。开始前看一眼这两个顶层目录在不在:
- 在 → 进第 1 步
- 不在 → 提示用户先运行「内容创作系统初始化」技能把目录建全,再回来采集
1. 识别链接来源
对话框输入:
- 用户直接在对话中发送链接
- 立即识别链接类型并采集
链接文档输入:
- 读取
AI第二大脑/02_规律研究/对标内容采集/对标采集内容链接.md - 逐行解析未标记「已入库 ✓」的链接
2. 链接类型识别
根据 URL 特征判断平台:
| 平台 | URL 特征 | 调用技能 |
|---|---|---|
| 小红书 | xiaohongshu.com / xhslink.com | xiaohongshu-collect |
| 公众号 | mp.weixin.qq.com | crawl-wechat |
| YouTube | youtube.com / youtu.be | youtube-collect |
| 视频号 | channels.weixin.qq.com / weixin.qq.com/sph | channels-collect |
3. 分流采集
小红书:
/xiaohongshu-collect <链接>
公众号:
/crawl-wechat <链接> --archive-dir "AI第二大脑/02_规律研究/对标内容采集/公众号"
YouTube:
/youtube-collect <链接>
取官方字幕转逐字稿 + 封面 + 播放数据,落 02_笔记信息.md + 04_文案结构化梳理.md + 05_视频脚本.md
视频号:
/channels-collect <链接>
下载视频(转写完删原片)+ 转写逐字稿 + 抽封面,落 02_笔记信息.md + 04_文案结构化梳理.md + 05_视频脚本.md
4. 采集后处理
4.1 回写链接文档
采集成功后,在链接文档对应行追加标记:
https://xiaohongshu.com/xxx 已入库 ✓ 2026-09-11
如果链接来自对话框(非链接文档),也要追加到链接文档末尾并标记。
4.2 链接归档(每次采集后追加到 CSV)
每次采集跑完,立刻归档一次——不让链接文档无限变长,同时留一份能拿来做统计的台账。
动作:采集完成后运行随技能附带的脚本:
python3 "<技能目录>/scripts/archive_links.py"
脚本自己找项目根(往上找含 AI第二大脑 的目录),扫链接文档里所有带「已入库 ✓ 日期」的行,追加进:
AI第二大脑/02_规律研究/对标内容采集/对标内容采集归档.csv
CSV 字段:平台, 链接, 入库日期, 状态, 素材文件夹
去重与追加:
- 以链接为唯一键,已记过的链接不重复追加
- 同一链接的入库日期变了 → 更新那一行
- 没带的
素材文件夹列留空,需要时人工补
其他说明:
- 脚本纯标准库,不需要额外装东西;首次运行自动建 CSV 并写表头
- 用户说「归档链接」时手动跑一次也可以
- 未入库的链接不记——CSV 只装已入库的
- 旧的按月份文件归档(
链接归档/YYYY-MM_链接归档.md)不再使用
4.3 结构化梳理(关键步骤)
所有平台统一要求:采集后必须生成 04_文案结构化梳理.md(中心思想 + 主段分析)。
四个平台共用一套编号:
| 编号 | 装什么 |
|---|---|
| 01_原始素材/ | 01-封面图/ + 02-正文图片/(图文型才有)。原片不存,转写完即删 |
| 02_笔记信息.md | 元信息 + 原文正文 |
| 03_图片文案原文.md | 图片 OCR 原文(只有图片笔记有) |
| 04_文案结构化梳理.md | 中心思想 + 核心论点 + 逐段梳理 |
| 05_视频脚本.md | 视频转写(只有视频型有) |
原文的载体各平台不同:图文型原文在 03_图片文案原文.md(公众号的正文在 02_笔记信息.md 里),视频型原文在 05_视频脚本.md。结构化梳理件是在原文之上做概括与归类,与原文两份并存、不互相替代。
理由: 规律提取需要统一的结构化输入格式。
5. 知识卡片沉淀(关卡 ①)
采集完成后,先自己判断这条素材里有没有值得存的知识点——判断标准是「这个内容以后写文章或做选题时还能用得上吗」:
| 判断信号 | 依据 | 例子 | |---|---|---| | 教程 / 步骤 | 素材给了具体做法、操作流程 | 安装配置步骤、工作流怎么搭 | | 原理 / 机制 | 讲清了一个东西为什么这样运转 | 渐进式披露为什么省 token | | 概念 / 对比 | 定义了一个概念,或讲清两个东西的区别 | 买点 vs 卖点、Skill 和 MCP 的区别 | | 工具 / 方法 | 介绍了一个工具怎么用、一个方法怎么套 | 某个命令的用法、一套判断框架 |
判断结果决定分岔:
- 有值得存的 → 走下面的询问格式问作者
- 没有(纯故事、纯情绪、纯数据罗列、素材本身就是广告)→ 不问,静默跳过,继续走规律提取那一步
- 作者明确说过要存 → 跳过判断,直接调
thought-card
宁可少问也别硬问——每条素材都问一遍,作者会被问烦。一条素材里值得存的点通常只有一两个,多的时候把最值得的先问。
询问用户时,必须先把卡片里大概会写什么讲出来——只问「要不要沉淀」作者没法判断。说清三件事:这条素材里的哪个知识点、这张卡片大概会讲什么、它以后能用在哪儿。
询问格式:
这篇素材里有一个知识点值得存:<知识点名称>。
卡片大概会写:<2-3 句说清这张卡片的内容——是什么、解决什么问题、关键做法或判断标准>
以后能用在哪:<写文章时当论据 / 做选题时的参考 / 回答问题时的现成答案>
要沉淀成知识卡片吗?
例子:
这篇素材里有一个知识点值得存:「买点 vs 卖点的区分」。
卡片大概会写:卖点是从自己产品出发的参数(蛋白棒含多少蛋白质),买点是买家生活场景里的具体结果和情绪(减脂期扛饿)。判断买点的方法是从真实服务里听客户的语言,不是拍脑袋猜。
以后能用在哪:写营销类、创作类文章时当核心论据;做选题时可直接变成一个选题。
要沉淀成知识卡片吗?
用户同意 → 调用 thought-card 提取并落盘到 AI第二大脑/03_知识库/(落盘时沿用上面说的知识点名称与概括,不再重写一遍)
6. 采集之后的串联流程(五道关卡)
采集和梳理做完(素材落盘 + 04_文案结构化梳理.md 写完),接着走这条链。每一关都是「问 → 是则继续,否就停在这里」,答「否」就地结束,不往下问。
五道关卡:① 知识卡片(第 5 节)② 规律卡片 ③ 选题池 ④ 给选题 ⑤ 交接写作。
采集 + 写 04_文案结构化梳理.md
↓
关卡 ①:判断有没有值得存的知识点 → 有则说清卡片内容再问(见第 5 节)
↓
提取规律(调 pattern-extractor)
├─ 够 2 条证据 → 问「要不要沉淀为规律卡片」→ 是则落卡 / 否则结束
└─ 不够 2 条 → 不问,直接进单条观察与待确认
(作者主动说「沉淀」,就照做,哪怕只有 1 条)
↓
问「要不要把这次的素材沉淀到选题池」
→ 是则写进 04_选题池/选题池.md / 否则结束
↓
基于账号定位给出 3-5 个可写的选题,问「要不要开始写作」
→ 是则调写作流程,从刚生成的选题里挑一个开工 / 否则结束
6.1 提取规律
调 pattern-extractor 抽规律、写底稿。做完之后看证据数:
够 2 条证据 → 关卡 ②:
这条素材里的「<做法名>」在 <N> 条素材里都出现过,可以写成规律卡片。
卡片会写:<一句话说清这条规律是什么、怎么用>
要沉淀为规律卡片吗?
- 是 → 落卡,继续下一关
- 否 → 结束流程
不够 2 条证据 → 不问,由 pattern-extractor 直接写进该平台夹的 _单条观察与待确认.md,然后继续下一关(不结束,因为后面还有选题可做)。
作者主动要求沉淀 → 跳过判断直接落卡(哪怕只有 1 条),继续下一关。
6.2 沉淀到选题池(关卡 ③)
这次采的素材里,「<素材带来的启发>」跟你的定位对得上,可以进选题池。
要沉淀到选题池吗?
- 是 → 调
topic-generator,把这次的素材与启发写进04_选题池/选题池.md,继续下一关 - 否 → 结束流程
6.3 给选题 + 交接写作(关卡 ④⑤)
基于你的定位和刚沉淀的素材,这 3 个选题你现在就能写:
1. <选题名> —— 讲什么 / 写给谁 / 解决什么问题
2. <选题名> —— …
3. <选题名> —— …
要开始写作吗?想写哪个?
- 是 → 调写作流程(
content-writer入口 A:从选题池选题),带作者选中的那个选题进入写作(访谈、框架、初稿那一套) - 否 → 结束流程
选题一次给 3-5 个,只给作者现在写得动的(有素材、能查证、符合定位),凑不出 3 个就给 1-2 个并说明原因。
7. 规律卡片落盘
AI第二大脑/02_规律研究/内容规律/规律卡片/<平台>/
├── 002_开头规律卡片/
├── 003_标题规律卡片/
└── 004_正文结构规律卡片/
人工确认边界:
- 够 2 条证据的做法 → 问过作者后落卡
- 只有 1 条证据的观察 → 不问,自动写进
_单条观察与待确认.md;作者点名要求时照样落卡(状态标单条观察)
使用示例
示例 1:对话框单条采集
用户:
采集这条小红书:https://xiaohongshu.com/explore/xxx
执行:
- 识别为小红书链接
- 调用
xiaohongshu-collect - 采集后生成
04_文案结构化梳理.md - 回写链接文档(追加链接 + 标记「已入库 ✓ 2026-09-11」)
- 询问:"这篇素材里有一个知识点值得存:「XX」。卡片大概会写:……。以后能用在哪:……。要沉淀成知识卡片吗?"
- 检查素材数:<5 条 → 记入待提取规律清单
示例 2:批量采集链接文档
用户:
采集链接文档里的所有内容
执行:
- 读取
对标采集内容链接.md - 逐行解析未标记的链接
- 按平台分类:小红书 5 条、公众号 3 条、YouTube 2 条
- 并行调用对应采集技能
- 每条采集完成后标记「已入库 ✓」
- 全部完成后询问知识卡片沉淀
- 检查素材数:小红书 5 条(≥5)、公众号 3 条(<5)→ 小红书触发询问,公众号记入待提取规律清单
示例 3:主动提取规律
用户:
采集这条公众号文章,并把它的结构沉淀成规律
执行:
- 调用
crawl-wechat采集 - 生成
04_文案结构化梳理.md - 回写链接文档
- 跳过知识卡片询问(用户已明确要求提取规律)
- 立即调用
pattern-extractor(即使只有 1 条素材) - 规律卡片落盘
示例 4:达到阈值触发
场景: 小红书已有 12 条素材(9 条已提取规律,3 条在待提取清单)
用户:
采集这条小红书
执行:
- 采集完成
- 检查素材数:12 + 1 = 13 条(≥5)
- 询问:"小红书已有 13 条新素材未提取规律,是否现在提取?"
- 用户同意 → 调用
pattern-extractor - 提取完成后,清空待提取规律清单中小红书部分
常见问题
1. 链接文档在哪里?
默认路径:AI第二大脑/02_规律研究/对标内容采集/对标采集内容链接.md
2. 待提取规律清单在哪里?
默认路径:AI第二大脑/02_规律研究/内容规律/待提取规律清单.md
如果不存在,采集时自动创建。
3. 为什么视频也要生成 04_文案结构化梳理.md?
规律提取需要统一的结构化输入格式(中心思想 + 主段分析)。视频只有转录文本无法直接提取规律,必须先进行结构化梳理。
4. 如何查看采集进度?
检查链接文档中的「已入库 ✓」标记:
- 未标记 → 未采集
- 已标记 → 已采集
5. 如何强制重新采集?
删除链接文档中对应行的「已入库 ✓」标记,再次调用编排器。
6. 链接文档会不会越来越长?
不会。每次采集跑完,脚本会把已入库的链接追加进同目录的 对标内容采集归档.csv(按链接去重,不重复记)。链接文档本身保持原样,作为「采过哪些」的记录;CSV 是可以直接拉去做统计的台账。用户也可以随时说「归档链接」手动跑一次。
依赖技能
| 技能 | 用途 | 调用方式 |
|---|---|---|
| xiaohongshu-collect | 小红书采集 | /xiaohongshu-collect <链接> |
| crawl-wechat | 公众号采集 | /crawl-wechat <链接> --archive-dir <路径> |
| youtube-collect | YouTube 采集 | /youtube-collect <链接> |
| channels-collect | 视频号采集 | /channels-collect <链接> |
| thought-card | 知识卡片沉淀 | /thought-card |
| pattern-extractor | 规律提取 | /pattern-extractor |
channels-collect 的下载环节依赖第三方开源技能 download-wechat-channels,按它的说明安装;该技能未安装时提示使用者安装,不要自己实现下载。
错误处理
| 错误场景 | 处理方式 | |---|---| | 链接无法识别平台 | 跳过该链接,记录到错误日志,继续处理下一条 | | 采集技能调用失败 | 保留该链接未标记状态,报告错误,继续处理下一条 | | 链接文档不存在 | 由第 0 步自检自动创建 | | 待提取规律清单不存在 | 由第 0 步自检自动创建 |
输出示例
✅ 采集完成:3 条成功,0 条失败
已入库素材:
- 小红书:001_如何用Claude Code搭建写作系统_xxx
- 公众号:002_AI写作的三个阶段
- YouTube:003_Agent编排实战_yyy
📊 素材统计:
- 小红书:13 条(达到阈值,建议提取规律)
- 公众号:5 条
- YouTube:2 条
💡 是否识别知识卡片?
这 3 篇素材里有 2 个知识点值得存:
1. 「XX 的安装方法」——卡片会写清三步安装与常见报错处理;以后写教程类文章可直接引用
2. 「YY 和 ZZ 的区别」——卡片会写两者的适用场景与选法;做选题时能直接变成一篇
要沉淀成知识卡片吗?
微信扫一扫