← Back to skills
extension
Category: Content & MediaAPI key requirement unconfirmed

采集编排器

对标内容采集编排器。用户说"采集这条链接""采集链接文档""入库这些内容"时触发。识别链接类型(小红书/公众号/YouTube/视频号),分流调用对应采集技能,采集后可选沉淀知识卡片与规律。

personAuthor: sunny31221hubOpenAPI

采集编排器

对标内容采集总指挥。识别链接类型并分流调用对应采集技能,入库后可选沉淀知识卡片与规律。

安装方法

  1. 先问使用者用的是什么 AI 工具(如 Claude Code、Codex、Cursor),回答记作 X

  2. 只安装给 X,不安装或链接其他任何工具:

    npx -y --registry=https://registry.npmmirror.com skills add https://modelscope.cn/skills/sunny31221/collect-orchestrator -a X -y
    

    (--registry 为 npmmirror 镜像,保证国内不翻墙也能装;-a X 表示只装给 X 这一个工具) X 不在上述命令支持范围时,按该工具自身的技能机制安装,装完确认 X 能识别本技能即可

  3. 装完后询问是否现在使用本技能

核心原则

编排器只负责调度,不重复实现采集逻辑。每个平台采集技能独立维护,编排器串联它们形成完整流程。

触发场景

用户说以下任一种表述时使用本技能:

  • "采集这条链接" + 具体链接
  • "采集链接文档" / "采集链接清单"
  • "入库这些内容"
  • "采集并提取规律"
  • "把这些素材采集下来"

完整流程

0. 目录检查

采集要写入 02_规律研究/ 和 03_知识库/ 下的既定目录。开始前看一眼这两个顶层目录在不在:

  • 在 → 进第 1 步
  • 不在 → 提示用户先运行「内容创作系统初始化」技能把目录建全,再回来采集

1. 识别链接来源

对话框输入:

  • 用户直接在对话中发送链接
  • 立即识别链接类型并采集

链接文档输入:

  • 读取 AI第二大脑/02_规律研究/对标内容采集/对标采集内容链接.md
  • 逐行解析未标记「已入库 ✓」的链接

2. 链接类型识别

根据 URL 特征判断平台:

| 平台 | URL 特征 | 调用技能 | |---|---|---| | 小红书 | xiaohongshu.com / xhslink.com | xiaohongshu-collect | | 公众号 | mp.weixin.qq.com | crawl-wechat | | YouTube | youtube.com / youtu.be | youtube-collect | | 视频号 | channels.weixin.qq.com / weixin.qq.com/sph | channels-collect |

3. 分流采集

小红书:

/xiaohongshu-collect <链接>

公众号:

/crawl-wechat <链接> --archive-dir "AI第二大脑/02_规律研究/对标内容采集/公众号"

YouTube:

/youtube-collect <链接>

取官方字幕转逐字稿 + 封面 + 播放数据,落 02_笔记信息.md + 04_文案结构化梳理.md + 05_视频脚本.md

视频号:

/channels-collect <链接>

下载视频(转写完删原片)+ 转写逐字稿 + 抽封面,落 02_笔记信息.md + 04_文案结构化梳理.md + 05_视频脚本.md

4. 采集后处理

4.1 回写链接文档

采集成功后,在链接文档对应行追加标记:

https://xiaohongshu.com/xxx  已入库 ✓ 2026-09-11

如果链接来自对话框(非链接文档),也要追加到链接文档末尾并标记。

4.2 链接归档(每次采集后追加到 CSV)

每次采集跑完,立刻归档一次——不让链接文档无限变长,同时留一份能拿来做统计的台账。

动作:采集完成后运行随技能附带的脚本:

python3 "<技能目录>/scripts/archive_links.py"

脚本自己找项目根(往上找含 AI第二大脑 的目录),扫链接文档里所有带「已入库 ✓ 日期」的行,追加进:

AI第二大脑/02_规律研究/对标内容采集/对标内容采集归档.csv

CSV 字段:平台, 链接, 入库日期, 状态, 素材文件夹

去重与追加:

  • 以链接为唯一键,已记过的链接不重复追加
  • 同一链接的入库日期变了 → 更新那一行
  • 没带的 素材文件夹 列留空,需要时人工补

其他说明:

  • 脚本纯标准库,不需要额外装东西;首次运行自动建 CSV 并写表头
  • 用户说「归档链接」时手动跑一次也可以
  • 未入库的链接不记——CSV 只装已入库的
  • 旧的按月份文件归档(链接归档/YYYY-MM_链接归档.md)不再使用

4.3 结构化梳理(关键步骤)

所有平台统一要求:采集后必须生成 04_文案结构化梳理.md(中心思想 + 主段分析)。

四个平台共用一套编号:

| 编号 | 装什么 | |---|---| | 01_原始素材/ | 01-封面图/ + 02-正文图片/(图文型才有)。原片不存,转写完即删 | | 02_笔记信息.md | 元信息 + 原文正文 | | 03_图片文案原文.md | 图片 OCR 原文(只有图片笔记有) | | 04_文案结构化梳理.md | 中心思想 + 核心论点 + 逐段梳理 | | 05_视频脚本.md | 视频转写(只有视频型有) |

原文的载体各平台不同:图文型原文在 03_图片文案原文.md(公众号的正文在 02_笔记信息.md 里),视频型原文在 05_视频脚本.md。结构化梳理件是在原文之上做概括与归类,与原文两份并存、不互相替代。

理由: 规律提取需要统一的结构化输入格式。

5. 知识卡片沉淀(关卡 ①)

采集完成后,先自己判断这条素材里有没有值得存的知识点——判断标准是「这个内容以后写文章或做选题时还能用得上吗」:

| 判断信号 | 依据 | 例子 | |---|---|---| | 教程 / 步骤 | 素材给了具体做法、操作流程 | 安装配置步骤、工作流怎么搭 | | 原理 / 机制 | 讲清了一个东西为什么这样运转 | 渐进式披露为什么省 token | | 概念 / 对比 | 定义了一个概念,或讲清两个东西的区别 | 买点 vs 卖点、Skill 和 MCP 的区别 | | 工具 / 方法 | 介绍了一个工具怎么用、一个方法怎么套 | 某个命令的用法、一套判断框架 |

判断结果决定分岔:

  • 有值得存的 → 走下面的询问格式问作者
  • 没有(纯故事、纯情绪、纯数据罗列、素材本身就是广告)→ 不问,静默跳过,继续走规律提取那一步
  • 作者明确说过要存 → 跳过判断,直接调 thought-card

宁可少问也别硬问——每条素材都问一遍,作者会被问烦。一条素材里值得存的点通常只有一两个,多的时候把最值得的先问。

询问用户时,必须先把卡片里大概会写什么讲出来——只问「要不要沉淀」作者没法判断。说清三件事:这条素材里的哪个知识点、这张卡片大概会讲什么、它以后能用在哪儿。

询问格式:

这篇素材里有一个知识点值得存:<知识点名称>。

卡片大概会写:<2-3 句说清这张卡片的内容——是什么、解决什么问题、关键做法或判断标准>

以后能用在哪:<写文章时当论据 / 做选题时的参考 / 回答问题时的现成答案>

要沉淀成知识卡片吗?

例子:

这篇素材里有一个知识点值得存:「买点 vs 卖点的区分」。

卡片大概会写:卖点是从自己产品出发的参数(蛋白棒含多少蛋白质),买点是买家生活场景里的具体结果和情绪(减脂期扛饿)。判断买点的方法是从真实服务里听客户的语言,不是拍脑袋猜。

以后能用在哪:写营销类、创作类文章时当核心论据;做选题时可直接变成一个选题。

要沉淀成知识卡片吗?

用户同意 → 调用 thought-card 提取并落盘到 AI第二大脑/03_知识库/(落盘时沿用上面说的知识点名称与概括,不再重写一遍)

6. 采集之后的串联流程(五道关卡)

采集和梳理做完(素材落盘 + 04_文案结构化梳理.md 写完),接着走这条链。每一关都是「问 → 是则继续,否就停在这里」,答「否」就地结束,不往下问。

五道关卡:① 知识卡片(第 5 节)② 规律卡片 ③ 选题池 ④ 给选题 ⑤ 交接写作。

采集 + 写 04_文案结构化梳理.md
   ↓
关卡 ①:判断有没有值得存的知识点 → 有则说清卡片内容再问(见第 5 节)
   ↓
提取规律(调 pattern-extractor)
   ├─ 够 2 条证据 → 问「要不要沉淀为规律卡片」→ 是则落卡 / 否则结束
   └─ 不够 2 条   → 不问,直接进单条观察与待确认
                    (作者主动说「沉淀」,就照做,哪怕只有 1 条)
   ↓
问「要不要把这次的素材沉淀到选题池」
   → 是则写进 04_选题池/选题池.md / 否则结束
   ↓
基于账号定位给出 3-5 个可写的选题,问「要不要开始写作」
   → 是则调写作流程,从刚生成的选题里挑一个开工 / 否则结束

6.1 提取规律

调 pattern-extractor 抽规律、写底稿。做完之后看证据数:

够 2 条证据 → 关卡 ②:

这条素材里的「<做法名>」在 <N> 条素材里都出现过,可以写成规律卡片。

卡片会写:<一句话说清这条规律是什么、怎么用>

要沉淀为规律卡片吗?
  • 是 → 落卡,继续下一关
  • 否 → 结束流程

不够 2 条证据 → 不问,由 pattern-extractor 直接写进该平台夹的 _单条观察与待确认.md,然后继续下一关(不结束,因为后面还有选题可做)。

作者主动要求沉淀 → 跳过判断直接落卡(哪怕只有 1 条),继续下一关。

6.2 沉淀到选题池(关卡 ③)

这次采的素材里,「<素材带来的启发>」跟你的定位对得上,可以进选题池。

要沉淀到选题池吗?
  • 是 → 调 topic-generator,把这次的素材与启发写进 04_选题池/选题池.md,继续下一关
  • 否 → 结束流程

6.3 给选题 + 交接写作(关卡 ④⑤)

基于你的定位和刚沉淀的素材,这 3 个选题你现在就能写:

1. <选题名> —— 讲什么 / 写给谁 / 解决什么问题
2. <选题名> —— …
3. <选题名> —— …

要开始写作吗?想写哪个?
  • 是 → 调写作流程(content-writer 入口 A:从选题池选题),带作者选中的那个选题进入写作(访谈、框架、初稿那一套)
  • 否 → 结束流程

选题一次给 3-5 个,只给作者现在写得动的(有素材、能查证、符合定位),凑不出 3 个就给 1-2 个并说明原因。

7. 规律卡片落盘

AI第二大脑/02_规律研究/内容规律/规律卡片/<平台>/
├── 002_开头规律卡片/
├── 003_标题规律卡片/
└── 004_正文结构规律卡片/

人工确认边界:

  • 够 2 条证据的做法 → 问过作者后落卡
  • 只有 1 条证据的观察 → 不问,自动写进 _单条观察与待确认.md;作者点名要求时照样落卡(状态标 单条观察)

使用示例

示例 1:对话框单条采集

用户:

采集这条小红书:https://xiaohongshu.com/explore/xxx

执行:

  1. 识别为小红书链接
  2. 调用 xiaohongshu-collect
  3. 采集后生成 04_文案结构化梳理.md
  4. 回写链接文档(追加链接 + 标记「已入库 ✓ 2026-09-11」)
  5. 询问:"这篇素材里有一个知识点值得存:「XX」。卡片大概会写:……。以后能用在哪:……。要沉淀成知识卡片吗?"
  6. 检查素材数:<5 条 → 记入待提取规律清单

示例 2:批量采集链接文档

用户:

采集链接文档里的所有内容

执行:

  1. 读取 对标采集内容链接.md
  2. 逐行解析未标记的链接
  3. 按平台分类:小红书 5 条、公众号 3 条、YouTube 2 条
  4. 并行调用对应采集技能
  5. 每条采集完成后标记「已入库 ✓」
  6. 全部完成后询问知识卡片沉淀
  7. 检查素材数:小红书 5 条(≥5)、公众号 3 条(<5)→ 小红书触发询问,公众号记入待提取规律清单

示例 3:主动提取规律

用户:

采集这条公众号文章,并把它的结构沉淀成规律

执行:

  1. 调用 crawl-wechat 采集
  2. 生成 04_文案结构化梳理.md
  3. 回写链接文档
  4. 跳过知识卡片询问(用户已明确要求提取规律)
  5. 立即调用 pattern-extractor(即使只有 1 条素材)
  6. 规律卡片落盘

示例 4:达到阈值触发

场景: 小红书已有 12 条素材(9 条已提取规律,3 条在待提取清单)

用户:

采集这条小红书

执行:

  1. 采集完成
  2. 检查素材数:12 + 1 = 13 条(≥5)
  3. 询问:"小红书已有 13 条新素材未提取规律,是否现在提取?"
  4. 用户同意 → 调用 pattern-extractor
  5. 提取完成后,清空待提取规律清单中小红书部分

常见问题

1. 链接文档在哪里?

默认路径:AI第二大脑/02_规律研究/对标内容采集/对标采集内容链接.md

2. 待提取规律清单在哪里?

默认路径:AI第二大脑/02_规律研究/内容规律/待提取规律清单.md

如果不存在,采集时自动创建。

3. 为什么视频也要生成 04_文案结构化梳理.md?

规律提取需要统一的结构化输入格式(中心思想 + 主段分析)。视频只有转录文本无法直接提取规律,必须先进行结构化梳理。

4. 如何查看采集进度?

检查链接文档中的「已入库 ✓」标记:

  • 未标记 → 未采集
  • 已标记 → 已采集

5. 如何强制重新采集?

删除链接文档中对应行的「已入库 ✓」标记,再次调用编排器。

6. 链接文档会不会越来越长?

不会。每次采集跑完,脚本会把已入库的链接追加进同目录的 对标内容采集归档.csv(按链接去重,不重复记)。链接文档本身保持原样,作为「采过哪些」的记录;CSV 是可以直接拉去做统计的台账。用户也可以随时说「归档链接」手动跑一次。

依赖技能

| 技能 | 用途 | 调用方式 | |---|---|---| | xiaohongshu-collect | 小红书采集 | /xiaohongshu-collect <链接> | | crawl-wechat | 公众号采集 | /crawl-wechat <链接> --archive-dir <路径> | | youtube-collect | YouTube 采集 | /youtube-collect <链接> | | channels-collect | 视频号采集 | /channels-collect <链接> | | thought-card | 知识卡片沉淀 | /thought-card | | pattern-extractor | 规律提取 | /pattern-extractor |

channels-collect 的下载环节依赖第三方开源技能 download-wechat-channels,按它的说明安装;该技能未安装时提示使用者安装,不要自己实现下载。

错误处理

| 错误场景 | 处理方式 | |---|---| | 链接无法识别平台 | 跳过该链接,记录到错误日志,继续处理下一条 | | 采集技能调用失败 | 保留该链接未标记状态,报告错误,继续处理下一条 | | 链接文档不存在 | 由第 0 步自检自动创建 | | 待提取规律清单不存在 | 由第 0 步自检自动创建 |

输出示例

✅ 采集完成:3 条成功,0 条失败

已入库素材:
- 小红书:001_如何用Claude Code搭建写作系统_xxx
- 公众号:002_AI写作的三个阶段
- YouTube:003_Agent编排实战_yyy

📊 素材统计:
- 小红书:13 条(达到阈值,建议提取规律)
- 公众号:5 条
- YouTube:2 条

💡 是否识别知识卡片?
这 3 篇素材里有 2 个知识点值得存:
1. 「XX 的安装方法」——卡片会写清三步安装与常见报错处理;以后写教程类文章可直接引用
2. 「YY 和 ZZ 的区别」——卡片会写两者的适用场景与选法;做选题时能直接变成一篇
要沉淀成知识卡片吗?