对标规律提取
Overview
从 规律研究/对标内容采集 的采集素材中提取内容规律,直接写成规律卡片。核心纪律:所有结论必须能在来源素材里指出来,写不出出处的结论不写;落不落卡由用户拍板,不看数量
落卡判据(作者 2026-09-15 定):作者点名「沉淀成规律卡片」→ 直接落卡,不再询问;未点名 → 说清卡片会写什么、问一句「要不要沉淀为规律卡片」——说是则落卡、说不是则不落;不看数量、不设待确认池、无观察池。
安装方法
- 先问使用者用的是什么 AI 工具,选项按这个顺序列:1. WorkBuddy 2. Claude Code 3. Codex 4. 其他(用户直接说工具名),回答记作 X
- 只安装给 X,不安装或链接其他任何工具:
-
X 是 WorkBuddy:把本技能下载后放进
~/.workbuddy/skills/(WorkBuddy 的技能目录;skills CLI 不支持 WorkBuddy,由你直接放置) -
X 是其他工具:
npx -y --registry=https://registry.npmmirror.com skills add https://modelscope.cn/skills/sunny31221/pattern-extractor-buheliwa -a X -y(不带
-a会安装给本机所有检测到的工具,禁止;--registry为 npmmirror 镜像,保证国内不翻墙也能拉到 CLI) -
X 不在上述范围时,按该工具自身的技能机制安装,装完确认 X 能识别本技能即可
-
- 装完后询问是否现在使用本技能
When to Use
- 用户说「提取规律」「规律提取」「更新内容规律」「分析素材规律」
- 用户说「我搜集了新内容,帮我更新内容规律」→ 走增量更新模式
- 新一批对标素材采集入库后,要求沉淀规律
When NOT to Use
- 写文章、改稿 → 不属于本技能范围
- 采集素材本身 → 不属于本技能范围
- 沉淀自己的观点与知识卡片 → 不属于本技能范围
规律卡片库结构(输出落点)
AI第二大脑/规律研究/内容规律/
├── 01_小红书/ ← 小红书对标素材提炼的规律
│ ├── 01_开头规律卡片/ (内含:卡片NNN-做法名.md)
│ ├── 02_标题规律卡片/ (含 dbs-xhs-title 外部公式卡 75 张)
│ ├── 03_正文结构规律卡片/
│ ├── 04_封面规律卡片/
│ └── _规律提取汇总.md ← 本平台底稿
├── 02_公众号/ ├── 四类 + …
├── 03_YouTube/ ├── 四类 + _归档 + _规律提取汇总.md
└── 04_视频号/ ├── 四类 + …
- 平台判定:素材所在采集目录的平台段(
对标内容采集/小红书/→内容规律/小红书/;公众号、YouTube 同理);素材来源平台不确定时问作者,不猜 - 类别判定:标题做法 →
标题规律卡片/,开头做法 →开头规律卡片/,正文结构做法 →正文结构规律卡片/,封面做法 →封面规律卡片/。本技能只产这四类(2026-09-15 定)。选题类的东西不在这里落卡:读者想看什么、对标账号写什么方向,由topic-generator-buheliwa每次结合素材与定位直接生成候选选题,不再多存一层会过期的中转卡片。 - 封面规律与标题规律的分界(2026-09-28 定):标题规律管的是文字怎么写(措辞、句式、元素组合),封面规律管的是这一屏画面怎么呈现(封面用什么形式、放几个字、有没有对比、有没有署名日期这类)。同一个做法,从封面的画面上看出来的落封面夹,说的是标题文字怎么写的落标题夹。
素材文件形态(所有素材统一为标准素材文件夹)
标准素材文件夹(链接采集与 JSON 采集的统一产出)
每条素材一个文件夹(如 对标内容采集/小红书/015_xxx/、对标内容采集/公众号/001_xxx/)。四个平台(小红书 / 公众号 / 视频号 / YouTube)用同一套编号,文件夹里不一定每个槽位都有,有什么用什么:
路径写法:本技能引用的目录一律按文件夹名书写、不带编号;实际目录带数字编号前缀时,忽略前缀按名字匹配。
01_原始素材/01-封面图/— 封面单独一份,读图时先看这里01_原始素材/02-正文图片/01.jpg、02.jpg…— 正文图片(只有图文型有)02_内容信息.md— 元信息 + 正文(按平台,字段表也按平台分套):小红书图文=短正文+评论+标签;小红书视频=评论+标签(无文字正文);公众号=全文正文+图片清单(无互动数据);YouTube=视频简介+标签+评论+播放数据;视频号=视频简介。每个素材都有这份文件03_图片文案原文.md— 图片文字 OCR 提取(已有原文,直接用,不重复读图)04_文案结构化梳理.md— 已有的结构化梳理(参考用,不作为正文来源)05_视频脚本.md— 视频语音转写(视频笔记的正文来源)- 原片不存,素材里没有视频文件
_归档/、_开头文件 — 历史或临时材料,扫描时跳过
图片在哪:01_原始素材/01-封面图/ 和 01_原始素材/02-正文图片/,两条都没有就记「图片未采集」。
形态 B:JSON 数据包 —— 已移交小红书采集技能(2026-09-15)
JSON 数据包(社媒助手复制的笔记 JSON)的入库职责归 xiaohongshu-collect-buheliwa 的「JSON 模式」——JSON 与链接只是输入形式不同,产出的素材文件夹完全一致,统一由小红书采集技能负责。
本技能扫描时若发现未入库的 JSON 数据包(在 对标内容链接.md(对标内容采集/)或对话框里),只提示不动手:「发现未入库的 JSON 数据包,先跑小红书采集的 JSON 模式入库」,然后继续处理已在库的素材。
Workflow
阶段 1:生成/更新汇总底稿(存平台夹内 _规律提取汇总.md)
- 扫描素材目录,列出全部素材文件夹;若在
对标内容链接.md(对标内容采集/)或对话框里见到未入库的 JSON 数据包,提示「先跑小红书采集的 JSON 模式入库」,不自己入库。 - 所有素材统一按标准素材文件夹处理(JSON 已由小红书采集入库为标准素材)。
- 确定素材所属平台 → 底稿写入
内容规律/<平台>/_规律提取汇总.md(不存在则新建;已有则增量追加)。 - 对每条素材读
02_内容信息.md,拿到标题与该平台的正文载体:小红书图文=短正文、公众号=全文正文、视频平台=视频简介(无文字正文);各字段的来源见下方「四字段来源」表。 - 图片文字处理(图片文字是正文的一部分,不得只看纯文字正文):
- 已有
03_图片文案原文.md→ 直接用原文,核对声明张数与实际图片数是否一致 - 没有
03(公众号就是这种,它不做 OCR 件)→ 用 Read 工具按图片编号顺序逐张读本地图片提取文字 - 读不出来的图片 → 在汇总中记录具体路径,不跳过、不推测
- 已有
- 视频笔记:
05_视频脚本.md转写 = 正文来源;封面图按图片规则读图。笔记文字正文只有标签、无实质内容时,开头取转写开头,并注明「取自视频脚本转写」。 - 每条素材提取四个字段,写入/更新底稿:
## 素材 NN
- 素材文件:<文件夹名>
- 标题:
- 开头 1-3 句原文:
- 图片正文:
- 正文结构:
字段规则:
- 素材中没有的字段写「未采集」
- 开头 1-3 句保留原文,不改写;视频转写照抄转写原文(含转写噪声),注明来源是转写
- 图片正文按「01.jpg、02.jpg…」顺序逐张记录,保留影响标题/开头/结构判断的原始文字;纯装饰、无可读文字的图写「无可读文字」
- 正文结构按原文实际段落顺序列出,用箭头连接,包含结尾动作;不提前压缩、不合并步骤
- 开头要区分两个来源:笔记文字开头 与 首图/前几张图片承担的内容开头,分别识别,不得把图片中的任意一句话冒充成笔记文字原文
- 其他信息(点赞收藏数据、评论、标签)不进汇总底稿,按需回素材文件查看
四字段来源(按平台,2026-09-15 适配;对不上就查这张表)
| 字段 | 小红书·图文 | 小红书·视频 | 公众号 | YouTube | 视频号 | |---|---|---|---|---|---| | 标题 | 02 | 02 | 02 | 02 | 02 | | 开头 1-3 句原文 | 02 短正文开头;图片另承担开头的,读 03 / 正文图单记 | 05 转写开头(注明「取自视频脚本转写」) | 02 正文开头 | 05 转写开头 | 05 转写开头 | | 图片正文 | 03 原文;无 03 时逐张读 02-正文图片 | 无正文图;封面有字就记封面文字,没字记「未采集」 | 无 03,直接读 02-正文图片(截图 / 海报上的文字) | 无正文图(封面有字读封面) | 同左 | | 正文结构 | 按 03 / 原图顺序 | 按 05 的分段小标题 | 按 02 正文实际段落 | 按 05 的分段 | 按 05 的分段 |
阶段 2:写成规律卡片(投入对应平台与类别夹)
- 先全景后规律:标题规律先看全部标题,再圈反复出现的元素组合(如「工具名 + 数字 + 学习结果」),不要只单看一个元素。
- 落卡判据:作者点名 → 直接写卡;未点名 → 说清卡片会写什么问一句「要不要沉淀为规律卡片」,说是则写卡、说不是则不写(不看数量)。
- 卡片写入位置:
内容规律/<平台>/<类别夹>/;卡片编号 = 目标夹内现有最大卡片编号 + 1(先ls确认)。 - 卡片格式(与存量卡片一致;模板见
assets/规律卡片模板.md):
---
name: <做法名>
description: <大白话解释一句话(匹配用)>
metadata:
type: 开头规律卡片 # 或 标题规律卡片 / 正文结构规律卡片 / 封面规律卡片
规律来源: 对标采集 # 对标采集 / 作者复盘,必填其一
状态: 候选规律
适合: <适合什么内容,一句话>
---
# 卡片 NNN | <做法名>
- 原文示例:<保留 1-2 句来源原文,不改写,标注素材编号与来源(笔记文字/图片文字/视频转写)>
- 不适合什么内容:
- 不可照搬点:
- 来源素材:<对标采集来的写素材编号(如 002);作者复盘来的写「作者复盘 · 复盘档案名」>
「大白话解释」和「适合什么内容」不再单列正文栏,frontmatter 的 `description` 和 `适合` 就是这两样,避免同一件事写两处。
- 开头规律卡片保留 1-2 句来源原文作为示例,不改写原文;来源标注笔记文字 / 图片文字 / 视频转写,不得混谈。
- 正文结构规律卡片写清结构顺序(箭头连接)与适合的内容类型。
- 证据不足、样本太少、无法判断的点 → 不写进卡片;作者点名要求时照做(2026-09-15 定:不设待确认池、无观察池)。
约定(每条带来由与适用范围)
- 图片文字 = 正文一部分——只对「正文在图片里」的素材成立。
- 适用:小红书图文、公众号这类正文靠图片承载的素材——
01-封面图/(承担开头的)和02-正文图片/上的文字算正文。 - 不适用:视频型素材的正文是
05_视频脚本.md转写,封面只在有字时算、没字记「未采集」;纯装饰图、无文字图不算。 - 违反判定:只读笔记文字正文、不读上面说的那些图片里的文字 = 漏读。
- 适用:小红书图文、公众号这类正文靠图片承载的素材——
- 原文不改写——只管底稿与卡片里的原文引用。
- 适用:写进
_规律提取汇总.md和规律卡片「原文示例」的内容——开头 1-3 句、图片文字、转写内容全部照抄;转写质量差时照抄并备注「语音转写,可能含误转词」。 - 不适用:作者自己写文章时的措辞、素材之外的表述,不按这条办。
- 适用:写进
- 落卡由作者拍板,不看数量——只管规律卡片。
- 适用:本技能往
内容规律/<平台>/<类别>/落规律卡片时。 - 不适用:知识卡片不走这条(走采集编排器的关卡①:AI 先判断有没有值得存的、有才问,作者点名则直接存)。
- 做法:作者点名 → 直接落卡;未点名 → 说清卡片会写什么问一句,说是则落卡、说不是则不落(2026-09-15 定;不设待确认池、无观察池)。
- 适用:本技能往
- 不写无证据的因果结论:不写「这样一定会爆」「平台算法喜欢」「这样能涨粉」等无法由当前素材证明的话;只描述「存在这种做法」,不下因果判断。
- 改写示例必须标注「AI 示例」:凡不是原笔记原文的示范内容,一律标明「AI 示例」,不得冒充原笔记。
- 来源区分:笔记文字、图片文字、视频转写三种来源分别标注。
- 已确认的规律不动:作者确认过的卡片,更新时只追加来源素材或新增卡片,不删除、不覆盖、不改写已有卡片内容。
- 卡片只写单条做法:一张卡 = 一个规律,不把多个做法揉进一张卡;做法名用能匹配触发场景的说法。
增量更新模式(作者说「我搜集了新内容」时)
- 只处理新增素材:对比底稿已有编号,找出新素材文件夹。
- 新素材先入底稿(走阶段 1 流程)。
- 与卡片库里已有卡片对比(
Glob目标平台与类别的全部卡片):- 新素材能支撑已有卡片 → 在该卡「来源素材」里追加来源,不重写卡
- 新素材里出现已有卡片之外的新做法 → 说清这张卡会写什么,问作者要不要建卡;说建就建(编号续排),说不建就不建
- 出现归不进任一既有类别的规律(如选题层面做法)→ 问作者归哪一类,不擅自新建类别
- 已确认的规律保持原样(铁律 7)。
- 完成后报告:新增几条素材、补强了哪些卡片、新增了哪些卡片、哪些做法问过作者而没建卡。
Common Mistakes
| 错误 | 修复 |
|------|------|
| 已有 03_图片文案原文.md 还去逐张读图 | 直接用那份原文,省时且避免两次 OCR 差异 |
| 把链接文档里的 JSON 数据包当成素材文件夹去找 | 提示「先跑小红书采集的 JSON 模式入库」,不自己入库 |
| 把规律写回旧的整篇规律文件 | 输出一律写成卡片,投入 内容规律/<平台>/<类别夹>/ |
| 平台判定靠猜 | 按素材所在采集目录的平台段判定;不确定问作者 |
| 不查重直接建卡 | 写卡前先 Glob 目标夹,同做法只补证据不建第二张卡 |
| 把图片里任意一句话当成笔记文字开头 | 分别识别「笔记文字开头」和「首图承担的开头」,标注来源 |
| 未点名就自己决定落不落卡 | 未点名一律先问作者:说落才落,说不落就不落(不看数量) |
| 写「这样一定会爆」类结论 | 只描述做法和来源,不下因果判断 |
| 更新时把全部规律重写一遍 | 增量模式:只处理新增素材,追加/补强/升级 |
| 转写噪声当原文改写了 | 照抄转写并备注可能含误转词,让作者回看原视频核对 |
| 汇总底稿塞进评论、数据等无关内容 | 底稿只留四个字段,其余回素材文件查看 |
不做什么
- 不采素材——只读已入库的素材文件夹
- 不写文章
- 不沉淀观点卡片——那是
thought-card-buheliwa的事 - 不产出选题类卡片——规律卡片只出标题 / 开头 / 正文结构 / 封面四类;选题由
topic-generator-buheliwa结合素材与定位直接生成 - 不负责 JSON 入库——发现未入库的 JSON 只提示「先跑小红书采集的 JSON 模式」,不动手
Resources
- 规律卡片模板:assets/规律卡片模板.md
微信扫一扫