← Back to skills
extension
Category: Productivity & OfficeAPI key requirement unconfirmed

对标规律提取

从内容素材库(小红书等对标内容)提取内容规律,按平台与类别写入规律卡片库:先按统一字段整理生成底稿,再把每条规律写成一张规律卡片,投入 内容规律/<平台>/<类别>/沉淀判据(2026-09-15 定):作者点名「沉淀成规律卡片」→ 直接落卡;未点名 → 说清卡片会写什么问一句,作者说是才落卡、说不是就不落(不看数量、不设待确认池)。确认过的规律只追加证据不重写。当用户说"提取规律""规律提取""更新内容规律""分析素材规律""我搜集了新内容,帮我更新内容规律"时使用。

personAuthor: sunny31221hubOpenAPI

对标规律提取

Overview

从 规律研究/对标内容采集 的采集素材中提取内容规律,直接写成规律卡片。核心纪律:所有结论必须能在来源素材里指出来,写不出出处的结论不写;落不落卡由用户拍板,不看数量

落卡判据(作者 2026-09-15 定):作者点名「沉淀成规律卡片」→ 直接落卡,不再询问;未点名 → 说清卡片会写什么、问一句「要不要沉淀为规律卡片」——说是则落卡、说不是则不落;不看数量、不设待确认池、无观察池。

安装方法

  1. 先问使用者用的是什么 AI 工具,选项按这个顺序列:1. WorkBuddy 2. Claude Code 3. Codex 4. 其他(用户直接说工具名),回答记作 X
  2. 只安装给 X,不安装或链接其他任何工具:
    • X 是 WorkBuddy:把本技能下载后放进 ~/.workbuddy/skills/(WorkBuddy 的技能目录;skills CLI 不支持 WorkBuddy,由你直接放置)

    • X 是其他工具:

      npx -y --registry=https://registry.npmmirror.com skills add https://modelscope.cn/skills/sunny31221/pattern-extractor-buheliwa -a X -y
      

      (不带 -a 会安装给本机所有检测到的工具,禁止;--registry 为 npmmirror 镜像,保证国内不翻墙也能拉到 CLI)

    • X 不在上述范围时,按该工具自身的技能机制安装,装完确认 X 能识别本技能即可

  3. 装完后询问是否现在使用本技能

When to Use

  • 用户说「提取规律」「规律提取」「更新内容规律」「分析素材规律」
  • 用户说「我搜集了新内容,帮我更新内容规律」→ 走增量更新模式
  • 新一批对标素材采集入库后,要求沉淀规律

When NOT to Use

  • 写文章、改稿 → 不属于本技能范围
  • 采集素材本身 → 不属于本技能范围
  • 沉淀自己的观点与知识卡片 → 不属于本技能范围

规律卡片库结构(输出落点)

AI第二大脑/规律研究/内容规律/
├── 01_小红书/          ← 小红书对标素材提炼的规律
│   ├── 01_开头规律卡片/         (内含:卡片NNN-做法名.md)
│   ├── 02_标题规律卡片/         (含 dbs-xhs-title 外部公式卡 75 张)
│   ├── 03_正文结构规律卡片/
│   ├── 04_封面规律卡片/
│   └── _规律提取汇总.md           ← 本平台底稿
├── 02_公众号/  ├── 四类 + …
├── 03_YouTube/ ├── 四类 + _归档 + _规律提取汇总.md
└── 04_视频号/ ├── 四类 + …
  • 平台判定:素材所在采集目录的平台段(对标内容采集/小红书/ → 内容规律/小红书/;公众号、YouTube 同理);素材来源平台不确定时问作者,不猜
  • 类别判定:标题做法 → 标题规律卡片/,开头做法 → 开头规律卡片/,正文结构做法 → 正文结构规律卡片/,封面做法 → 封面规律卡片/。本技能只产这四类(2026-09-15 定)。选题类的东西不在这里落卡:读者想看什么、对标账号写什么方向,由 topic-generator-buheliwa 每次结合素材与定位直接生成候选选题,不再多存一层会过期的中转卡片。
  • 封面规律与标题规律的分界(2026-09-28 定):标题规律管的是文字怎么写(措辞、句式、元素组合),封面规律管的是这一屏画面怎么呈现(封面用什么形式、放几个字、有没有对比、有没有署名日期这类)。同一个做法,从封面的画面上看出来的落封面夹,说的是标题文字怎么写的落标题夹。

素材文件形态(所有素材统一为标准素材文件夹)

标准素材文件夹(链接采集与 JSON 采集的统一产出)

每条素材一个文件夹(如 对标内容采集/小红书/015_xxx/、对标内容采集/公众号/001_xxx/)。四个平台(小红书 / 公众号 / 视频号 / YouTube)用同一套编号,文件夹里不一定每个槽位都有,有什么用什么:

路径写法:本技能引用的目录一律按文件夹名书写、不带编号;实际目录带数字编号前缀时,忽略前缀按名字匹配。

  • 01_原始素材/01-封面图/ — 封面单独一份,读图时先看这里
  • 01_原始素材/02-正文图片/01.jpg、02.jpg… — 正文图片(只有图文型有)
  • 02_内容信息.md — 元信息 + 正文(按平台,字段表也按平台分套):小红书图文=短正文+评论+标签;小红书视频=评论+标签(无文字正文);公众号=全文正文+图片清单(无互动数据);YouTube=视频简介+标签+评论+播放数据;视频号=视频简介。每个素材都有这份文件
  • 03_图片文案原文.md — 图片文字 OCR 提取(已有原文,直接用,不重复读图)
  • 04_文案结构化梳理.md — 已有的结构化梳理(参考用,不作为正文来源)
  • 05_视频脚本.md — 视频语音转写(视频笔记的正文来源)
  • 原片不存,素材里没有视频文件
  • _归档/、_ 开头文件 — 历史或临时材料,扫描时跳过

图片在哪:01_原始素材/01-封面图/ 和 01_原始素材/02-正文图片/,两条都没有就记「图片未采集」。

形态 B:JSON 数据包 —— 已移交小红书采集技能(2026-09-15)

JSON 数据包(社媒助手复制的笔记 JSON)的入库职责归 xiaohongshu-collect-buheliwa 的「JSON 模式」——JSON 与链接只是输入形式不同,产出的素材文件夹完全一致,统一由小红书采集技能负责。

本技能扫描时若发现未入库的 JSON 数据包(在 对标内容链接.md(对标内容采集/)或对话框里),只提示不动手:「发现未入库的 JSON 数据包,先跑小红书采集的 JSON 模式入库」,然后继续处理已在库的素材。

Workflow

阶段 1:生成/更新汇总底稿(存平台夹内 _规律提取汇总.md)

  1. 扫描素材目录,列出全部素材文件夹;若在 对标内容链接.md(对标内容采集/)或对话框里见到未入库的 JSON 数据包,提示「先跑小红书采集的 JSON 模式入库」,不自己入库。
  2. 所有素材统一按标准素材文件夹处理(JSON 已由小红书采集入库为标准素材)。
  3. 确定素材所属平台 → 底稿写入 内容规律/<平台>/_规律提取汇总.md(不存在则新建;已有则增量追加)。
  4. 对每条素材读 02_内容信息.md,拿到标题与该平台的正文载体:小红书图文=短正文、公众号=全文正文、视频平台=视频简介(无文字正文);各字段的来源见下方「四字段来源」表。
  5. 图片文字处理(图片文字是正文的一部分,不得只看纯文字正文):
    • 已有 03_图片文案原文.md → 直接用原文,核对声明张数与实际图片数是否一致
    • 没有 03(公众号就是这种,它不做 OCR 件)→ 用 Read 工具按图片编号顺序逐张读本地图片提取文字
    • 读不出来的图片 → 在汇总中记录具体路径,不跳过、不推测
  6. 视频笔记:05_视频脚本.md 转写 = 正文来源;封面图按图片规则读图。笔记文字正文只有标签、无实质内容时,开头取转写开头,并注明「取自视频脚本转写」。
  7. 每条素材提取四个字段,写入/更新底稿:
## 素材 NN
- 素材文件:<文件夹名>
- 标题:
- 开头 1-3 句原文:
- 图片正文:
- 正文结构:

字段规则:

  • 素材中没有的字段写「未采集」
  • 开头 1-3 句保留原文,不改写;视频转写照抄转写原文(含转写噪声),注明来源是转写
  • 图片正文按「01.jpg、02.jpg…」顺序逐张记录,保留影响标题/开头/结构判断的原始文字;纯装饰、无可读文字的图写「无可读文字」
  • 正文结构按原文实际段落顺序列出,用箭头连接,包含结尾动作;不提前压缩、不合并步骤
  • 开头要区分两个来源:笔记文字开头 与 首图/前几张图片承担的内容开头,分别识别,不得把图片中的任意一句话冒充成笔记文字原文
  • 其他信息(点赞收藏数据、评论、标签)不进汇总底稿,按需回素材文件查看

四字段来源(按平台,2026-09-15 适配;对不上就查这张表)

| 字段 | 小红书·图文 | 小红书·视频 | 公众号 | YouTube | 视频号 | |---|---|---|---|---|---| | 标题 | 02 | 02 | 02 | 02 | 02 | | 开头 1-3 句原文 | 02 短正文开头;图片另承担开头的,读 03 / 正文图单记 | 05 转写开头(注明「取自视频脚本转写」) | 02 正文开头 | 05 转写开头 | 05 转写开头 | | 图片正文 | 03 原文;无 03 时逐张读 02-正文图片 | 无正文图;封面有字就记封面文字,没字记「未采集」 | 无 03,直接读 02-正文图片(截图 / 海报上的文字) | 无正文图(封面有字读封面) | 同左 | | 正文结构 | 按 03 / 原图顺序 | 按 05 的分段小标题 | 按 02 正文实际段落 | 按 05 的分段 | 按 05 的分段 |

阶段 2:写成规律卡片(投入对应平台与类别夹)

  1. 先全景后规律:标题规律先看全部标题,再圈反复出现的元素组合(如「工具名 + 数字 + 学习结果」),不要只单看一个元素。
  2. 落卡判据:作者点名 → 直接写卡;未点名 → 说清卡片会写什么问一句「要不要沉淀为规律卡片」,说是则写卡、说不是则不写(不看数量)。
  3. 卡片写入位置:内容规律/<平台>/<类别夹>/;卡片编号 = 目标夹内现有最大卡片编号 + 1(先 ls 确认)。
  4. 卡片格式(与存量卡片一致;模板见 assets/规律卡片模板.md):
---
name: <做法名>
description: <大白话解释一句话(匹配用)>
metadata:
  type: 开头规律卡片   # 或 标题规律卡片 / 正文结构规律卡片 / 封面规律卡片
  规律来源: 对标采集      # 对标采集 / 作者复盘,必填其一
  状态: 候选规律
  适合: <适合什么内容,一句话>
---

# 卡片 NNN | <做法名>

- 原文示例:<保留 1-2 句来源原文,不改写,标注素材编号与来源(笔记文字/图片文字/视频转写)>
- 不适合什么内容:
- 不可照搬点:
- 来源素材:<对标采集来的写素材编号(如 002);作者复盘来的写「作者复盘 · 复盘档案名」>

「大白话解释」和「适合什么内容」不再单列正文栏,frontmatter 的 `description` 和 `适合` 就是这两样,避免同一件事写两处。
  1. 开头规律卡片保留 1-2 句来源原文作为示例,不改写原文;来源标注笔记文字 / 图片文字 / 视频转写,不得混谈。
  2. 正文结构规律卡片写清结构顺序(箭头连接)与适合的内容类型。
  3. 证据不足、样本太少、无法判断的点 → 不写进卡片;作者点名要求时照做(2026-09-15 定:不设待确认池、无观察池)。

约定(每条带来由与适用范围)

  1. 图片文字 = 正文一部分——只对「正文在图片里」的素材成立。
    • 适用:小红书图文、公众号这类正文靠图片承载的素材——01-封面图/(承担开头的)和 02-正文图片/ 上的文字算正文。
    • 不适用:视频型素材的正文是 05_视频脚本.md 转写,封面只在有字时算、没字记「未采集」;纯装饰图、无文字图不算。
    • 违反判定:只读笔记文字正文、不读上面说的那些图片里的文字 = 漏读。
  2. 原文不改写——只管底稿与卡片里的原文引用。
    • 适用:写进 _规律提取汇总.md 和规律卡片「原文示例」的内容——开头 1-3 句、图片文字、转写内容全部照抄;转写质量差时照抄并备注「语音转写,可能含误转词」。
    • 不适用:作者自己写文章时的措辞、素材之外的表述,不按这条办。
  3. 落卡由作者拍板,不看数量——只管规律卡片。
    • 适用:本技能往 内容规律/<平台>/<类别>/ 落规律卡片时。
    • 不适用:知识卡片不走这条(走采集编排器的关卡①:AI 先判断有没有值得存的、有才问,作者点名则直接存)。
    • 做法:作者点名 → 直接落卡;未点名 → 说清卡片会写什么问一句,说是则落卡、说不是则不落(2026-09-15 定;不设待确认池、无观察池)。
  4. 不写无证据的因果结论:不写「这样一定会爆」「平台算法喜欢」「这样能涨粉」等无法由当前素材证明的话;只描述「存在这种做法」,不下因果判断。
  5. 改写示例必须标注「AI 示例」:凡不是原笔记原文的示范内容,一律标明「AI 示例」,不得冒充原笔记。
  6. 来源区分:笔记文字、图片文字、视频转写三种来源分别标注。
  7. 已确认的规律不动:作者确认过的卡片,更新时只追加来源素材或新增卡片,不删除、不覆盖、不改写已有卡片内容。
  8. 卡片只写单条做法:一张卡 = 一个规律,不把多个做法揉进一张卡;做法名用能匹配触发场景的说法。

增量更新模式(作者说「我搜集了新内容」时)

  1. 只处理新增素材:对比底稿已有编号,找出新素材文件夹。
  2. 新素材先入底稿(走阶段 1 流程)。
  3. 与卡片库里已有卡片对比(Glob 目标平台与类别的全部卡片):
    • 新素材能支撑已有卡片 → 在该卡「来源素材」里追加来源,不重写卡
    • 新素材里出现已有卡片之外的新做法 → 说清这张卡会写什么,问作者要不要建卡;说建就建(编号续排),说不建就不建
    • 出现归不进任一既有类别的规律(如选题层面做法)→ 问作者归哪一类,不擅自新建类别
  4. 已确认的规律保持原样(铁律 7)。
  5. 完成后报告:新增几条素材、补强了哪些卡片、新增了哪些卡片、哪些做法问过作者而没建卡。

Common Mistakes

| 错误 | 修复 | |------|------| | 已有 03_图片文案原文.md 还去逐张读图 | 直接用那份原文,省时且避免两次 OCR 差异 | | 把链接文档里的 JSON 数据包当成素材文件夹去找 | 提示「先跑小红书采集的 JSON 模式入库」,不自己入库 | | 把规律写回旧的整篇规律文件 | 输出一律写成卡片,投入 内容规律/<平台>/<类别夹>/ | | 平台判定靠猜 | 按素材所在采集目录的平台段判定;不确定问作者 | | 不查重直接建卡 | 写卡前先 Glob 目标夹,同做法只补证据不建第二张卡 | | 把图片里任意一句话当成笔记文字开头 | 分别识别「笔记文字开头」和「首图承担的开头」,标注来源 | | 未点名就自己决定落不落卡 | 未点名一律先问作者:说落才落,说不落就不落(不看数量) | | 写「这样一定会爆」类结论 | 只描述做法和来源,不下因果判断 | | 更新时把全部规律重写一遍 | 增量模式:只处理新增素材,追加/补强/升级 | | 转写噪声当原文改写了 | 照抄转写并备注可能含误转词,让作者回看原视频核对 | | 汇总底稿塞进评论、数据等无关内容 | 底稿只留四个字段,其余回素材文件查看 |

不做什么

  • 不采素材——只读已入库的素材文件夹
  • 不写文章
  • 不沉淀观点卡片——那是 thought-card-buheliwa 的事
  • 不产出选题类卡片——规律卡片只出标题 / 开头 / 正文结构 / 封面四类;选题由 topic-generator-buheliwa 结合素材与定位直接生成
  • 不负责 JSON 入库——发现未入库的 JSON 只提示「先跑小红书采集的 JSON 模式」,不动手

Resources