视频号采集
安装方法
-
先问使用者用的是什么 AI 工具(如 Claude Code、Codex、Cursor),回答记作 X
-
只安装给 X,不安装或链接其他任何工具:
npx -y --registry=https://registry.npmmirror.com skills add https://modelscope.cn/skills/sunny31221/channels-collect -a X -y(
--registry为 npmmirror 镜像,保证国内不翻墙也能装;-a X表示只装给 X 这一个工具) X 不在上述命令支持范围时,按该工具自身的技能机制安装,装完确认 X 能识别本技能即可 -
装完后询问是否现在使用本技能
依赖什么
下载环节用第三方开源技能 download-wechat-channels(作者:镇涛 AI 实战笔记),它通过腾讯官方链路解析视频号视频。本技能不包含下载引擎,只负责调用它,并把结果整理成标准素材。
- 没装这个下载技能时:告诉使用者按下面的安装办法装一次,不要自己实现下载逻辑
- 它是独立开源项目,署名与提示语属于原作者,不要修改、不要抹掉
| 依赖 | 作用 |
|---|---|
| download-wechat-channels(第三方技能) | 解析并下载视频号视频 MP4 |
| mlx-whisper | 把视频语音转成逐字稿(macOS) |
| ffmpeg | 抽封面帧 |
装不上 / 跑不通怎么办:
| 情况 | 处理 |
|---|---|
| 没有下载技能 | 让使用者先装(见下),装完继续 |
| 没有 mlx-whisper | 装一次;实在装不上就在最终报告里写明「转写未完成」,只落 02_笔记信息.md + 封面,不留空文件 |
| 没有 ffmpeg | brew install ffmpeg(macOS);装不上就跳过封面,不阻塞 |
| 视频无音轨 | 跳过转写,在 02_笔记信息.md 写明「无音轨」 |
去哪装(推荐降级链:国际源失败 → 国内镜像):
# 下载技能(第三方,按它自己的说明装)
# mlx-whisper(Apple 芯片的 macOS)
pip3 install -U mlx-whisper
pip3 install -U mlx-whisper -i https://pypi.tuna.tsinghua.edu.cn/simple # 清华镜像
pip3 install -U mlx-whisper -i https://mirrors.aliyun.com/pypi/simple/ # 阿里云镜像
# Windows / Intel Mac 用 openai-whisper 代替
pip install -U openai-whisper
pip install -U openai-whisper -i https://pypi.tuna.tsinghua.edu.cn/simple
# ffmpeg
brew install ffmpeg # macOS
winget install Gyan.FFmpeg # Windows
装完验证:
mlx_whisper --help | head -3
ffmpeg -version | head -1
触发场景
- "采集这个视频号视频" + 分享链接
- "视频号入库" / "把这条视频号链接存进对标素材"
- 采集编排器识别到
weixin.qq.com/sph/channels.weixin.qq.com链接后分流到本技能
输出位置
AI第二大脑/02_规律研究/对标内容采集/视频号/
└── NNN_标题_视频ID/
├── 01_原始素材/
│ └── 01-封面图/
│ └── cover.jpg
├── 02_笔记信息.md
├── 04_文案结构化梳理.md
└── 05_视频脚本.md
- 编号:取目标目录已有最大编号 +1(三位补零),不假设从 001 开始
- 文件夹名:
编号_标题_视频ID,标题里的/换成全角「/」 - 去重:同一视频 ID 已存在时跳过,不重复建文件夹
流程
1. 调下载技能
按第三方技能 download-wechat-channels 的说明完成下载。要点:
- 首次使用需要本人扫码登录腾讯元宝官方页;不要代替使用者登录,把扫码页显示出来,告诉他扫完会自动继续
- 默认画质
auto,使用者明确指定时用他选的 - 记下下载结果里的这几个字段:标题、作者、发布时间、封面图地址、MP4 绝对路径
2. 建素材文件夹
先跑脚本把文件夹建出来(编号、去重、目录结构由脚本决定,不让 AI 数):
python3 "<本技能目录>/scripts/create_note_folder.py" \
--platform 视频号 --type 视频 \
--id <视频ID> --title "<标题>" --author "<作者>"
返回 JSON 里的 folder 就是素材文件夹路径,后面所有文件都写进它。
3. 抽封面
下载技能默认把 MP4 存在 ~/Downloads/视频号(Windows 存系统下载目录)。原片不进素材文件夹——它只是转写的原料,抽完封面、转写完就删:
ffmpeg -y -i "<下载得到的 MP4 路径>" -vframes 1 -q:v 2 "<素材文件夹>/01_原始素材/01-封面图/cover.jpg"
4. 转写逐字稿
mlx_whisper "<下载得到的 MP4 路径>" --model mlx-community/whisper-medium-mlx \
--language zh --output-dir "<素材文件夹>" --output-format txt
(Windows / Intel Mac 换成 whisper "<下载得到的 MP4 路径>" --model medium --language zh --output_format txt --output_dir "<素材文件夹>")
转写完把原片删掉(封面和逐字稿都已落盘):
rm "<下载得到的 MP4 路径>"
转写结果要做两件事,再存档:
- 繁转简:mlx-whisper 默认输出繁体(实测会出「我聽到」「製作方式」),转成简体,其余字词不动
- 英文词误转说明:语音转写会把英文专有名词写错(实测把 Claude 写成
Klod)。逐字稿保留原样不擅改,在05_视频脚本.md里列一行「误转词对照」,把确认认错的词写清楚
转写结果是逐字稿原文,除繁转简外照抄:不改写、不顺句、不补标点,口语词、重复、口癖都保留。
繁转简的办法(按顺序试):
- 让 AI 直接转(最省事,繁体转简体是模型的常规能力)
- 想自动化就装一次:
pip3 install opencc-python-reimplemented -i https://pypi.tuna.tsinghua.edu.cn/simple(Homebrew 的 Python 会报externally-managed-environment,加--break-system-packages或改用虚拟环境),转法是opencc.OpenCC('t2s').convert(text)
5. 写 02_笔记信息.md
# <标题>
| 字段 | 内容 |
|------|------|
| 编号 | <三位编号> |
| 视频ID | <分享链接里的 ID> |
| 来源 | 视频号 |
| 作者 | <作者名> |
| 发布时间 | <发布时间;拿不到写「未获取」> |
| 原文链接 | <分享链接> |
| 时长 | <时长> |
| 入库时间 | <YYYY-MM-DD> |
---
## 视频信息
<下载技能返回的其他可用信息;没有就写「无」>
互动数据(点赞 / 收藏 / 转发 / 评论)拿不到就不写这一行,不要估、不要凭印象填。
6. 写 05_视频脚本.md
逐字稿很长时,先整理结构化部分,再把逐字稿原样放在文末存档:
# 视频脚本(结构化整理):<标题>
> 来源:视频号 <作者名>(<发布时间>);转录:本机语音转写,可能含误转词
---
## 一、核心观点
<3-8 条,每条一句话>
## 二、全文整理(按核心观点分组)
### 观点 N:<小标题>
<这一段的原话要点,可引原句>
---
## 三、提取的文字(转录原文存档,逐句原样)
<逐字稿,不加标点、不改写>
7. 写结构化梳理
05_视频脚本.md 是原始素材,还要再出一份便于下游提炼规律的梳理件 04_文案结构化梳理.md:
# 文案结构化梳理
> 来源:<编号> <标题>([[05_视频脚本.md]])
> 梳理日期:<YYYY-MM-DD>
> 说明:本文件做结构化梳理:中心思想、核心论点、逐段小标题 + 一句话总结。总结保留原文的具体论据、数据与比喻,不删减关键信息;完整原文见 05 号文件。
---
## 一、中心思想
<一段话说清这条视频主张什么;下面附一句可直接引用的一句话说概括>
## 二、核心论点(N 条)
1. **<论点>**:<展开,保留原文的数据、例子、比喻>
(逐条列完)
## 三、逐段梳理
### <原文小标题>|<一句话总结>
- **一句话总结**:<这一段讲了什么>
- **原文示例**:<引原句,可核对>
- **可复用点**:<这条做法在哪能用>
(按原文段落顺序,一段一条)
## 四、结构规律提炼
<3-5 条,讲这条视频的骨架怎么搭的:几段式、每段承担什么、开头与结尾各做什么>
要点:梳理件里的每一句都要能追回 05 的原文;不新增视频里没有的数据或例子。
8. 完成后报告
报告:标题、作者、时长、转写字数、封面是否抽到、落盘路径。有跳过或失败的项目一并说明。
铁律
- 下载交给第三方引擎:不自己实现解析、不绕过登录、不碰付费或私密内容
- 保留原作者署名:第三方技能的提示语与署名不动
- 逐字稿只做繁转简:除繁转简外不改写、不润色、不补标点;误转词另列对照,不直接改原文
- 拿不到的数据留白:互动数据、发布时间拿不到就写「未获取」,不估
- 去重靠视频 ID:同一视频不重复入库
微信扫一扫