video-to-text
把视频链接或本地录音转成文字稿。全程在本机跑,不花钱,音频不上传。
python3 scripts/transcribe.py "https://www.bilibili.com/video/BVxxxxx"
python3 scripts/transcribe.py ~/Desktop/周会录音.m4a
为什么再造一个
市面上的转写工具,要么按分钟收费(云端语音接口普遍 1 元/分钟上下),要么要求你把音频传上去。
这两件事对某些场景是硬伤:内部会议录音、客户访谈、未发布的素材,根本不能传给第三方。
这个 skill 用开源的 Whisper 模型在本机跑完,没有密钥,没有额度,没有上传。
能转什么
- 网上的:B站、YouTube、抖音、微博、知乎、小红书、西瓜视频、TikTok…… 1700+ 站点(底层是 yt-dlp)。快手不支持。
- 本机的:会议录音、访谈、播客、课程录屏,常见音视频格式都行。
装
pip install faster-whisper
brew install yt-dlp ffmpeg # Windows 用 winget / scoop
pip install mlx-whisper # 仅苹果 M 系列芯片,装了快很多
机器适配
不用手动配,脚本自己探测:
| 机器 | 后端 | |---|---| | 苹果 M 系列芯片 | mlx-whisper,走 GPU | | 有英伟达显卡 | faster-whisper,走 CUDA | | 其他(英特尔 Mac / 无独显的 Windows、Linux) | faster-whisper,走 CPU |
两个也许有用的设计
领域词表。转专业内容时同音字会错得离谱——「夏普比率」听成「下铺比率」。喂一段本领域词汇进去能明显改善。自带投资/量化的例子,换成医学、法律、技术的照着写就行,见 prompts/README.md。
不自动进库。产物只落输出目录,不会自动写进你的笔记库。要不要留、留到哪,你自己决定。
完整文档
见 SKILL.md。
出处与许可
底座参考了 ClawHub 上的 douyin-video-to-txt。本版改动:多后端自动适配、支持本地文件、可替换的领域词表、模型可选、输出目录可配置。
MIT。
微信扫一扫