三剪客 · 多平台自媒体数据采集 Skill
MediaCrawler:多平台自媒体数据采集 的安装、常用命令与避坑要点
前置条件
- Python 3.11(当前依赖基于该版本构建)
- uv(推荐)或原生 venv + pip
- Node.js >= 16.0.0:抖音、知乎的签名计算依赖它,缺了会直接报语法错误
- Chrome 浏览器 >= 144,并在
chrome://inspect/#remote-debugging里开启远程调试(CDP 模式) - 目标平台的可登录账号,且已在真实浏览器里登录过
- 先用
uv --version和node -v验证环境,再动采集任务 - 选用 MySQL 存储时,需要提前把数据库建好
使用
- 克隆仓库、
uv sync同步依赖;标准 Playwright 模式再跑一次uv run playwright install。 - 打开
config/base_config.py,按需设置KEYWORDS(关键词)、XHS_SPECIFIED_ID_LIST(指定帖子 ID)、ENABLE_GET_COMMENTS、ENABLE_GET_WORDCLOUD、HEADLESS、ENABLE_CDP_MODE等开关。 - 运行采集:
uv run main.py --platform xhs --lt qrcode --type search;按 ID 精确抓用--type detail。 - 要落库就先初始化:
uv run main.py --init_db sqlite,再用--save_data_option sqlite或--save_data_option db指定存储。 - 不想敲命令行就用 WebUI:先后端
uvicorn api.main:app --port 8080 --reload,再前端npm run dev(5173),或构建前端后直接访问 8080。 - 更详细的参数与平台差异看官方文档站与
uv run main.py --help。
依赖
- Python 3.11 虚拟环境与仓库
pyproject.toml/requirements.txt中声明的依赖 - Playwright 浏览器驱动(标准模式必需)
- Node.js >= 16(抖音、知乎必需)
- 本地 Chrome 浏览器(CDP 模式,版本 >= 144)
- 可选:MySQL 服务、代理服务
- 运行时依赖目标平台的网络可达性;抓取结果默认落在
data/目录
安全
- 不内嵌任何密钥
- 登录态与 Cookie 缓存在本地浏览器数据目录与
brower_data/,属于敏感文件,不要提交到版本库、不要打包分发 - MySQL 连接口令写在本地配置里,不要写进代码或提交记录
- 使用前确认已获得数据采集授权,并确认用途落在上游声明的学习研究范围内;上游明确禁止商用
- 严格控制采集频率与规模,上游明确反对大规模爬取,账号有被风控或封禁的风险
- 采集到的内容涉及个人信息与平台内容版权,二次使用与对外发布前需自行做合规评估
- 不要用本项目规避平台的访问控制或安全机制
上游项目
本 Skill 由 三剪客 出品并独立编写,正文为原创内容,不包含第三方项目的源代码。
- 项目:
MediaCrawler - 仓库:https://github.com/NanmiCoder/MediaCrawler
许可证
MIT,见 LICENSE.md。
联系我们
- 技术微信:9872659 —— 加好友时说一下是从哪个 Skill 找过来的,直接给你配套的 API Key 与能跑的示例。
- 要算力 / 要 API Key:算力集市 · 注册领 API Key —— 一个 Key 调用全部 AI 算力,注册、充值、创建 Key 都在这里。
- 更多 AI 插件与接口:AI 插件市场。
相关链接
| 链接 | 地址 | 说明 | |---|---|---| | 算力集市 · 注册领 API Key | api.a7w.cn | 一个 Key 调用全部 AI 算力;注册、充值、创建 Key 都在这 | | AI 插件市场 | aigc.a7w.cn | 浏览全部 AI 插件与接口说明 | | 三剪客 · 一句话批量出片 | ks.a7w.cn | 短剧二创 / 影视解说 / 矩阵号批量混剪桌面客户端 | | 视频超清 · 在线批量超分 | vr.a7w.cn | 网页版视频超分,批量处理,最高 4K | | 0人公司 · AI Agent 平台 | a7w.cn | 主站,了解整套 AI Agent 生态 |
Scan to join WeChat group