豆瓣个人数据归档 · douban-archive
v4.0.0 起回归豆瓣专用。贴吧归档请用
@user_946e03ef/tieba-archive,知识星球导出请用@user_946e03ef/zsxq-topic-archive。
把散落在豆瓣里的「看过、读过、关注过、写过的话」收拢成一份属于你自己的档案。
这是什么
一个帮助普通用户把豆瓣账号数据(书影音标记、广播、关注、长评)全量归档的 skill。抓取 → 跨账号去重 → 盘点诊断 → 交付自包含 HTML 报告 + CSV 数据表,全程不碰账号密码。
环境准备(前提条件)
本 skill 主要用来归档你自己的豆瓣账号,完整数据需要登录态,因此:
- 登录模式(推荐,抓自己账号):必须先装好 browser-skill(含浏览器插件)——它是核心前提,负责复用你已登录的浏览器做自动化批量抓取。
- 公开模式(轻量替代):只抓公开页面、零前提,但数据不完整,适合先试跑或暂未装插件时。
⚠️ 数据量提示:本 skill 不适合一次性抓取天量数据,单次建议 ≤1000 条;超出容易在执行中卡顿甚至卡死。数据多时请分时段、分年份执行(比如先抓某一年的,再抓下一年)。
怎么装 browser-skill、怎么装浏览器插件、怎么验证连接、怎么开始用,看这一篇就够:references/prerequisites.md(一文说清安装与连接全流程)。
它能做什么
- 抓取:读书/影视/音乐标记、广播、关注的人与小站、长评论(影评/书评),支持公开页与登录态两种模式
- 去重:多账号(1 个 / 2 个 / N 个都行)按条目 URL 精确去重,标出「全账号交集 / 部分交集 / 仅某号」
- 盘点:按年份/类型/评分/标签统计,生成图表与清单
- 深度诊断(两个内嵌模式):
- 写作深度诊断:分析你以前 vs 现在的写作水平、价值观、心理状态、审美观变化——把你的长评/广播当写作史样本,逐篇诊断 + 跨年对比
- 草稿医生素材复用:评估旧文字哪些能改造成新内容(五层体检 + A/B/C 复用分级,绝不代笔)
怎么用
见 SKILL.md 的工作流程。核心流程六步:
- 确认目标(账号、范围、模式——先确认再动手)
- 抓书影音(读/看/听标记,逐页翻页)
- 抓广播与关注(广播、关注的人/小站、长评——长评最容易漏)
- 数据核验(列表页 × 广播 × 详情页三方交叉验证)
- 跨账号去重(多号时按 URL 唯一键合并)
- 盘点与深度诊断(审美盘点 + 写作深度诊断 + 素材复用评估)
输出示例(只交付两份文档)
我的豆瓣汇总.html(数据盘点:统计卡 + 图表 + 完整清单 + 去重结果)我的豆瓣点评赏析.html(深度诊断:审美画像 + 写作深度诊断 + 素材复用评估)
CSV / JSON 数据底稿仅在用户明确要求时另附。
隐私与合规
- 不采集账号密码、验证码等凭证;登录模式借助用户自己的浏览器
- 默认只抓用户自己的账号;抓他人账号需说明关系 + 对方知情,最多 3 个(连同自己的号最多 4 个),且只抓公开数据
- 输出做脱敏:用户名、主页链接、真实地名按规则泛化
- 只抓公开数据;不绕过反爬机制;抓取间隔 ≥1.5 秒
- 尊重他人隐私,不抓取他人非公开数据
许可
MIT License
免责声明
本 skill 仅用于个人数据归档与自我回顾,不构成任何专业建议。抓取行为请遵守目标平台的服务条款与当地法律法规;使用者需自行确认抓取对象为本人账号或已获授权的账号。
作者:广东小张。方法论融合多方公开资料与实战经验,具体页面结构以豆瓣实际页面为准。
关于作者
- 作者:广东小张(能源行业一线技术工人,AI 技能自建者)· MIT 开源许可
- 交流学习:需要交流和学习更多,搜索「广东小张的养娃纪事」公众号留言。
- 对外分享产物遵循收敛规范:不罗列内部知识库名,方法论写「融合多方公开资料与实战经验,以官方原文为准」。
微信扫一扫