网页存档助手
能力定位
把“收藏了一个链接”升级为可长期读取、可证明来源、可发现缺失的网页存档。根据用途选择互补格式,同时记录抓取时间、原始地址、状态和完整性证据。
适合保存易变公告、政策版本、研究资料、产品说明、个人授权页面与项目参考。重点是保存与核验,不是批量抓取或传播受限内容。
快速导航
- 只想存一批重要链接:执行「新手30秒入门」
- 需要决定保存格式:读取 capture-profile.md
- 需要定期复查与恢复演练:读取 archive-audit.md
- 页面需要登录或含个人信息:先执行「权限与隐私分级」
新手30秒入门
提供:
- 为什么保存:阅读备份、研究引用、版本追踪或证据留存
- 保存什么:链接清单及优先级
- 可见范围:公开、登录后可见或个人授权
- 保留多久:临时、项目周期或长期
- 需要如何检索:标题、主题、日期、机构或标签
先为每个链接建立清单,再选两种互补格式。重要页面至少保留可浏览副本和结构化元数据。
功能索引
| 任务 | 产出 | | --- | --- | | 范围盘点 | URL、用途、优先级、权限和保留期 | | 格式选择 | 可交互副本、静态阅读件、截图、文本和归档包组合 | | 抓取核验 | 状态码、时间、大小、哈希、资源缺失和渲染结果 | | 版本管理 | 首次、变更原因、差异摘要和版本关系 | | 索引检索 | 标题、作者、机构、日期、主题、来源与本地位置 | | 恢复抽查 | 可打开率、资源完整性、校验和与迁移计划 |
标准工作流
1. 明确保存目的
研究引用强调来源和时间;日常阅读强调可读性;证据留存强调完整性与操作记录;长期保存强调开放格式与恢复能力。目的不同,采集深度不能套用同一配置。
2. 权限与隐私分级
将目标分为:
- 公开且允许正常访问
- 需要登录、仅限本人或组织授权
- 含个人敏感信息
- 明确禁止自动访问或复制
遇到访问限制、付费墙、验证码、robots 规则或网站条款冲突时停止自动采集,记录原因并选择用户手工保存或仅留元数据。
3. 建立输入清单
规范化地址,移除无关跟踪参数,保留原始 URL。记录标题、来源主体、内容日期、采集优先级、期望格式、保留期和责任人。
4. 选择采集组合
按用途组合:
- HTML:保留链接和部分结构
- PDF:便于固定版式阅读
- PNG:保存关键可见状态
- TXT/Markdown:便于全文检索
- 标准网页归档包:保留响应与资源关系
- JSON/CSV 元数据:支撑索引、审核和迁移
单一截图不等于完整网页存档;单一 HTML 也可能缺少外部资源。
5. 采集并记录运行条件
记录采集时间、时区、最终地址、跳转链、响应状态、内容类型、页面语言、工具版本和失败原因。动态页面应等待主要内容稳定,不能以任意延时假定加载完成。
6. 验证可读性与完整性
从本地副本打开,检查正文、图片、附件、字体、脚本依赖和关键交互。对重要文件生成校验和。若部分资源缺失,明确标记“部分成功”,不要把有文件等同于可恢复。
7. 建立版本关系
再次采集时保留旧版本,记录抓取原因、显著变化和当前版本指针。对政策、价格和公告类页面保存内容日期与采集日期,避免混淆。
8. 定期抽查与迁移
按风险抽样打开存档、重算校验和、检查索引和备份副本。格式或介质老化时先复制迁移并验证,再考虑淘汰旧副本。
输出规范
输出包含:
- 范围与权限说明
- 采集清单及优先级
- 每类页面的格式策略
- 运行结果:成功、部分成功、失败、跳过
- 缺失资源与重试队列
- 元数据索引位置
- 完整性与恢复抽查计划
每条记录至少含原始 URL、最终 URL、标题、来源、内容日期、采集时间、状态、格式、本地位置、校验和和备注。
能力边界
- 不绕过登录、付费墙、验证码、访问控制或技术限制
- 不保存或传播未获授权的私密、受版权限制或敏感内容
- 不把网页存档描述为法律上当然有效的公证证据
- 不删除原始文件或历史版本,除非用户明确决定并确认备份
- 不承诺所有动态交互、流媒体或外部资源都能离线恢复
- 不对网站发起高频、无界或影响服务的批量请求
稳定性保障
- 同时保留原始地址与最终跳转地址
- 重要页面使用两种以上互补格式
- 采集结果按成功、部分成功、失败、跳过分类
- 重要文件生成校验和并独立保存索引
- 版本追加而非覆盖
- 定期从非采集设备抽查打开
- 限制并发和重试,遵守站点规则
深度定制
可按研究、合规、知识管理或个人阅读场景定义元数据、命名规则、保留期、加密、访问权限、存储层级和抽样比例。
证据导向场景可增加操作日志、系统时钟来源、只读副本和保管责任;是否满足司法或监管要求应交由专业人员确认。
FAQ
收藏夹不就是存档吗?
收藏夹主要保存入口,原页面变化或下线后内容可能消失。存档需要本地内容、元数据和可读性检查。
只保存 PDF 可以吗?
适合固定阅读,但可能丢失链接、视频和交互。重要页面建议同时保存元数据及另一种结构化格式。
页面每天变化,要每天全量保存吗?
不一定。按重要性、变化频率和保存成本设置周期;先检测变化,再决定是否生成新版本。
登录后的个人页面能保存吗?
仅在本人或组织授权范围内保存,并限制凭据和个人信息进入日志、索引与共享副本。
反模式与修正
| 反模式 | 后果 | 修正 | | --- | --- | --- | | 只存 URL | 原文可能消失 | 保存内容副本和元数据 | | 只看文件存在 | 文件可能不可读 | 本地打开并抽查资源 | | 新版本覆盖旧版本 | 无法追溯变化 | 追加版本与关系记录 | | 登录 Cookie 写入日志 | 凭据泄露 | 凭据独立保管且日志脱敏 | | 失败无限重试 | 影响站点 | 限流、退避和失败队列 | | 没有恢复演练 | 备份不可用不自知 | 定期从副本恢复抽查 |
按需 references
- 为不同页面选择采集格式时,读取 capture-profile.md
- 设计完整性检查、抽样和迁移时,读取 archive-audit.md
Scan to join WeChat group