[Image] 网页图片下载器
输入任意网站地址,自动下载该网页上所有的图片,按类型/AI 智能分类并打包为 ZIP。
何时使用
- 批量获取某个网页上的所有图片
- 收集图片素材、壁纸、参考图
- 备份网站图片资源
- 下载整套相册或图片集
- 下载需要登录才能访问的图片
- 批量下载多个网站图片(逗号分隔 / URL 文件)
- 自动按内容分类整理(人物、风景、产品、截图等)
目录结构
web-image-downloader/
├── SKILL.md <- 主入口(本文件)
├── references/ <- 详细参考文档
│ ├── filter-rules.md <- 过滤规则详解
│ ├── api-reference.md <- 技术接口文档
│ └── output-format.md <- 输出格式说明
├── scripts/ <- 可执行脚本
│ ├── main.py <- 主下载脚本
│ ├── dedupe.py <- 去重脚本 (MD5 + pHash)
│ ├── quality.py <- 质量过滤脚本 (v1.4.0)
│ ├── classify.py <- AI 智能分类脚本 (v1.4.0)
│ ├── progress.py <- 进度条脚本
│ └── zipper.py <- ZIP 打包脚本
├── assets/ <- 静态资源
│ └── download-form.html
└── evals/
└── evals.json
使用方法
步骤 1:提供网址
输入目标网页的完整 URL,或多个 URL(逗号分隔 / URL 文件)。
步骤 2:指定参数(可选)
| 参数 | 说明 | 默认值 |
|------|------|--------|
| 保存路径 | 图片保存位置 | Downloads/web-images/[域名]/ |
| 最小尺寸 | 宽度或高度 >= 此值(px) | 100 |
| 最大尺寸 | 宽度或高度 <= 此值(px) | 不限制 |
| 图集识别 | 识别并下载图片集 | true |
| 增量更新 | 对比已有文件,只下载新增 | false |
| 并发数 | 同时下载的线程数 | 3 |
| Cookie | 登录态 Cookie 字符串 | 无 |
| Cookie 文件 | Netscape 格式 Cookie 文件 | 无 |
| 断点续传 | 从中断处继续下载 | false |
| 感知哈希 | 启用相似图片去重 | true |
| v1.4.0 新增: |
| URL 文件 | 从文本文件读取 URL 列表 | 无 |
| 质量过滤 | 过滤模糊/无色/水印图 | true |
| 质量阈值 | 最低质量分 (0-100) | 60 |
| AI 分类 | 按内容自动分类到子目录 | true |
步骤 3:执行下载
我会:
- 抓取网页 HTML 内容(支持多 URL 批量)
- 解析所有图片链接
- 图集识别
- 去重检测(MD5 + 感知哈希)
- 广告图过滤
- 质量过滤(模糊、色彩贫乏、大面积水印)
- 并发下载到对应文件夹
- AI 智能分类(人物/风景/产品/截图/图标/文档/插画)
- 打包为 ZIP
核心功能
基础能力
- MD5 去重 — 哈希比对,相同图片只保存一份
- 感知哈希去重 — 识别缩放/裁剪后的相似图片
- Cookie 支持 — 支持
--cookie和--cookie-file - 断点续传 —
--resume参数,中断后从 session.json 恢复 - 语义化命名 — 优先用 alt 文本命名
- 并发下载 —
--concurrency控制并发数 - 图集识别 — 自动识别画廊/相册
- 尺寸过滤 — 可指定最小/最大图片尺寸
- 广告过滤 — 自动排除广告图片
- 增量更新 — 对比已有文件,只下载新增
v1.4.0 新增
- 质量过滤 — 拉普拉斯清晰度检测 + 色彩丰富度 + 文本水印覆盖检测
- AI 智能分类 — 8 类启发式分析(人物/风景/产品/截图/图标/文档/插画/其他)
- 批量 URL — 逗号分隔多 URL +
--url-file文件输入
输出格式
下载完成后生成:
- 格式文件夹(JPG/、PNG/、GIF/、WebP/、SVG/、AVIF/、HEIC/、Other/)
- AI 分类文件夹(01-人物/、02-风景/、03-产品/、04-截图/、05-图标/、06-文档/、07-插画/、08-其他/)
- report.json 下载报告(含质量评分、分类标签)
- session.json 断点续传数据
{域名}.zip打包文件
示例
# 基础下载
下载 https://wallhaven.cc/search?q=landscape
# 质量过滤 + AI 分类
下载 https://example.com/photos,最小 1920px
# Cookie 登录
下载 https://weibo.com/u/123456/album,cookie="SUB=xxx"
# 断点续传
下载 https://example.com/gallery,resume
# 高并发快速下载
下载 https://example.com/wallpapers,并发数 8
# v1.4.0: 批量下载多个网站(逗号分隔)
下载 https://site1.com,https://site2.com,https://site3.com/photos
# v1.4.0: 从文件批量下载
下载 https://example.com,url-file=urls.txt
# v1.4.0: 关闭分类/质量过滤
下载 https://example.com,no-classify,no-quality
命令行参考
python main.py <url | url1,url2,url3> [options]
基础选项:
--output=<path> 输出目录
--min-size=<px> 最小尺寸 (默认: 100)
--max-size=<px> 最大尺寸
--no-gallery 关闭图集识别
--incremental 增量更新
--concurrency=<n> 并发下载数 (默认: 3)
v1.3.0 新增:
--cookie="k=v;..." Cookie 字符串
--cookie-file=<path> Netscape 格式 Cookie 文件
--resume 断点续传
--no-phash 关闭感知哈希去重
--phash-threshold=<n> 感知哈希阈值 (默认: 10)
v1.4.0 新增:
--url-file=<path> 从文件读取 URL 列表
--no-quality 关闭质量过滤
--quality-score=<n> 最低质量分 (0-100, 默认: 60)
--no-classify 关闭 AI 智能分类
如需使用,请告诉我:
- 网址:要下载图片的网页地址(可多个)
- 参数(可选):尺寸过滤、Cookie、批量模式等
Scan to join WeChat group