返回 Skill 列表
extension
分类: 数据与分析无需 API Key

网页图片批量下载

网页图片下载器。输入任意网站地址,自动提取并下载该网页上所有的图片。 当用户说"下载网页图片"、"下载这个网站的所有图片"、"批量下载图片"、 "下载网页上的图片"、"帮我把这个页面的图片都下下来"时触发。 支持 JPG、PNG、GIF、WebP、SVG 等常见图片格式。 特性:去重检测、图集识别、进度显示、尺寸过滤、广告过滤、增量更新。

person作者: user_0c7f1934hubcommunity

[Image] 网页图片下载器

输入任意网站地址,自动下载该网页上所有的图片,按类型/AI 智能分类并打包为 ZIP。

何时使用

  • 批量获取某个网页上的所有图片
  • 收集图片素材、壁纸、参考图
  • 备份网站图片资源
  • 下载整套相册或图片集
  • 下载需要登录才能访问的图片
  • 批量下载多个网站图片(逗号分隔 / URL 文件)
  • 自动按内容分类整理(人物、风景、产品、截图等)

目录结构

web-image-downloader/
├── SKILL.md              <- 主入口(本文件)
├── references/           <- 详细参考文档
│   ├── filter-rules.md   <- 过滤规则详解
│   ├── api-reference.md  <- 技术接口文档
│   └── output-format.md  <- 输出格式说明
├── scripts/              <- 可执行脚本
│   ├── main.py           <- 主下载脚本
│   ├── dedupe.py         <- 去重脚本 (MD5 + pHash)
│   ├── quality.py        <- 质量过滤脚本 (v1.4.0)
│   ├── classify.py       <- AI 智能分类脚本 (v1.4.0)
│   ├── progress.py       <- 进度条脚本
│   └── zipper.py         <- ZIP 打包脚本
├── assets/               <- 静态资源
│   └── download-form.html
└── evals/
    └── evals.json

使用方法

步骤 1:提供网址

输入目标网页的完整 URL,或多个 URL(逗号分隔 / URL 文件)。

步骤 2:指定参数(可选)

| 参数 | 说明 | 默认值 | |------|------|--------| | 保存路径 | 图片保存位置 | Downloads/web-images/[域名]/ | | 最小尺寸 | 宽度或高度 >= 此值(px) | 100 | | 最大尺寸 | 宽度或高度 <= 此值(px) | 不限制 | | 图集识别 | 识别并下载图片集 | true | | 增量更新 | 对比已有文件,只下载新增 | false | | 并发数 | 同时下载的线程数 | 3 | | Cookie | 登录态 Cookie 字符串 | 无 | | Cookie 文件 | Netscape 格式 Cookie 文件 | 无 | | 断点续传 | 从中断处继续下载 | false | | 感知哈希 | 启用相似图片去重 | true | | v1.4.0 新增: | | URL 文件 | 从文本文件读取 URL 列表 | 无 | | 质量过滤 | 过滤模糊/无色/水印图 | true | | 质量阈值 | 最低质量分 (0-100) | 60 | | AI 分类 | 按内容自动分类到子目录 | true |

步骤 3:执行下载

我会:

  1. 抓取网页 HTML 内容(支持多 URL 批量)
  2. 解析所有图片链接
  3. 图集识别
  4. 去重检测(MD5 + 感知哈希)
  5. 广告图过滤
  6. 质量过滤(模糊、色彩贫乏、大面积水印)
  7. 并发下载到对应文件夹
  8. AI 智能分类(人物/风景/产品/截图/图标/文档/插画)
  9. 打包为 ZIP

核心功能

基础能力

  1. MD5 去重 — 哈希比对,相同图片只保存一份
  2. 感知哈希去重 — 识别缩放/裁剪后的相似图片
  3. Cookie 支持 — 支持 --cookie--cookie-file
  4. 断点续传--resume 参数,中断后从 session.json 恢复
  5. 语义化命名 — 优先用 alt 文本命名
  6. 并发下载--concurrency 控制并发数
  7. 图集识别 — 自动识别画廊/相册
  8. 尺寸过滤 — 可指定最小/最大图片尺寸
  9. 广告过滤 — 自动排除广告图片
  10. 增量更新 — 对比已有文件,只下载新增

v1.4.0 新增

  1. 质量过滤 — 拉普拉斯清晰度检测 + 色彩丰富度 + 文本水印覆盖检测
  2. AI 智能分类 — 8 类启发式分析(人物/风景/产品/截图/图标/文档/插画/其他)
  3. 批量 URL — 逗号分隔多 URL + --url-file 文件输入

输出格式

下载完成后生成:

  • 格式文件夹(JPG/、PNG/、GIF/、WebP/、SVG/、AVIF/、HEIC/、Other/)
  • AI 分类文件夹(01-人物/、02-风景/、03-产品/、04-截图/、05-图标/、06-文档/、07-插画/、08-其他/)
  • report.json 下载报告(含质量评分、分类标签)
  • session.json 断点续传数据
  • {域名}.zip 打包文件

示例

# 基础下载
下载 https://wallhaven.cc/search?q=landscape

# 质量过滤 + AI 分类
下载 https://example.com/photos,最小 1920px

# Cookie 登录
下载 https://weibo.com/u/123456/album,cookie="SUB=xxx"

# 断点续传
下载 https://example.com/gallery,resume

# 高并发快速下载
下载 https://example.com/wallpapers,并发数 8

# v1.4.0: 批量下载多个网站(逗号分隔)
下载 https://site1.com,https://site2.com,https://site3.com/photos

# v1.4.0: 从文件批量下载
下载 https://example.com,url-file=urls.txt

# v1.4.0: 关闭分类/质量过滤
下载 https://example.com,no-classify,no-quality

命令行参考

python main.py <url | url1,url2,url3> [options]

基础选项:
  --output=<path>       输出目录
  --min-size=<px>       最小尺寸 (默认: 100)
  --max-size=<px>       最大尺寸
  --no-gallery          关闭图集识别
  --incremental         增量更新
  --concurrency=<n>     并发下载数 (默认: 3)

v1.3.0 新增:
  --cookie="k=v;..."   Cookie 字符串
  --cookie-file=<path>  Netscape 格式 Cookie 文件
  --resume              断点续传
  --no-phash            关闭感知哈希去重
  --phash-threshold=<n> 感知哈希阈值 (默认: 10)

v1.4.0 新增:
  --url-file=<path>     从文件读取 URL 列表
  --no-quality          关闭质量过滤
  --quality-score=<n>   最低质量分 (0-100, 默认: 60)
  --no-classify         关闭 AI 智能分类

如需使用,请告诉我:

  1. 网址:要下载图片的网页地址(可多个)
  2. 参数(可选):尺寸过滤、Cookie、批量模式等