金炼之-网页工具 (jinlianzhi-web-toolkit)
网页操作自动化工具 | v1.0.1 国内 70+ 站点优先 + 失败自动重试 + 全平台支持
支持的 AI 助手平台
本 Skill 兼容以下 8 个主流 AI 客户端,可全部安装使用:
- Claude Code —
~/.claude/skills/ - Cursor —
~/.cursor/skills/ - Codex —
~/.codex/skills/或项目下.agents/skills/ - Windsurf —
~/.codeium/windsurf/skills/或项目下.windsurf/skills/ - WorkBuddy —
~/.workbuddy/skills/ - QoderWork —
~/.qoderwork/skills/ - Google Antigravity —
~/.gemini/antigravity/skills/ - Gemini CLI —
~/.gemini/skills/
安装方式
# 1. 安装 SkillHub CLI(如未安装)
curl -fsSL https://skillhub.cn/install/install.sh | bash -s -- --cli-only
# 2. 登录(如未登录)
skillhub login --key <你的 token> --host https://api.skillhub.cn
# 3. 安装到对应 AI 客户端的 skills 目录
skillhub install jinlianzhi-web-toolkit --dir <上面 8 个路径之一>
何时使用
任何涉及以下场景的任务,AI 会自动加载本 Skill:
- 操作网页 / 上网 / 查资料
- 抓网页 / 读网页 / 打开网站
- 搜索(新闻 / 热点 / 网页内容)
- 浏览器自动化 / 截图 / 表单填写
核心功能
1. 国内 70+ 站点优先
微博、小红书、抖音、B 站、公众号、知乎、CSDN、博客园、百度网盘、阿里云、腾讯云等 70+ 国内站点,走 opencli 适配器(不是 web_fetch),避免 403。
2. 5 级降级链
工具失败自动试下一个,全程不打扰用户:
Level 1: web_search 重试(自动换 query)
↓ 失败
Level 2: web_fetch 拿搜索引擎结果页
↓ 失败
Level 3: opencli 对应站点适配器
↓ 失败
Level 4: browser headless 模式
↓ 失败
Level 5: 告知用户 + 提供降级建议
3. 失败原因写日志
所有失败原因写到 ~/.mavis-体系/web-tools.log,用户面前永远只看到"✓ 拿到结果"。
慢调用(>10s)自动红色告警。
决策流
┌─ 没有 URL,需要搜索 ──────→ web_search
│ ├─ 国内需求 → 优先 baidu search
│ └─ 海外需求 → google search
│
├─ 已知 URL,静态内容 ──────→ web_fetch
│ ├─ 国内 URL(.cn / .com.cn)→ 优先 opencli 中国适配器
│ └─ 海外 URL → web_fetch
│
├─ 以上失败 / 不适用 ──────→ opencli(CLI 结构化,70+ 站点)
│
└─ 全都不行 ───────────────→ browser(浏览器自动化,兜底)
4 个工具的用法
web_search(关键词搜索)
- 国内需求自动用 baidu search
- 海外需求用 google search
- 失败时按 5 级降级链处理
web_fetch(已知 URL 静态内容)
- 反爬严的(微博/小红书/抖音/B 站)→ 强制走 opencli
- 轻度反爬的(知乎/CSDN/博客园)→ web_fetch 失败再走 opencli
opencli(Fallback,优先于 browser)
opencli weibo search --keyword "关键词"
opencli xhs search --keyword "关键词"
opencli douyin search --keyword "关键词"
opencli bilibili search --keyword "关键词"
opencli wechat-mp fetch --url xxx
browser(最后手段)
- JS 渲染页面(SPA、动态加载)
- 需要登录态
- 页面交互(点击 / 填表 / 翻页 / 滚动)
- 截图需求
- 其他工具全部失败
关键注意事项
✅ 登录操作必须获得用户授权 ✅ 敏感操作(发帖 / 删除 / 支付)必须二次确认 ✅ 优先 CSS 选择器(比 XPath 稳定) ✅ 智能等待(等目标元素出现,不要 sleep 固定时间) ✅ CAPTCHA 无法自动处理时告知用户 ✅ 多步操作保持状态(登录后复用同一浏览器上下文)
❌ 不适用场景(踩坑 FAQ)
这一节是 v1.0.2 重点补的内容。下面这些场景本 Skill 不会自动处理,AI 会主动告知用户而不是硬上。
1. 需要登录的页面(未登录态)
- 表现:打开后跳登录页 / 401 / 403
- 处理:AI 会要求你先人工登录或提供 cookie,不会自动帮你输账号密码
- 典型例子:微信扫码登录、抖音关注页、个人中心、未登录态的 B 站收藏夹
2. CAPTCHA / 滑块 / 人机验证
- 表现:出现"请拖动滑块完成验证" / reCAPTCHA / hCaptcha
- 处理:AI 100% 停下来告诉你"这里需要人工过验证",不会尝试绕过
- 典型例子:12306 购票、知乎频繁访问、Google search 大量请求后
3. 支付 / 转账 / 下单
- 表现:进入支付环节 / 收银台
- 处理:AI 会二次确认"你确认要支付 X 元吗?",得到明确"是"才会继续
- 典型例子:淘宝下单、京东结算、咸鱼拍下、steam 加购物车
4. 反爬特别严的网站(即使 4 级降级也不行)
- 表现:连续 4 个工具全部 403 / 验证码 / 封 IP
- 处理:AI 会告诉你"这个站搞不定" + 建议替代数据源,不会死磕
- 典型例子:小红书个人主页(需登录 + 风控)、微信公众号文章原文(已下线)、抖音视频直链(需 X-Bogus)
5. 实时性要求高的场景
- 表现:需要秒级 / 分钟级实时数据
- 处理:AI 会建议"用 API / WebSocket / 官方 SDK",不会用爬虫硬拉
- 典型例子:股票实时行情、直播间弹幕、即时通讯
6. 法律 / 隐私边界
- 表现:涉及他人隐私 / 未公开数据 / 版权内容
- 处理:AI 会主动拒绝或要求明确授权
- 典型例子:抓取用户手机号、未公开的内部文档、绕过付费墙
7. JS 深度交互的页面(5 级都难搞)
- 表现:WebGL 渲染 / Canvas 动画 / Shadow DOM / iframe 嵌套
- 处理:AI 会用 browser 兜底,但会明确告知"成功率 60-80%,不保证 100%"
- 典型例子:在线 PS、Figma 网页版、Three.js 演示页
8. 已知坑点(黑名单 URL)
mp.weixin.qq.com/s/...文章原文 = 已下线,AI 会告诉你"请提供文章截图 / 复制粘贴正文"xiaohongshu.com/user-profile/...个人主页 = 风控,AI 会建议你用笔记链接douyin.com/xxx视频直链 = 需 X-Bogus 签名,AI 会建议你用分享口令
9. 大量并发请求
- 表现:用户要求"帮我抓 1000 个页面"
- 处理:AI 会自动限速(每 5-10s 一个),不会用并发把对方服务器打挂
- 说明:被封 IP 是双方都亏的事
10. 自学习沉淀机制(v1.0.2+ 实验性)
- 每次成功抓取的站点,会写一条经验到沉淀卡
- 下次同站点抓取会优先复用之前的最优路径
- 沉淀卡是只追加不删除,可手动清空
11. 常见误用
- ❌ "帮我下载这个视频" → AI 不会直接下载版权视频,会问你用途
- ❌ "把微博评论全抓下来" → AI 会只抓前 N 页(默认 50 条),并告知"全量需付费 API"
- ❌ "绕过登录" → AI 会拒绝,不会帮破解登录
- ❌ "24 小时不停抓" → AI 会主动设置间隔,避免 IP 被封
致谢
- 作者:金炼之(Jinlianzhi)
- 首发:2026-08-09
- 首发平台:腾讯 SkillHub
版本
- v1.0.0(2026-08-09)— 首发
- v1.0.1(2026-08-09)— 修正:列全 8 个 AI 客户端支持
- v1.0.2(2026-08-09)— 优化:+ ❌ 不适用场景章节(11 条踩坑 FAQ)/ + 封面图 / + category / + tags
微信扫一扫