Apify 的 Crawlee 网页爬取和抓取库
Crawlee 是 Apify 面向 Node.js 的开源爬取和抓取框架。它统一了 HTTP 抓取和浏览器自动化,增加了队列、存储、重试、代理等功能,并让开发者可以在 Playwright、Puppeteer、Cheerio 和 JSDOM 之间切换而无需重建整个管道。
安装
使用与您的环境匹配的上游安装或设置路径:
- npx crawlee create my-crawler
- npm start
- npm install crawlee playwright
- npm install crawlee@next
来自上游的要求和注意事项:
- 您更喜欢使用 🐍 Python 而不是 JavaScript?👉 查看 Python 版本的 Crawlee 👈。
- Crawlee 需要 Node.js 16 或更高版本。
基本用法或入门笔记:
-
我们建议访问 Crawlee 文档中的 介绍教程 获取更多信息。
-
使用 Crawlee CLI
-
尝试 Crawlee 最快的方法是使用 Crawlee CLI 并选择 入门示例。CLI 会为您安装所有必要的依赖并添加样板代码供您使用。
-
Source: https://github.com/1991513ccie-png/skills
-
Extracted from upstream docs: https://raw.githubusercontent.com/apify/crawlee/HEAD/README.md
文档
- https://crawlee.dev/
微信扫一扫