返回 Skill 列表
extension
分类: 数据与分析无需 API Key

Crawl4AI Open-Source Web Crawling and Markdown Extraction

Crawl4AI 是一个开源爬虫和刮取工具,专为 LLM 就绪的网页提取而构建,支持结构化 markdown 输出、浏览器支持以及 Python 包分发。它具有广泛的采用率、积极的维护和专门用于集成模式的文档网站。

person作者: user_3c6cb52ehubcommunity

Crawl4AI 开源网页爬取与 Markdown 提取

Crawl4AI 是一个开源爬虫和刮取工具,专为 LLM 就绪的网页提取而构建,支持结构化 markdown 输出、浏览器支持以及 Python 包分发。它具有广泛的采用率、积极的维护和专门用于集成模式的文档网站。

先决条件

python, pip, docker, go, rust, java

安装

使用与您的环境匹配的上游安装或设置路径:

  • pip install -U crawl4ai
  • pip install crawl4ai --pre
  • Crawl4AI 提供灵活的安装选项以适应各种用例。您可以将其作为 Python 包安装或使用 Docker。
  • pip install crawl4ai

来自上游的要求和注意事项:

  • Python Version
  • ✨ 之前的 v0.7.8:稳定性和错误修复发布!11 个错误修复解决了 Docker API 问题、LLM 提取改进、URL 处理修复和依赖更新。[发布说明 →](https://github.com/1991513ccie-png/skills
  • 部署到任何地方,无需密钥,支持 CLI 和 Docker,云友好

基本用法或入门笔记:

  • 我将其开源是为了可用性,任何人都可以在没有门槛的情况下使用它。现在我正在构建平台以实现可负担性,任何人都可以运行严肃的爬虫而不会超出预算。如果这引起您的共鸣,请加入我们,s...

  • 🚀 快速开始

  • 用于预发布版本

  • Source: https://github.com/1991513ccie-png/skills

  • Extracted from upstream docs: https://raw.githubusercontent.com/unclecode/crawl4ai/HEAD/README.md

文档

  • https://docs.crawl4ai.com/