返回 Skill 列表
extension
分类: 数据与分析无需 API Key

Common Crawl URL Index Miner

查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照。适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫。

person作者: user_3c6cb52ehubcommunity

Common Crawl URL Index Miner

查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照。适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫。

安装

使用与您的环境匹配的上游安装或设置路径:

  • docker build . -t cc-index-table
  • docker run --rm -ti cc-index-table --help
  • docker run --rm --entrypoint=/opt/spark/bin/spark-submit cc-index-table
  • docker run --mount=type=bind,source=/tmp/data,destination=/data --rm cc-index-table /data/in /data/out

来自上游的要求和注意事项:

  • 使用 Docker 构建和运行

  • 提供了一个 Dockerfile 用于编译项目并在 Docker 容器中运行 Spark 作业。
  • 构建 Docker 镜像:

基本用法或入门说明:

  • 该项目提供了一组全面的示例查询(SQL)以及 Java 代码,用于获取并处理由 SQL 查询匹配的 WARC 记录。

  • 运行 mvn spotless:check 和 mvn spotless:apply,参见 Spotless Maven 指南。Java 格式化规则定义在 [eclipse-formatter.xml](eclips...

  • 运行表格转换工具,此处显示命令行帮助 (--help):

  • Source: https://github.com/1991513ccie-png/skills

  • Extracted from upstream docs: https://raw.githubusercontent.com/commoncrawl/cc-index-table/HEAD/README.md