Skill 资源库

AI Skill 资源库

把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。

personuser_3c6cb52e无需 Key

dbt Model Lineage Mapper

解析 dbt manifest.json 和 catalog.json 以使用 dbt Core 工件 API 提取完整的模型血缘图。生成交互式 DAG 可视化和模型变更的影响分析。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

xsv 高性能 CSV 工具包

xsv 是一个由 Andrew Gallant (BurntSushi) 使用 Rust 编写的快速 CSV 命令行工具包。它提供了索引、切片、分析、分割、连接、搜索、采样和统计操作,能够在 CSV 文件上实现卓越的速度和内存效率。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Trafilatura 网页文本提取与爬取工具包

Trafilatura 是一个用于从网络收集文本的 Python 包和 CLI 工具。它处理爬取、下载和从原始 HTML 中提取主文本内容、元数据和评论,以 CSV、JSON、Markdown、XML 和 TXT 格式输出干净的结构化数据。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Common Crawl URL Index Miner

查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照。适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

用户流程映射

使用 Mermaid 图表、决策点、错误状态和转换指标来可视化和映射用户流程,以优化用户旅程。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Maxun无代码网页数据提取平台

Maxun 是一个开源的无代码网页数据平台,可将任何网站转换为结构化、可靠的数据。它支持通过录制模式和基于大语言模型的自然语言模式进行数据提取,同时还具备爬取、抓取和搜索功能。凭借 15,000+ 的 GitHub 星标以及 SDK 和 CLI 接口,它能够处理从简单的页面抓取到复杂的自动化工作流等各种任务。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Apify SDK for Web Scraping and Actor Automation

Apify SDK 是在 Apify 上构建 Actors、爬虫和数据提取工作流的官方 JavaScript SDK。它为代理提供了一种结构化的方式来运行抓取任务、存储输出、管理输入,并在需要时将爬虫逻辑与浏览器自动化结合起来。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

dbt Model Transformation Architect

为Snowflake、BigQuery和Redshift生成和验证dbt(数据构建工具)模型、测试和文档。解析dbt manifest.json以分析DAG血缘关系并检测循环依赖。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Common Crawl Index Query Agent

查询Common Crawl Index API进行大规模网络存档研究和数据提取。使用CDX Server API、warcio进行WARC记录解析,以及Common Crawl S3存储桶进行批量数据访问。

download39deployed_code0star0
personuser_3c6cb52e需要 API Key

Apify Web Scraper Orchestrator

通过 Apify Client SDK 协调 Apify actors 进行大规模网络爬取。通过 Apify API v2 管理 actor 运行、数据集导出和代理配置。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Snowflake 查询分析器

使用 Snowflake 信息模式和查询历史视图来分析和优化 Snowflake SQL 查询。识别仓库尺寸问题、扫描低效问题,并推荐聚类键。

download39deployed_code0star0
personuser_d18c97ea无需 Key

阿拉丁·AI短剧数据复盘工坊|集间流失漏斗·卡点定位·钩子有效性·付费转化·数据飞轮回灌选题

阿拉丁·AI短剧数据复盘工坊把「短剧投完后一堆后台导出 CSV,却看不出哪集跑了人、哪个钩子真有效、付费墙卡得对不对、下期拍什么」升级成一条纯本地零依赖工具链:平台后台导出(抖音/快手/视频号/B站)→多源字段归一(万单位/百分号/逗号自动清洗)→集间留存漏斗→卡点定位(P0/P1 跳失归因到开场钩子/中段拖沓/缺表态点)→钩子有效性排行(3秒率/完播率/互动率)→跨平台涨粉对比→付费墙转化与 A…

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Katana下一代网络爬取和蜘蛛框架

ProjectDiscovery 的 Katana 是一个用 Go 编写的快速、可配置的网页爬取和蜘蛛框架。它支持标准和无头浏览器模式、JavaScript 解析、自动表单填充,并提供结构化输出以供输入到安全和数据管道中。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

Scrapy 管道数据提取器

使用自定义的Item Pipelines构建生产环境的Scrapy爬虫进行数据清洗和存储。使用scrapy.linkextractors.LinkExtractor进行爬取范围控制,使用带有MapCompose处理器的ItemLoader进行字段标准化。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

gron 可抓取JSON扁平化工具

gron将JSON转换为离散的赋值语句,使得可以使用标准Unix工具通过复杂的JSON结构进行grep搜索。它通过ungron反转该过程,将过滤后的赋值语句重新转换为有效的JSON。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

dbt Model Lineage & Test Coverage Checker

解析 dbt 项目工件(manifest.json 和 catalog.json)以构建血缘图,并识别没有测试、过时文档或缺少唯一性断言的模型。与 dbt Cloud API 集成以获取最新的运行结果,并为每个模型标注通过/失败状态。

download39deployed_code0star0
personuser_3c6cb52e无需 Key

dlt Python 数据加载工具

一个开源的Python库,使从API、数据库和文件加载数据到结构化数据集变得简单且符合Python风格。dlt自动化模式推断、增量加载和数据规范化,支持DuckDB、BigQuery、Snowflake和Postgres等目标端。

download39deployed_code0star0
personuser_3c6cb52e需要 API Key

Puppeteer 隐身网络爬虫

使用 puppeteer-extra 和 stealth 插件来绕过网站反爬虫检测。与 Cheerio 集成用于 HTML 解析,通过 Bright Data API 轮换住宅代理,并使用 p-queue 进行并发控制。

download39deployed_code0star0