Chartbrew Open Source Reporting Platform for API and Database Dashboards
Chartbrew 是一个开源 Web 应用程序,用于从 API、SQL 和 NoSQL 数据库构建和共享实时仪表板。它具有可视化图表构建器、AI 助手、计划报告以及可嵌入的图表用于数据可视化。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
Chartbrew 是一个开源 Web 应用程序,用于从 API、SQL 和 NoSQL 数据库构建和共享实时仪表板。它具有可视化图表构建器、AI 助手、计划报告以及可嵌入的图表用于数据可视化。
解析 dbt manifest.json 和 catalog.json 以使用 dbt Core 工件 API 提取完整的模型血缘图。生成交互式 DAG 可视化和模型变更的影响分析。
xsv 是一个由 Andrew Gallant (BurntSushi) 使用 Rust 编写的快速 CSV 命令行工具包。它提供了索引、切片、分析、分割、连接、搜索、采样和统计操作,能够在 CSV 文件上实现卓越的速度和内存效率。
Trafilatura 是一个用于从网络收集文本的 Python 包和 CLI 工具。它处理爬取、下载和从原始 HTML 中提取主文本内容、元数据和评论,以 CSV、JSON、Markdown、XML 和 TXT 格式输出干净的结构化数据。
查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照。适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫。
使用 Mermaid 图表、决策点、错误状态和转换指标来可视化和映射用户流程,以优化用户旅程。
Maxun 是一个开源的无代码网页数据平台,可将任何网站转换为结构化、可靠的数据。它支持通过录制模式和基于大语言模型的自然语言模式进行数据提取,同时还具备爬取、抓取和搜索功能。凭借 15,000+ 的 GitHub 星标以及 SDK 和 CLI 接口,它能够处理从简单的页面抓取到复杂的自动化工作流等各种任务。
Apify SDK 是在 Apify 上构建 Actors、爬虫和数据提取工作流的官方 JavaScript SDK。它为代理提供了一种结构化的方式来运行抓取任务、存储输出、管理输入,并在需要时将爬虫逻辑与浏览器自动化结合起来。
为Snowflake、BigQuery和Redshift生成和验证dbt(数据构建工具)模型、测试和文档。解析dbt manifest.json以分析DAG血缘关系并检测循环依赖。
查询Common Crawl Index API进行大规模网络存档研究和数据提取。使用CDX Server API、warcio进行WARC记录解析,以及Common Crawl S3存储桶进行批量数据访问。
通过 Apify Client SDK 协调 Apify actors 进行大规模网络爬取。通过 Apify API v2 管理 actor 运行、数据集导出和代理配置。
使用 Snowflake 信息模式和查询历史视图来分析和优化 Snowflake SQL 查询。识别仓库尺寸问题、扫描低效问题,并推荐聚类键。
使用 Great Expectations Python 库验证数据质量。将期望定义为数据的单元测试,运行验证套件,并生成人类可读的数据质量报告。
阿拉丁·AI短剧数据复盘工坊把「短剧投完后一堆后台导出 CSV,却看不出哪集跑了人、哪个钩子真有效、付费墙卡得对不对、下期拍什么」升级成一条纯本地零依赖工具链:平台后台导出(抖音/快手/视频号/B站)→多源字段归一(万单位/百分号/逗号自动清洗)→集间留存漏斗→卡点定位(P0/P1 跳失归因到开场钩子/中段拖沓/缺表态点)→钩子有效性排行(3秒率/完播率/互动率)→跨平台涨粉对比→付费墙转化与 A…
ProjectDiscovery 的 Katana 是一个用 Go 编写的快速、可配置的网页爬取和蜘蛛框架。它支持标准和无头浏览器模式、JavaScript 解析、自动表单填充,并提供结构化输出以供输入到安全和数据管道中。
使用自定义的Item Pipelines构建生产环境的Scrapy爬虫进行数据清洗和存储。使用scrapy.linkextractors.LinkExtractor进行爬取范围控制,使用带有MapCompose处理器的ItemLoader进行字段标准化。
gron将JSON转换为离散的赋值语句,使得可以使用标准Unix工具通过复杂的JSON结构进行grep搜索。它通过ungron反转该过程,将过滤后的赋值语句重新转换为有效的JSON。
Colly 是一个用于 Go 语言的快速开源爬取和爬虫框架。它适用于从简单的页面提取到异步爬虫处理大量页面集合,支持请求回调和结构化解析。
解析 dbt 项目工件(manifest.json 和 catalog.json)以构建血缘图,并识别没有测试、过时文档或缺少唯一性断言的模型。与 dbt Cloud API 集成以获取最新的运行结果,并为每个模型标注通过/失败状态。
使用 Apify MCP 服务器让兼容 MCP 的代理运行 Apify Actor,以从搜索、地图、电商、社交平台和任意网站中进行结构化提取。
一个开源的Python库,使从API、数据库和文件加载数据到结构化数据集变得简单且符合Python风格。dlt自动化模式推断、增量加载和数据规范化,支持DuckDB、BigQuery、Snowflake和Postgres等目标端。
使用 puppeteer-extra 和 stealth 插件来绕过网站反爬虫检测。与 Cheerio 集成用于 HTML 解析,通过 Bright Data API 轮换住宅代理,并使用 p-queue 进行并发控制。
Stock分析器技能,帮助AI Agent进行数据分析和洞察提取。
服务预测专家。根据数据分析预测服务需求量及变动