Datasette Data Exploration and Publishing Tool
Datasette 是一个用于探索和发布数据的开源 Python 工具。它将任何 SQLite 数据库转换为带有 JSON API 的交互式网页界面,使数据记者、研究人员和开发人员能够在不编写应用程序代码的情况下共享数据集。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
Datasette 是一个用于探索和发布数据的开源 Python 工具。它将任何 SQLite 数据库转换为带有 JSON API 的交互式网页界面,使数据记者、研究人员和开发人员能够在不编写应用程序代码的情况下共享数据集。
通过 Apify Client SDK 协调 Apify actors 进行大规模网络爬取。通过 Apify API v2 管理 actor 运行、数据集导出和代理配置。
使用 Crawl4AI 运行网页爬取和数据抓取工作流,Crawl4AI 是一个开源爬虫,旨在生成 LLM 就绪的 markdown 和结构化提取输出。它支持异步爬取、浏览器自动化钩子、深度爬取、CLI 使用以及基于 Python 的数据管道。
Analytics de produto — PostHog, Mixpanel, eventos, funnels, cohorts, retencao, north star metric, OKRs e dashboards de produto. 当用户需要处理相关业务场景时使用。
在抖音直播切片场景中,把表现差异转成下一轮具体改进,交付内容改进单并以切片进房转化率复查。
Create clear, effective charts and dashboards from structured data using matplotlib, seaborn, and plotly.
数据分析专家技能。当用户提供数据表格(CSV/Excel 文件或直接粘贴的表格)并希望得到一份结构化分析、结论与行动建议时使用——尤其针对电商数据(订单/GMV/转化/复购)、用户数据(RFM 分层/同期群留存/流失)与销售数据(趋势/预测/区域品类)。内置 AARRR 海盗模型、HEART 增长质量模型、转化漏斗、RFM、同期群、SWOT/波特五力/PEST 等 7 大分析模型,覆盖"发生了什么…
通过 Puppeteer 进行无头 Chrome 爬虫,具备自动 Cookie 处理、JavaScript 渲染和基于 Cheerio 的 DOM 提取功能。可处理无限滚动和懒加载内容。
Crawlee 是 Apify 面向 Node.js 的开源爬取和抓取框架。它统一了 HTTP 抓取和浏览器自动化,增加了队列、存储、重试、代理等功能,并让开发者可以在 Playwright、Puppeteer、Cheerio 和 JSDOM 之间切换而无需重建整个管道。
查询 Common Crawl Index API 和 CC-MAIN 数据集,以大规模获取历史 URL 覆盖范围、MIME 类型和抓取快照。适用于需要广泛网页召回率的研究工作流程,而无需从头构建完整的爬虫。
YonSuite 业务数据查询与分析 CLI 工具。通过 yscli 命令行查询销售/采购/生产/库存单据、客户/供应商/物料/组织档案、CRM 商机,支持日期筛选、模糊搜索,输出表格/JSON/CSV/pretty。
本 Skill 用于识别并脱敏文本中的个人身份信息(PII),覆盖姓名、身份证、手机、住址、邮箱、银行卡、人脸等,提供遮蔽、替换、泛化、假名化策略,并按公开/内部/机密分级确定脱敏强度。属数据处理辅助工具。
当用户要做 门店热力图、城市分布热力、网点密度、开店选址可视化时启用。输入门店坐标(lng/lat 或 地址→地理编码),用高德地图热力图层生成自包含 HTML,颜色越红越密集。需联网 + 高德 Key,跨平台。
生成、筛选或解读上市公司违规案例周报,只使用董小屿违规案例库及其关联数据,并按 LatestInfoPublDate(公告日期/发布时间)选取连续 7 个自然日。用户要求“违规案例周报”“最近一周违规处罚案例”“本周处罚对象、违规事项、处罚情况或法规依据汇总”,或要求输出可交付 Word、JSON、Markdown 时使用。
当用户提到B站、哔哩哔哩、bilibili、B站视频、UP主、B站弹幕、B站番剧、B站数据、open.bilibili 时使用。帮助用户通过 B站开放平台/半开放 API 查询视频与番剧信息、UP主数据与弹幕互动分析。
在Apify平台上使用Apify SDK和RequestQueue及Dataset API部署智能网络爬虫代理。通过Apify CheerioCrawler和PlaywrightCrawler处理动态内容,并具备自动扩展功能。
为Snowflake、BigQuery和Redshift生成和验证dbt(数据构建工具)模型、测试和文档。解析dbt manifest.json以分析DAG血缘关系并检测循环依赖。
使用 Puppeteer 构建网页抓取管道,采用 page.evaluate、page.waitForSelector 和 browser.newPage。处理无限滚动、Cookie 同意横幅和反机器人检测,使用 stealth 插件。
分析大规模用户反馈数据以识别市场细分、衡量满意度、发现产品改进机会,按用户群体和情感分类组织洞察。
Analyze Excel spreadsheets, create pivot tables, generate charts, and perform data analysis. Use when analyzing Excel files, spreadsheets, tabular data, or .xlsx files.
使用 Tabula Java 库通过 tabula-py 绑定来检测和提取 PDF 文档中的表格。支持网格和流提取模式,可配置区域坐标,并输出为 pandas 数据框或 CSV 格式。
「全球GDP」单指标数据速查 Skill,隶属国家数据速查系列(母版 z-cn-data-radar)。专注该指标的最新值查询、往年历史罗列、同比/环比对比、口径百科、异常预警、跨指标联动与结果导出;复用母版方法论,联网优先+快照兜底,绝不编造数据。
官方 Firecrawl MCP 服务器将 Firecrawl 的抓取、爬取、搜索和深度研究功能暴露给 MCP 客户端。对于需要通过维护良好的 API 支持服务进行网页提取而不是手工构建抓取器的代理来说,这是一个强有力的选择。
一个开源的Python库,使从API、数据库和文件加载数据到结构化数据集变得简单且符合Python风格。dlt自动化模式推断、增量加载和数据规范化,支持DuckDB、BigQuery、Snowflake和Postgres等目标端。