Back to skills
extension
Category: Data & AnalyticsNo API key required

多组学整合策略

为转录组学、蛋白质组学和代谢组学数据分析设计多组学整合策略

personAuthor: aipoch-aihubclawhub

技能:多组学整合策略(编号:204)

概述

设计多组学(转录组学 RNA、蛋白质组学 Pro、代谢组学 Met)联合分析方案,在通路层面执行交叉验证,并提供系统生物学层面的整合分析策略。

使用场景

  • 复杂疾病的系统生物学机制研究
  • 生物标志物发现与验证
  • 药物靶点鉴定与通路验证
  • 多组学数据质量评估与一致性分析

目录结构

.
├── SKILL.md                 # This file - Skill documentation
├── config/
│   └── pathways.json        # Pathway database configuration
├── scripts/
│   └── main.py             # Main analysis script
├── templates/
│   └── report_template.md   # Analysis report template
└── examples/
    └── sample_data/         # Sample datasets

输入

必需文件

| 文件 | 格式 | 描述 | |------|------|------| | rna_data.csv | CSV | 转录组学数据:基因 ID、表达量、差异分析结果 | | pro_data.csv | CSV | 蛋白质组学数据:蛋白质 ID、丰度值、差异分析结果 | | met_data.csv | CSV | 代谢组学数据:代谢物 ID、浓度值、差异分析结果 |

输入格式规范

RNA 数据(rna_data.csv)

gene_id,gene_name,log2fc,pvalue,padj,sample_A,sample_B,...
ENSG00000139618,BRCA1,1.23,0.001,0.005,12.5,13.2,...

蛋白质数据(pro_data.csv)

protein_id,gene_name,log2fc,pvalue,padj,sample_A,sample_B,...
P38398,BRCA1,0.85,0.002,0.008,2450,2890,...

代谢物数据(met_data.csv)

metabolite_id,metabolite_name,kegg_id,log2fc,pvalue,padj,...
C00187,Cholesterol,C00187,-1.45,0.003,0.012,...

整合策略

1. ID 映射层

  • RNA → Protein:通过基因符号 / UniProt ID 进行映射
  • Protein → Metabolite:通过 KEGG/Reactome 酶-反应-代谢物进行关联
  • RNA → Metabolite:通过 KEGG 通路间接关联

2. 通路映射

支持的数据库:

  • KEGG(京都基因与基因组百科全书)
  • Reactome
  • WikiPathways
  • GO (Gene Ontology) - 生物学过程

3. 交叉验证方法

3.1 方向一致性验证

  • 同一通路中基因/蛋白质/代谢物的变化方向是否一致
  • 评分:+1(一致)、-1(相反)、0(无数据)

3.2 相关性验证

  • Pearson/Spearman 相关性分析
  • 跨组学表达谱聚类

3.3 通路富集一致性

  • 对每个组学独立进行富集分析
  • 识别共同富集通路

3.4 网络拓扑验证

  • 构建跨组学调控网络
  • 识别关键节点(Hub 基因/蛋白质/代谢物)

输出

1. 整合报告(integration_report.md

# Multi-Omics Integration Analysis Report

## Executive Summary
- Sample count: RNA=30, Pro=28, Met=25
- Mapping success rate: RNA-Pro=85%, Pro-Met=62%
- Pathway coverage: 342 KEGG pathways

## Cross-Validation Results
### Highly Consistent Pathways (Score > 0.8)
1. Glycolysis/Gluconeogenesis (Score=0.92)
2. Citrate cycle (TCA cycle) (Score=0.88)

### Conflicting Pathways (Score < -0.3)
1. Fatty acid biosynthesis (Score=-0.45)

## Recommendations
- Focus on: Energy metabolism-related pathways
- Needs verification: Lipid metabolism pathway data quality

2. 外部可视化工具(不包含)

本工具生成分析结果,可使用外部工具进行可视化。用户可将结果导出至:

| 图表类型 | 用途 | 所需外部工具 | |---------|------|---------| | Circos Plot | 跨组学关系全景 | matplotlib/circlize(用户自行安装)| | Pathway Heatmap | 通路水平变化 | seaborn/complexheatmap(用户自行安装)| | Sankey Diagram | 数据流映射 | plotly(用户自行安装)| | Network Graph | 分子相互作用网络 | networkx/cytoscape(networkx 已包含)| | Correlation Matrix | 跨组学相关性 | seaborn(用户自行安装)| | Bubble Plot | 整合富集分析 | ggplot2/plotly(用户自行安装)|

注意: 本技能专注于数据整合与分析。可视化需要用户另行安装绘图库。

3. 输出文件

| 文件 | 描述 | |------|------| | mapped_ids.json | ID 映射结果 | | pathway_scores.csv | 通路交叉验证评分 | | consistency_matrix.csv | 跨组学一致性矩阵 | | network_edges.csv | 网络边列表 | | report.html | 交互式 HTML 报告 |

使用方法

基本用法

python scripts/main.py \
  --rna rna_data.csv \
  --pro pro_data.csv \
  --met met_data.csv \
  --output ./results

高级选项

python scripts/main.py \
  --rna rna_data.csv \
  --pro pro_data.csv \
  --met met_data.csv \
  --pathway-db KEGG,Reactome \
  --id-mapping config/mapping.json \
  --method correlation+enrichment+network \
  --output ./results \
  --format html,csv,json

配置

config/pathways.json

{
  "databases": {
    "KEGG": {
      "enabled": true,
      "organism": "hsa",
      "min_genes": 3
    },
    "Reactome": {
      "enabled": true,
      "min_genes": 5
    }
  },
  "mapping": {
    "rna_to_protein": "gene_symbol",
    "protein_to_metabolite": "enzyme_commission"
  }
}

依赖项

  • Python >= 3.8
  • pandas >= 1.3.0
  • numpy >= 1.21.0
  • scipy >= 1.7.0
  • scikit-learn >= 1.0.0
  • networkx >= 2.6.0
  • matplotlib >= 3.4.0
  • seaborn >= 0.11.0
  • gseapy >= 1.0.0(通路富集分析)

参考文献

  1. Subramanian et al. (2005) PNAS - GSEA 方法
  2. Kamburov et al. (2011) NAR - ConsensusPathDB
  3. Chin et al. (2018) Nature Communications - 多组学整合方法综述

版本

  • 版本:1.0.0
  • 最后更新:2026-02-06
  • 作者:OpenClaw 生物信息学团队

风险评估

| 风险指标 | 评估 | 级别 | |----------------|------------|-------| | 代码执行 | Python/R 脚本在本地执行 | 中 | | 网络访问 | 无外部 API 调用 | 低 | | 文件系统访问 | 读取输入文件,写入输出文件 | 中 | | 指令篡改 | 标准提示词指南 | 低 | | 数据暴露 | 输出文件保存到工作空间 | 低 |

安全检查清单

  • [ ] 无硬编码凭证或 API 密钥
  • [ ] 无未授权文件系统访问(../)
  • [ ] 输出不暴露敏感信息
  • [ ] 提示词注入保护已到位
  • [ ] 输入文件路径已验证(无 ../ 遍历)
  • [ ] 输出目录限制在工作空间内
  • [ ] 脚本在沙箱环境中执行
  • [ ] 错误消息已净化(不暴露堆栈跟踪)
  • [ ] 依赖项已审计

先决条件

# Python dependencies
pip install -r requirements.txt

评估标准

成功指标

  • [ ] 成功执行主要功能
  • [ ] 输出符合质量标准
  • [ ] 优雅地处理边缘情况
  • [ ] 性能可接受

测试用例

  1. 基本功能:标准输入 → 预期输出
  2. 边缘情况:无效输入 → 优雅的错误处理
  3. 性能:大数据集 → 可接受的处理时间

生命周期状态

  • 当前阶段:草稿
  • 下一次审查日期:2026-03-06
  • 已知问题:无
  • 计划改进
    • 性能优化
    • 其他功能支持

参数

| 参数 | 类型 | 默认值 | 描述 | |-----------|------|---------|-------------| | --rna | str | 必填 | | | --pro | str | 必填 | | | --met | str | 必填 | | | --output | str | './results' | | | --databases | str | 'KEGG' | | | --create-sample | str | 必填 | 创建用于测试的样本数据 | | --format | str | 'md | |