Back to skills
extension
Category: Data & AnalyticsNo API key required

双疾病转录组机器学习规划器

为比较两种疾病的转录组数据设计机器学习分析方案,生成特征选择、模型训练、交叉验证和解释性分析的完整流程

personAuthor: aipoch-aihubclawhub

双疾病转录组机器学习规划器

为比较两种疾病(或疾病亚型)的转录组数据设计完整的机器学习分析方案。生成从数据预处理、特征选择、模型训练、交叉验证到生物学解释的端到端流程规划和可执行代码框架。

使用场景

当你需要:

  • 设计ML流程区分两种疾病的转录组特征
  • 构建疾病分类器或预测模型
  • 识别疾病间差异表达基因的最优特征集
  • 规划模型性能评估和可解释性分析策略
  • 生成包含SHAP/LIME解释、通路富集和生物学验证的完整分析管线

工作流程

  1. 需求分析 - 确认两种疾病类型、数据来源(RNA-seq、芯片、单细胞)、样本量和研究目标
  2. 数据预处理规划 - 设计标准化、批次效应校正、低表达过滤方案
  3. 特征选择策略 - 规划差异分析、方差过滤、递归特征消除(RFE)、LASSO等方法组合
  4. 模型选择 - 根据样本量和数据特点推荐Random Forest、XGBoost、SVM、神经网络等算法
  5. 验证策略 - 设计交叉验证、留一验证、外部验证集方案
  6. 可解释性分析 - 规划SHAP值计算、特征重要性排序、决策边界可视化
  7. 生物学解释 - 设计关键基因的通路富集、PPI网络、文献验证流程
  8. 代码生成 - 输出R或Python完整分析脚本,包含注释和可视化代码

输出内容

  • 分析方案文档 - 包含算法选择依据、参数设置、验证策略的结构化方案
  • 可执行脚本 - Python(scikit-learn/XGBoost)或R(caret/randomForest)完整代码
  • 特征选择流程 - 多层筛选策略和阈值设定
  • 性能评估方案 - ROC/PR曲线、混淆矩阵、特征稳定性分析
  • 生物学解释模板 - GO/KEGG富集分析、关键基因验证实验建议

典型应用

  • 构建区分阿尔茨海默病和帕金森病的脑组织转录组分类器
  • 设计鉴别Luminal A和Luminal B型乳腺癌的基因特征集
  • 开发预测克罗恩病和溃疡性结肠炎的肠道转录组模型
  • 识别急性髓系白血病和急性淋巴细胞白血病的标志基因面板
  • 比较COVID-19重症和流感重症的免疫转录组差异模式

技术特点

  • 针对高维低样本转录组数据的ML方案优化
  • 集成类别不平衡处理(SMOTE、类权重调整)
  • 考虑批次效应和混杂因素的建模策略
  • 结合统计显著性和机器学习特征重要性的双重筛选
  • 输出符合生物医学期刊要求的模型报告和图表

示例提示

  • "设计一个ML流程,用GEO数据集区分系统性红斑狼疮和类风湿关节炎的外周血转录组"
  • "我有两组肝癌RNA-seq数据(HCC和ICC各50例),帮我规划特征选择和XGBoost建模方案"
  • "为TCGA肺腺癌和肺鳞癌数据生成完整的Python分类器代码,包含SHAP解释"
  • "设计一个稳健的交叉验证策略,用于小样本(每组20例)的疾病转录组分类"