bio-machine-learning-model-validation
实现嵌套交叉验证和分层划分,以对生物医学数据集进行无偏模型评估。防止生物标志物发现过程中的数据泄露和过拟合。在验证分类器或优化组学数据的超参数时使用。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
实现嵌套交叉验证和分层划分,以对生物医学数据集进行无偏模型评估。防止生物标志物发现过程中的数据泄露和过拟合。在验证分类器或优化组学数据的超参数时使用。
使用KEGG、Reactome和MetaboAnalyst将代谢物映射到生物通路。进行通路富集和拓扑分析。在生化通路背景下解释代谢组学结果时使用。
使用Bracken和Kraken2的输出进行物种丰度估计。将来自较高分类级别的读段重新分配给物种,以获得更准确的估计。当需要从Kraken2分类输出中获得准确的物种水平丰度时,请使用此方法。
从16S rRNA或ITS扩增子测序中使用DADA2推断扩增子序列变异(ASV)。涵盖质量过滤、错误学习、去噪和嵌合体去除。在处理解复用的扩增子FASTQ文件以生成用于下游分析的ASV表时使用。
使用ReactomePA包进行Reactome通路富集分析。在将基因列表与Reactome的经过同行评审的通路数据库进行对比分析时使用。执行过度表达分析和GSEA,并提供可视化和通路层次结构探索。
使用Biopython的Bio.Phylo.TreeConstruction计算进化距离并构建系统发育树。在从比对创建距离矩阵、构建NJ/UPGMA树或生成bootstrap共识树时使用。
使用Fst、Tajima's D、iHS、XP-EHH等选择统计学方法检测自然选择的特征。计算群体分化,测试偏离中性的情况,并使用scikit-allel和vcftools识别选择性清除。在计算如Fst或Tajima's D这样的选择特征时使用。
从MS/MS数据中进行肽段-谱图匹配和蛋白质鉴定。在从串联质谱图中鉴定肽段时使用。涵盖数据库搜索、谱图库匹配以及使用靶标-诱饵方法进行FDR估计。
质量控制和代谢组学数据的标准化。涵盖了基于QC的校正、批次效应去除以及数据转换方法。在对代谢组学数据进行统计分析前,用于校正技术变异。
XCMS3工作流程用于LC-MS/MS代谢组学预处理。涵盖峰检测、保留时间对齐、对应(分组)和空白填充。在将原始LC-MS数据处理成非靶向代谢组学的特征表时使用。
使用methylKit tiles、bsseq BSmooth和DMRcate检测差异甲基化区域(DMR)。当在不同实验条件或细胞类型间识别连续基因组区域的甲基化差异时使用。
使用clusterProfiler的gseGO和gseKEGG进行基因集富集分析。在分析排名基因列表时使用,以发现基因集中协调的表达变化,无需任意显著性截止值。能够检测到细微但协调的表达变化。
对分阶段和插补结果进行质量控制。通过INFO分数进行筛选,评估准确性,并为下游分析准备插补数据。在过滤低质量的插补变异或在全基因组关联研究(GWAS)前验证插补准确性时使用。
计算连锁不平衡统计量(r², D'),进行群体结构分析的LD剪枝,识别单倍型区块,并使用PLINK、scikit-allel和LDBlockShow可视化LD模式。在计算LD或剪枝变异时使用。
加载并解析质谱数据格式,包括mzML、mzXML以及量化工具输出的文件如MaxQuant的proteinGroups.txt。在使用原始或处理过的MS数据开始蛋白质组学分析时使用。处理污染物过滤和缺失值评估。
从肽鉴定中进行蛋白质分组和推断。在通过共享肽解决蛋白质不确定性时使用。使用简约法和概率方法处理蛋白质组并控制蛋白质水平的FDR。
基于MS-DIAL的代谢组学预处理作为XCMS的替代方案。涵盖峰检测、对齐、注释和导出以供下游分析使用。在处理用于R/Python分析的MS-DIAL输出文件时或偏好基于图形用户界面的预处理时使用。
使用medaka从Oxford Nanopore数据中进行组装和变异体调用。该工具使用了针对特定碱基识别器版本训练的神经网络。当改进仅使用ONT的数据组装或在没有短读段校正的情况下从Nanopore数据中调用变异体时,请使用此方法。
使用R中的methylKit进行DNA甲基化分析。导入Bismark覆盖文件,按覆盖率过滤,标准化样本,并执行统计比较。在分析单碱基甲基化模式、比较样本或准备用于DMR检测的数据时使用。
使用clusterProfiler和rWikiPathways进行WikiPathways富集分析。适用于将基因列表与社区策划的开源通路进行对比分析时。可为30多种物种执行过度表达分析和GSEA。
使用Beagle或SHAPEIT将基因型分阶段成单倍型。确定每个染色体上共同遗传的等位基因。在准备用于填补、HLA分型或需要分阶段单倍型的群体遗传分析的VCF文件时使用。
使用PLINK和ADMIXTURE通过PCA和混合分析来分析人口结构。识别群体聚类,评估祖先比例,可视化遗传结构,并为混合模型选择最佳K值。在使用PCA或混合分析进行人群分层分析时使用。
全基因组关联研究(GWAS)使用PLINK进行。通过逻辑/线性回归结合协变量执行病例对照和数量性状关联测试,生成曼哈顿图和QQ图以可视化结果。在运行GWAS或关联测试时使用。
蛋白质组学数据的质量控制和评估。在对蛋白质组学数据进行下游分析之前评估其质量时使用。涵盖样本指标、缺失值模式、重复相关性、批次效应和强度分布。