bio-phylo-distance-calculations
使用Biopython的Bio.Phylo.TreeConstruction计算进化距离并构建系统发育树。在从比对创建距离矩阵、构建NJ/UPGMA树或生成bootstrap共识树时使用。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
使用Biopython的Bio.Phylo.TreeConstruction计算进化距离并构建系统发育树。在从比对创建距离矩阵、构建NJ/UPGMA树或生成bootstrap共识树时使用。
使用Fst、Tajima's D、iHS、XP-EHH等选择统计学方法检测自然选择的特征。计算群体分化,测试偏离中性的情况,并使用scikit-allel和vcftools识别选择性清除。在计算如Fst或Tajima's D这样的选择特征时使用。
从MS/MS数据中进行肽段-谱图匹配和蛋白质鉴定。在从串联质谱图中鉴定肽段时使用。涵盖数据库搜索、谱图库匹配以及使用靶标-诱饵方法进行FDR估计。
使用FastQ Screen检测样本污染和跨物种读取。通过与多个参考基因组进行比对,识别细菌、病毒、接头或样本交换污染。当怀疑存在交叉污染或处理易于微生物污染的样本时使用。
使用Trimmomatic和fastp根据质量分数、长度和N含量过滤reads。应用滑动窗口修剪,从reads末端移除低质量碱基,并丢弃低于阈值的reads。当reads有质量较差的尾部或需要达到下游分析所需的最低质量时使用。
使用umi_tools提取、处理并通过唯一分子标识符(UMIs)去重读段。当文库制备包括UMIs且需要精确的分子计数时使用,例如在单细胞RNA测序、低输入RNA测序或目标测序中区分PCR重复与生物学重复。
从密码子分辨率的Ribo-seq数据中检测核糖体暂停和停滞位点。在研究翻译调控、识别暂停位点或分析特定密码子的翻译动态时使用。
通过检查3核苷酸周期性和计算P位点偏移来验证Ribo-seq数据质量。在评估文库质量或确定下游分析的读取偏移时使用。
计算连锁不平衡统计量(r², D'),进行群体结构分析的LD剪枝,识别单倍型区块,并使用PLINK、scikit-allel和LDBlockShow可视化LD模式。在计算LD或剪枝变异时使用。
加载并解析质谱数据格式,包括mzML、mzXML以及量化工具输出的文件如MaxQuant的proteinGroups.txt。在使用原始或处理过的MS数据开始蛋白质组学分析时使用。处理污染物过滤和缺失值评估。
从肽鉴定中进行蛋白质分组和推断。在通过共享肽解决蛋白质不确定性时使用。使用简约法和概率方法处理蛋白质组并控制蛋白质水平的FDR。
使用fastp进行一体化读取预处理,包括接头修剪、质量过滤、去重、碱基校正和HTML报告生成。当预处理Illumina数据并希望使用单一快速工具代替单独的Cutadapt、Trimmomatic和FastQC步骤时,请使用此方法。
RNA-seq特定的质量控制,包括rRNA污染检测、链特异性验证、基因体覆盖度以及转录本完整性指标。在进行差异表达分析之前验证RNA-seq文库时使用。
预处理核糖体分析数据,包括适配器修剪、大小选择、rRNA去除和比对。在准备用于翻译下游分析的Ribo-seq读段时使用。
使用RiboCode和ORFquant检测并量化来自Ribo-seq数据的翻译开放阅读框(包括uORFs和新的ORFs)。当识别注释编码序列之外的翻译区域或量化ORF级别的翻译时使用。
在差异表达之前对RNA-seq计数矩阵进行质量控制和探索。检查离群值、批次效应和样本关系。在DE分析前评估计数矩阵质量时使用。
使用PLINK和ADMIXTURE通过PCA和混合分析来分析人口结构。识别群体聚类,评估祖先比例,可视化遗传结构,并为混合模型选择最佳K值。在使用PCA或混合分析进行人群分层分析时使用。
全基因组关联研究(GWAS)使用PLINK进行。通过逻辑/线性回归结合协变量执行病例对照和数量性状关联测试,生成曼哈顿图和QQ图以可视化结果。在运行GWAS或关联测试时使用。
蛋白质组学数据的质量控制和评估。在对蛋白质组学数据进行下游分析之前评估其质量时使用。涵盖样本指标、缺失值模式、重复相关性、批次效应和强度分布。
使用Cutadapt和Trimmomatic从FASTQ文件中去除测序接头。支持单端和双端读取,Illumina TruSeq、Nextera及自定义接头序列。当FastQC显示存在接头污染或在短读比对之前使用。
通过使用MultiQC汇总来自FastQC、比对和其他工具的指标来生成标准化的质量控制报告。在跨样本总结质量控制指标、创建可共享的质量报告或构建自动化质量控制流程时使用。
使用Biopython的Bio.Restriction在DNA序列中查找限制性内切酶切割位点。可以使用单一酶、一批酶或商用酶集合进行搜索。返回线性或环状DNA的切割位置。适用于在序列中查找限制性内切酶切割位点时使用。
计算翻译效率(TE)为核糖体占有率与mRNA丰度的比率。用于比较不同条件下的翻译调控或识别独立于转录而翻译发生变化的基因。
使用Subread featureCounts从对齐的BAM文件中计算每个基因的reads数。在处理来自STAR/HISAT2的BAM文件以生成用于DESeq2/edgeR的基因水平计数时使用。