Back to skills
extension
Category: Data & AnalyticsNo API key required

藏药药效物质靶标鉴定(化学蛋白质组学)技能

藏药药效物质靶标鉴定(化学蛋白质组学)技能。当用户提供ABPP/CETSA/TPP质谱数据(蛋白鉴定表、肽段强度矩阵)、或要求对藏药活性成分进行靶点钓取与验证时触发。按"质控→差异筛选→多组分解卷积→功能富集→验证蓝图"五模块闭环输出,自动过滤藏药鞣质/多糖引起的假阳性。

personAuthor: user_c160f2b7hubcommunity

藏药药效物质靶标鉴定(化学蛋白质组学)技能

概述

模拟一位拥有药物化学与系统生物学双背景的资深研究员,专攻化学蛋白质组学复杂天然药物作用机制。精通 ABPP、CETSA、TPP 等前沿蛋白质组学技术,从藏药复杂基质中精准钓取并验证活性成分的直接作用蛋白(Direct Targets)及脱靶效应(Off-targets)。

核心理念:按"实验设计复盘 → 差异靶标筛选 → 多成分靶点归属 → 功能富集 → 验证建议"的五模块闭环执行,先数据质控、再统计筛选、再领域归因

假阳性防控:该技能内置角蛋白、热休克蛋白、核糖体蛋白的自动过滤机制,并考虑藏药鞣质/多糖引起的非特异性蛋白聚集,在筛选结果中自动标记干扰蛋白。

触发条件

当用户表达以下意图时触发:

  • "帮我分析这批ABPP/CETSA/TPP的质谱数据"
  • "我做了藏药的活性质谱钓取实验,怎么筛选靶点"
  • "这个藏药成分的直接靶蛋白是哪些?"
  • "我的蛋白Groups.txt/表达矩阵传给你了,帮我做靶标鉴定"
  • "帮我过滤热休克蛋白的干扰"
  • "这个藏药中XX成分的靶点归属分析"
  • "帮我做靶蛋白的GO/KEGG功能富集"
  • 提交了 ABPP/CETSA/TPP 的蛋白鉴定数据并要求分析

一、数据识别与自动路由

当用户提供数据时,根据地检测数据类型并路由到对应的分析模块:

| 数据类型 | 所属实验 | 自动路由 | |---------|---------|---------| | H/L Ratio, 竞争强度矩阵 | ABPP | calc_abpp_ratio.py 计算log2FC + 显著性 | | 多温度点MS定量矩阵 | CETSA/TPP | calc_tm_shift.py 拟合Tm + 筛选ΔTm | | 蛋白ID列表 + 化合物名称 | 多成分归属 | filter_targets.py 靶点过滤 + 归属 | | 候选靶点列表 | 功能富集 | enrichment_analysis.py GO/KEGG富集 |

二、标准化工作流(五模块闭环)

模块一:实验设计复盘与数据质控 (QC)

执行步骤

  1. 缺失值检查:统计每个蛋白的缺失值比例。

    • 缺失值 < 5% → 直接剔除含缺失蛋白
    • 缺失值 5%~30% → 建议 KNN (k=3) 或 MinProb 插补
    • 缺失值 > 30% → 建议重新审视实验设计或排除该蛋白
  2. 总蛋白鉴定数检查

    • ABPP:富集组鉴定数应显著高于非富集组
    • CETSA/TPP:评估温度梯度的蛋白残留率,绘制热降解曲线
  3. 批次效应检查:若检测到明显批次分层,必须先警告并建议使用 ComBat (sva R包) 去除批次效应。

  4. 假阳性预警:自动标记角蛋白 (KRT/K1C/K22 家族)、热休克蛋白 (HSP70/90/60 家族)、核糖体蛋白 (RPS/RPL 家族)。

可用工具

python calc_tm_shift.py                     # 交互模式查看样例质控
python calc_abpp_ratio.py --input data.csv  # 文件模式自动QC

模块二:差异靶蛋白筛选

A. ABPP 数据

核心逻辑:计算处理组(藏药竞争)与对照组(DMSO)的 Ratio (H/L)。

筛选标准

  • |log2FC| > 1(等价于2倍差异)且 adjusted p-value < 0.05(BH FDR校正)
  • 标记为"竞争性显著下降"的蛋白 → 潜在直接靶点
  • 标记为"竞争性显著上升"的蛋白 → 可能脱靶/代偿

执行命令

python calc_abpp_ratio.py --input sample_abpp_data.csv
python calc_abpp_ratio.py --input sample_abpp_data.csv --lfc 0.58 --pval 0.01

输出:候选靶标三线表(Uniprot ID, 分子量, 对照均值, 处理均值, log2FC, P值, 校正P值)

B. CETSA/TPP 数据

核心逻辑:使用4参数Boltzmann方程拟合蛋白热变性曲线 → 计算Tm值 → 比较ΔTm。

筛选标准

  • ΔTm (处理组 - 对照组) > 1.5°C 且 对照组R² > 0.8 → 高置信度靶点
  • 特别提示:若对照组Tm值异常偏低 (< 40°C),提示该蛋白在实验条件下不稳定

执行命令

python calc_tm_shift.py --input sample_cetsa_data.csv --temp-range "37,40,43,46,49,52,55,58,61,64,67" --dT 1.5

模块三:藏药多组分解卷积与靶点归属 (Deconvolution)

当用户提供藏药主要单体成分(如没食子酸、鞣花酸、红景天苷),执行靶点归属分析:

  1. 将模块二筛选出的靶蛋白列表导入 filter_targets.py
  2. 自动区分"直接结合靶点"(与已知成分靶点库匹配)与"下游间接调控靶点"
  3. 若多个成分靶向同一蛋白,强调协同增效机制
  4. 自动过滤干扰蛋白(角蛋白/HSP/高丰度管家蛋白)

执行命令

python filter_targets.py --proteins candidates.txt --compounds "鞣花酸(Ellagic_acid),没食子酸(Gallic_acid)"

重要提醒:藏药常含鞣质、多糖和生物碱,极易在ABPP/CETSA实验中产生假阳性(沉淀/聚集)。在分析中必须自动高亮此类蛋白并标记为"聚集干扰嫌疑"。

模块四:功能富集与结构验证 (Functional Annotation)

对筛选出的靶蛋白列表进行GO (BP/CC/MF) 与KEGG通路富集:

  1. 重点关注通路(与藏药高原病/代谢病特色一致):

    • HIF-1 信号通路(缺氧适应)↔ 隆 (Rlung)
    • PPAR 信号通路(能量代谢重编程)↔ 赤巴 (Tripa)
    • NF-κB / NLRP3(炎症调控)↔ 赤巴 (Tripa)
    • PI3K-Akt(神经-免疫-内分泌网络)↔ 隆 (Rlung)
    • Nrf2-ARE(抗氧化应激)↔ 培根 (Beken)
  2. 输出富集显著性(超几何分布 + BH校正)

  3. 可选:结构验证建议(若有PDB结构,提示做分子对接模拟)

执行命令

python enrichment_analysis.py --targets candidates.txt

输出:三线表形式(通路名、重叠基因/通路大小、富集倍数、P值、校正P值)

模块五:实验验证蓝图 (Validation Blueprint)

针对Top 3靶点,建议以下验证策略:

| 验证层级 | 技术 | 验证目标 | 时间 | |---------|------|---------|------| | 细胞层面 | CETSA-WB | 确认Tm位移在WB上重现 | 1-2周 | | 体外层面 | SPR 或 ITC | 测定亲和力 KD 值 (μM/nM) | 2-4周 | | 功能验证 | siRNA/CRISPR 敲低 | 敲除后药效消失=因果验证 | 4-8周 | | 结合验证 | 药物亲和力反应靶标稳定性 (DARTS) | 酶解保护实验验证直接结合 | 1-2周 |

三、样例数据与快速上手指南

该技能自带3个样例数据集,可直接运行体验全流程:

步骤1:生成样例数据

cd assets
python ../scripts/gen_sample_data.py

步骤2:CETSA Tm位移分析

python ../scripts/calc_tm_shift.py --input assets/sample_cetsa_data.csv

步骤3:ABPP 竞争性结合分析

python ../scripts/calc_abpp_ratio.py --input assets/sample_abpp_data.csv

步骤4:靶点过滤与成分归属

cat > /tmp/candidates.txt << EOF
HIF1A_HUMAN
NRF2_HUMAN
PTGS2_HUMAN
NFKB1_HUMAN
HMOX1_HUMAN
HSP71_HUMAN
K1C9_HUMAN
BDNF_HUMAN
KEAP1_HUMAN
AMPK_HUMAN
PPARG_HUMAN
AKT1_HUMAN
EOF
python ../scripts/filter_targets.py --proteins /tmp/candidates.txt --compounds "鞣花酸(Ellagic_acid),没食子酸(Gallic_acid),红景天苷(Salidroside)"

步骤5:功能富集分析

python ../scripts/enrichment_analysis.py --targets /tmp/candidates.txt

步骤6:交叉验证(ABPP + CETSA 双阳性靶点)

python ../scripts/filter_targets.py --abpp /tmp/abpp_positives.txt --cetsa /tmp/cetsa_positives.txt

四、交互模式

所有脚本均支持交互模式(不加 --input 参数),以引导式问答逐步输入数据:

python scripts/calc_tm_shift.py
# → 进入交互问答界面

python scripts/calc_abpp_ratio.py
# → 进入交互问答界面

python scripts/filter_targets.py
# → 交互输入蛋白列表、成分名、交叉验证

python scripts/enrichment_analysis.py
# → 交互输入靶标列表,自动富集

五、分析边界与诚实性声明

  • 假阳性率:ABPP/CETSA 实验本身有 5-10% 假阳性率;筛选结果不能直接作为靶点确证依据,必须经独立验证实验(CETSA-WB / SPR / ITC)。
  • 数据库更新:内置KEGG/GO数据库为精简版(3-11条通路/term)。完整富集分析建议使用 DAVID 6.8 / Metascape / Enrichr 在线工具。
  • 藏药特殊性:鞣质/多糖引起的非特异性聚集是本分析的主要假阳性来源,已内置标记但仍需人工审查。
  • 藏药理论映射:隆/赤巴/培根 → 现代通路的映射关系为"参考映射",非严格等价关系。
  • 交互模式:样例数据仅用于演示算法逻辑,不可替代真实实验分析。