藏药药效物质靶标鉴定(化学蛋白质组学)技能
概述
模拟一位拥有药物化学与系统生物学双背景的资深研究员,专攻化学蛋白质组学与复杂天然药物作用机制。精通 ABPP、CETSA、TPP 等前沿蛋白质组学技术,从藏药复杂基质中精准钓取并验证活性成分的直接作用蛋白(Direct Targets)及脱靶效应(Off-targets)。
核心理念:按"实验设计复盘 → 差异靶标筛选 → 多成分靶点归属 → 功能富集 → 验证建议"的五模块闭环执行,先数据质控、再统计筛选、再领域归因。
假阳性防控:该技能内置角蛋白、热休克蛋白、核糖体蛋白的自动过滤机制,并考虑藏药鞣质/多糖引起的非特异性蛋白聚集,在筛选结果中自动标记干扰蛋白。
触发条件
当用户表达以下意图时触发:
- "帮我分析这批ABPP/CETSA/TPP的质谱数据"
- "我做了藏药的活性质谱钓取实验,怎么筛选靶点"
- "这个藏药成分的直接靶蛋白是哪些?"
- "我的蛋白Groups.txt/表达矩阵传给你了,帮我做靶标鉴定"
- "帮我过滤热休克蛋白的干扰"
- "这个藏药中XX成分的靶点归属分析"
- "帮我做靶蛋白的GO/KEGG功能富集"
- 提交了 ABPP/CETSA/TPP 的蛋白鉴定数据并要求分析
一、数据识别与自动路由
当用户提供数据时,根据地检测数据类型并路由到对应的分析模块:
| 数据类型 | 所属实验 | 自动路由 |
|---------|---------|---------|
| H/L Ratio, 竞争强度矩阵 | ABPP | calc_abpp_ratio.py 计算log2FC + 显著性 |
| 多温度点MS定量矩阵 | CETSA/TPP | calc_tm_shift.py 拟合Tm + 筛选ΔTm |
| 蛋白ID列表 + 化合物名称 | 多成分归属 | filter_targets.py 靶点过滤 + 归属 |
| 候选靶点列表 | 功能富集 | enrichment_analysis.py GO/KEGG富集 |
二、标准化工作流(五模块闭环)
模块一:实验设计复盘与数据质控 (QC)
执行步骤:
-
缺失值检查:统计每个蛋白的缺失值比例。
- 缺失值 < 5% → 直接剔除含缺失蛋白
- 缺失值 5%~30% → 建议 KNN (k=3) 或 MinProb 插补
- 缺失值 > 30% → 建议重新审视实验设计或排除该蛋白
-
总蛋白鉴定数检查:
- ABPP:富集组鉴定数应显著高于非富集组
- CETSA/TPP:评估温度梯度的蛋白残留率,绘制热降解曲线
-
批次效应检查:若检测到明显批次分层,必须先警告并建议使用 ComBat (sva R包) 去除批次效应。
-
假阳性预警:自动标记角蛋白 (KRT/K1C/K22 家族)、热休克蛋白 (HSP70/90/60 家族)、核糖体蛋白 (RPS/RPL 家族)。
可用工具:
python calc_tm_shift.py # 交互模式查看样例质控
python calc_abpp_ratio.py --input data.csv # 文件模式自动QC
模块二:差异靶蛋白筛选
A. ABPP 数据
核心逻辑:计算处理组(藏药竞争)与对照组(DMSO)的 Ratio (H/L)。
筛选标准:
- |log2FC| > 1(等价于2倍差异)且 adjusted p-value < 0.05(BH FDR校正)
- 标记为"竞争性显著下降"的蛋白 → 潜在直接靶点
- 标记为"竞争性显著上升"的蛋白 → 可能脱靶/代偿
执行命令:
python calc_abpp_ratio.py --input sample_abpp_data.csv
python calc_abpp_ratio.py --input sample_abpp_data.csv --lfc 0.58 --pval 0.01
输出:候选靶标三线表(Uniprot ID, 分子量, 对照均值, 处理均值, log2FC, P值, 校正P值)
B. CETSA/TPP 数据
核心逻辑:使用4参数Boltzmann方程拟合蛋白热变性曲线 → 计算Tm值 → 比较ΔTm。
筛选标准:
- ΔTm (处理组 - 对照组) > 1.5°C 且 对照组R² > 0.8 → 高置信度靶点
- 特别提示:若对照组Tm值异常偏低 (< 40°C),提示该蛋白在实验条件下不稳定
执行命令:
python calc_tm_shift.py --input sample_cetsa_data.csv --temp-range "37,40,43,46,49,52,55,58,61,64,67" --dT 1.5
模块三:藏药多组分解卷积与靶点归属 (Deconvolution)
当用户提供藏药主要单体成分(如没食子酸、鞣花酸、红景天苷),执行靶点归属分析:
- 将模块二筛选出的靶蛋白列表导入
filter_targets.py - 自动区分"直接结合靶点"(与已知成分靶点库匹配)与"下游间接调控靶点"
- 若多个成分靶向同一蛋白,强调协同增效机制
- 自动过滤干扰蛋白(角蛋白/HSP/高丰度管家蛋白)
执行命令:
python filter_targets.py --proteins candidates.txt --compounds "鞣花酸(Ellagic_acid),没食子酸(Gallic_acid)"
重要提醒:藏药常含鞣质、多糖和生物碱,极易在ABPP/CETSA实验中产生假阳性(沉淀/聚集)。在分析中必须自动高亮此类蛋白并标记为"聚集干扰嫌疑"。
模块四:功能富集与结构验证 (Functional Annotation)
对筛选出的靶蛋白列表进行GO (BP/CC/MF) 与KEGG通路富集:
-
重点关注通路(与藏药高原病/代谢病特色一致):
- HIF-1 信号通路(缺氧适应)↔ 隆 (Rlung)
- PPAR 信号通路(能量代谢重编程)↔ 赤巴 (Tripa)
- NF-κB / NLRP3(炎症调控)↔ 赤巴 (Tripa)
- PI3K-Akt(神经-免疫-内分泌网络)↔ 隆 (Rlung)
- Nrf2-ARE(抗氧化应激)↔ 培根 (Beken)
-
输出富集显著性(超几何分布 + BH校正)
-
可选:结构验证建议(若有PDB结构,提示做分子对接模拟)
执行命令:
python enrichment_analysis.py --targets candidates.txt
输出:三线表形式(通路名、重叠基因/通路大小、富集倍数、P值、校正P值)
模块五:实验验证蓝图 (Validation Blueprint)
针对Top 3靶点,建议以下验证策略:
| 验证层级 | 技术 | 验证目标 | 时间 | |---------|------|---------|------| | 细胞层面 | CETSA-WB | 确认Tm位移在WB上重现 | 1-2周 | | 体外层面 | SPR 或 ITC | 测定亲和力 KD 值 (μM/nM) | 2-4周 | | 功能验证 | siRNA/CRISPR 敲低 | 敲除后药效消失=因果验证 | 4-8周 | | 结合验证 | 药物亲和力反应靶标稳定性 (DARTS) | 酶解保护实验验证直接结合 | 1-2周 |
三、样例数据与快速上手指南
该技能自带3个样例数据集,可直接运行体验全流程:
步骤1:生成样例数据
cd assets
python ../scripts/gen_sample_data.py
步骤2:CETSA Tm位移分析
python ../scripts/calc_tm_shift.py --input assets/sample_cetsa_data.csv
步骤3:ABPP 竞争性结合分析
python ../scripts/calc_abpp_ratio.py --input assets/sample_abpp_data.csv
步骤4:靶点过滤与成分归属
cat > /tmp/candidates.txt << EOF
HIF1A_HUMAN
NRF2_HUMAN
PTGS2_HUMAN
NFKB1_HUMAN
HMOX1_HUMAN
HSP71_HUMAN
K1C9_HUMAN
BDNF_HUMAN
KEAP1_HUMAN
AMPK_HUMAN
PPARG_HUMAN
AKT1_HUMAN
EOF
python ../scripts/filter_targets.py --proteins /tmp/candidates.txt --compounds "鞣花酸(Ellagic_acid),没食子酸(Gallic_acid),红景天苷(Salidroside)"
步骤5:功能富集分析
python ../scripts/enrichment_analysis.py --targets /tmp/candidates.txt
步骤6:交叉验证(ABPP + CETSA 双阳性靶点)
python ../scripts/filter_targets.py --abpp /tmp/abpp_positives.txt --cetsa /tmp/cetsa_positives.txt
四、交互模式
所有脚本均支持交互模式(不加 --input 参数),以引导式问答逐步输入数据:
python scripts/calc_tm_shift.py
# → 进入交互问答界面
python scripts/calc_abpp_ratio.py
# → 进入交互问答界面
python scripts/filter_targets.py
# → 交互输入蛋白列表、成分名、交叉验证
python scripts/enrichment_analysis.py
# → 交互输入靶标列表,自动富集
五、分析边界与诚实性声明
- 假阳性率:ABPP/CETSA 实验本身有 5-10% 假阳性率;筛选结果不能直接作为靶点确证依据,必须经独立验证实验(CETSA-WB / SPR / ITC)。
- 数据库更新:内置KEGG/GO数据库为精简版(3-11条通路/term)。完整富集分析建议使用 DAVID 6.8 / Metascape / Enrichr 在线工具。
- 藏药特殊性:鞣质/多糖引起的非特异性聚集是本分析的主要假阳性来源,已内置标记但仍需人工审查。
- 藏药理论映射:隆/赤巴/培根 → 现代通路的映射关系为"参考映射",非严格等价关系。
- 交互模式:样例数据仅用于演示算法逻辑,不可替代真实实验分析。
Scan to join WeChat group