中药新药质量分析技能(tcm-newdrug-qc-analysis)
Overview
以中药(含藏药、民族药)质量标准研究分析专家的身份,处理从色谱原始数据 → 含量测定 → 指纹图谱相似度 → 化学计量学建模 → CTD 申报数据报告的全链条分析任务。核心输入为色谱峰面积数据、含量测定数据或"时间-信号"原始谱数据(AIA/CDF 先在工作站导出为 CSV),核心输出为可复现的计算结果、判定结论、图谱与 ALCOA+ 计算日志。
与现有技能的分工边界(避免重复加载):
tcm-qc-chemometrics:侧重学术论文写作支持与 R 语言代码(stats/factoextra/ropls)——本技能侧重可执行 Python 计算引擎 + CTD 申报输出 + 商业软件交叉验证,并额外覆盖 QAMS、总量统计矩、PLSR、色谱数据预处理(本技能缺失项)。physicochemical-chromatography:侧重 HPLC/GC 方法开发指导与理化检测知识问答——本技能不替代方法设计,只做数据计算与统计。tcm-rd-basic-stats:基础统计计算引擎(t检验/ANOVA/Cpk)——方法学验证的统计计算可与之接力,但含量/指纹图谱/化学计量学专属计算用本技能脚本。
工作流程总览
- 需求澄清:确认分析类型(含量测定 / 指纹图谱 / 化学计量学 / 组合)、数据格式(峰面积矩阵 CSV、含量 CSV、"时间-信号"CSV)、分组信息、报告用途(申报/论文/内部研究)。
- 模块选择:按需求选择下方对应模块与脚本;组合任务按"含量测定 → 指纹图谱 → 化学计量学"顺序执行。
- 计算执行:运行对应脚本(CLI 或 Python API),检查输出判定结论与异常提示。
- 交叉验证:按各模块"一致性核对清单"与商业软件比对,记录核对结果。
- 报告输出:按 CTD 章节结构汇总(见
references/data-integrity-ctd.md),附带计算日志。
模块一:含量测定数据处理
脚本:scripts/quantitative_analysis.py(numpy 实现,无需 pandas)
python3 quantitative_analysis.py --demo # 演示自测(含全部功能验证)
python3 quantitative_analysis.py --std std.csv --sample sample.csv \
--volume 25 --dilution 10 --mass 0.5002 --unit mg/g # 标准曲线+含量计算
python3 quantitative_analysis.py --recovery rec.csv # 加标回收率
python3 quantitative_analysis.py --precision prec.csv # 精密度 RSD
- 标准曲线:输入 CSV 两列
[浓度, 峰面积](内标法传峰面积比);输出回归方程 y=ax+b、r、R²、斜率/截距标准误、各浓度点相对偏差(异常点标识)、残差;线性判定 r≥0.999。 - 含量计算:
浓度=(峰面积-b)/a;支持 mg/g、%、ug/mL 单位换算(含量 = 浓度×定容体积×稀释倍数/取样量);输出各批次均值、SD、RSD%。 - QAMS:RCF f=(A_s/C_s)/(A_x/C_x),多点校正取均值;RCF 的 RSD% 要求≤5%;QAMS 含量 = (A_x×C_s)/(A_s×f);与外标法结果比对(偏差一般≤5%)。
- LOD/LOQ:曲线法 LOD=3.3σ/S、LOQ=10σ/S(σ 默认回归标准误,也可传空白响应 SD);信噪比法 S/N=3/10。
- 方法学验证:分离度 Rs≥1.5;回收率 98%–102%、RSD≤2%(中药复杂基质可按品种放宽至 95%–105%);重复性/中间精密度/重现性 RSD 评价;耐用性不同条件下结果 RSD。
- 一致性核对:回归系数、r、含量数值、RSD 与 Waters Empower / Agilent OpenLAB 输出比对(同输入差异应 <0.1%),核对要点见
references/quantitative-analysis.md第六节。
模块二:指纹图谱/特征图谱分析
脚本:scripts/fingerprint_analysis.py
python3 fingerprint_analysis.py --demo # 演示自测
python3 fingerprint_analysis.py --peaks peaks.csv --rt rts.csv # 峰面积矩阵直接分析
python3 fingerprint_analysis.py --signals sig.csv --method both # 时间-信号原始谱全流程
- 数据输入:峰面积矩阵 CSV(首行
[样品名, 峰1, 峰2, ...])直接计算;"时间-信号"CSV(首列时间)自动完成基线校正(ALS 近似)→ 峰识别(一阶导数+信噪比阈值)→ 共有峰匹配(RT 窗口)。AIA/CDF 文件先在工作站导出为 CSV。 - 相似度算法(报告必须标注所用算法):
- 夹角余弦 cosθ=(Σxᵢyᵢ)/(√Σxᵢ²·√Σyᵢ²)
- 相关系数(Pearson)
- 总量统计矩:AUCT(零阶)、MCTT(一阶)、VCTT(二阶)
- 共有峰分析:输出峰号、RRT 均值/RSD、RPA 均值/RSD 模式表(参照峰=参照物或 S 峰)。
- 判定:指纹图谱相似度**≥0.90**(品种标准另有规定的从其规定);特征图谱按特征峰数及 RT/RRT 命中自动判定。
- 一致性核对:相同峰面积矩阵输入时,夹角余弦/相关系数结果应与国家药典委**"中药色谱指纹图谱相似度评价系统"**一致(浮点误差内),核对要点见
references/fingerprint-analysis.md第五节。 - 可视化:叠加色谱图(PNG 300dpi,含对照图谱虚线)、共有峰标注图、相似度热图。
模块三:化学计量学与多元统计分析
脚本:scripts/chemometrics_analysis.py(numpy + scipy + matplotlib)
python3 chemometrics_analysis.py --demo # 演示自测
python3 chemometrics_analysis.py --data X.csv --group g.csv --method hca
python3 chemometrics_analysis.py --data X.csv --group g.csv --method pca
python3 chemometrics_analysis.py --data X.csv --group g.csv --method opls-da --permutations 200
python3 chemometrics_analysis.py --data X.csv --group g.csv --method plsr
- HCA:距离(欧氏/马氏/Pearson)× 链接(Ward/平均/最短/最长);树状图;最佳聚类数=肘部 WSS 拐点 + 轮廓系数最大。
- PCA:Z-Score 标准化;特征值、贡献率、累计贡献率;提取规则=累计≥85% 或特征值>1(取两者较大);输出载荷/得分矩阵;Hotelling T²(95%置信限,F 分布)与 SPE/Q 统计量(95%经验限)异常样本检测;得分图、载荷图、碎石图。
- OPLS-DA:实现为正交信号校正(OSC,Wold)+ PLS-DA(等价近似,与 ropls/SIMCA 的完整 OPLS 在主要参数上一致);输出 R²X、R²Y、Q²(7 折交叉验证);置换检验默认 200 次(判据:真实 Q² 显著高于置换分布,置换 Q² 截距<0.05);VIP>1 为重要变量;输出得分图、置换检验直方图、VIP 图、S-Plot(协方差×相关载荷)。
- PLSR:多响应偏最小二乘回归;最佳成分数按交叉验证 Q² 最大选择;输出 R²、Q²、RMSE、VIP;观测 vs 预测图。
- 一致性核对:同数据同预处理时,R²X/R²Y/Q²、VIP 排序应与 SIMCA(Sartorius)/ Mev™ 一致(R²/Q² 差异通常<0.02),核对要点见
references/chemometrics.md第六节。完整 OPLS 的逐位一致建议以 ropls/SIMCA 复核。
报告输出与数据完整性
- 每个计算模块输出**"数据表 + 统计量 + 判定结论 + 标准依据"**四要素;含量测定附带完整方法学验证数据;相似度标注算法与对照图谱生成方式;化学计量学给出模型质量指标。
- 报告按 CTD 结构组织:模块3(药学)→ S.4 质量标准(S.4.2 分析方法 / S.4.3 分析方法验证 / S.4.4 标准制定依据),模板与章节说明见
references/data-integrity-ctd.md。 - 所有计算自动生成 ALCOA+ 计算日志(时间戳、输入文件 SHA256、参数、逐步计算、结果),保存于输出目录
*_audit.log。 - 数值保留位数:含量 3–4 位有效数字、RSD 2 位小数、相似度 3–4 位小数。
环境依赖
- Python ≥3.9;numpy(必需)、scipy(化学计量学聚类/统计必需)、matplotlib(绘图,可选)。环境通常无需 pandas——所有 CSV 用内置 csv 模块读取;Excel(.xlsx)导入时先用 openpyxl 转换为 CSV。
- 脚本均为独立可执行文件,含
--demo自测模式;执行前确认 Python 环境已安装所需依赖(pip install numpy scipy matplotlib)。
Resources 索引
| 文件 | 内容 | 何时加载 |
|------|------|---------|
| references/regulatory-basis.md | 5 部法规/指导原则适用条款速查(CDE 2021 质量研究指导原则、2024 特征图谱指导原则、药典 9101、药典委相似度系统、2024 中药标准管理规定) | 需要引用法规依据或核对判定标准时 |
| references/quantitative-analysis.md | 含量测定全部公式、判定标准、与 Empower/OpenLAB 一致性核对清单 | 执行模块一时 |
| references/fingerprint-analysis.md | 预处理/相似度三法/共有峰/判定标准、与药典委系统一致性核对 | 执行模块二时 |
| references/chemometrics.md | HCA/PCA/OPLS-DA/PLSR 算法与参数、模型质控指标表、SIMCA/Mev 交叉验证 | 执行模块三时 |
| references/data-integrity-ctd.md | ALCOA+ 落地方式、CTD 3.2.S.4/P.5 章节适配、报告模板 | 汇总报告时 |
| scripts/quantitative_analysis.py | 模块一计算引擎 | 含量测定任务 |
| scripts/fingerprint_analysis.py | 模块二计算引擎 | 指纹图谱任务 |
| scripts/chemometrics_analysis.py | 模块三计算引擎 | 化学计量学任务 |
微信扫一扫