返回 Skill 列表
extension
分类: 数据与分析无需 API Key

中药新药质量分析技能(质量标准研究全链条分析计算引擎)

中药新药质量分析技能(质量标准研究全链条分析计算引擎)。当用户需要对中药(含藏药、民族药)新药质量标准研究中的含量测定数据进行处理——标准曲线建立(外标/内标/标准加入法)、含量自动计算、一测多评(QAMS/相对校正因子)、LOD/LOQ、方法学验证统计(分离度/回收率/精密度/耐用性);或开展指纹图谱/特征图谱分析——数据预处理(基线校正/峰对齐)、相似度评价(夹角余弦/相关系数/总量统计矩)、共有峰分析(RRT/RPA)、相似度判定(≥0.90);或进行化学计量学多元统计分析——HCA聚类、PCA(T²/SPE异常检测)、OPLS-DA(置换检验/VIP/S-plot)、PLSR,并输出符合CTD申报要求、满足ALCOA+数据完整性的质量研究数据报告时使用。触发词:含量测定、标准曲线、线性回归、一测多评、QAMS、相对校正因子、检出限、定量限、LOD、LOQ、方法学验证、回收率、精密度、耐用性、分离度、指纹图谱、特征图谱、相似度、夹角余弦、相关系数、总量统计矩、共有峰、相对保留时间、RRT、相对峰面积、RPA、化学计量学、聚类分析、HCA、主成分分析、PCA、Hotelling、OPLS-DA、正交偏最小二乘、VIP、S-plot、置换检验、PLSR、偏最小二乘回归、中药质量研究、CTD申报、质量研究数据。计算结果可与 Waters Empower/Agilent OpenLAB、国家药典委"中药色谱指纹图谱相似度评价系统"、SIMCA/Mev 交叉验证。

person作者: user_c160f2b7hubcommunity

中药新药质量分析技能(tcm-newdrug-qc-analysis)

Overview

以中药(含藏药、民族药)质量标准研究分析专家的身份,处理从色谱原始数据 → 含量测定 → 指纹图谱相似度 → 化学计量学建模 → CTD 申报数据报告的全链条分析任务。核心输入为色谱峰面积数据、含量测定数据或"时间-信号"原始谱数据(AIA/CDF 先在工作站导出为 CSV),核心输出为可复现的计算结果、判定结论、图谱与 ALCOA+ 计算日志。

与现有技能的分工边界(避免重复加载):

  • tcm-qc-chemometrics:侧重学术论文写作支持与 R 语言代码(stats/factoextra/ropls)——本技能侧重可执行 Python 计算引擎 + CTD 申报输出 + 商业软件交叉验证,并额外覆盖 QAMS、总量统计矩、PLSR、色谱数据预处理(本技能缺失项)。
  • physicochemical-chromatography:侧重 HPLC/GC 方法开发指导与理化检测知识问答——本技能不替代方法设计,只做数据计算与统计。
  • tcm-rd-basic-stats:基础统计计算引擎(t检验/ANOVA/Cpk)——方法学验证的统计计算可与之接力,但含量/指纹图谱/化学计量学专属计算用本技能脚本。

工作流程总览

  1. 需求澄清:确认分析类型(含量测定 / 指纹图谱 / 化学计量学 / 组合)、数据格式(峰面积矩阵 CSV、含量 CSV、"时间-信号"CSV)、分组信息、报告用途(申报/论文/内部研究)。
  2. 模块选择:按需求选择下方对应模块与脚本;组合任务按"含量测定 → 指纹图谱 → 化学计量学"顺序执行。
  3. 计算执行:运行对应脚本(CLI 或 Python API),检查输出判定结论与异常提示。
  4. 交叉验证:按各模块"一致性核对清单"与商业软件比对,记录核对结果。
  5. 报告输出:按 CTD 章节结构汇总(见 references/data-integrity-ctd.md),附带计算日志。

模块一:含量测定数据处理

脚本scripts/quantitative_analysis.py(numpy 实现,无需 pandas)

python3 quantitative_analysis.py --demo                    # 演示自测(含全部功能验证)
python3 quantitative_analysis.py --std std.csv --sample sample.csv \
    --volume 25 --dilution 10 --mass 0.5002 --unit mg/g    # 标准曲线+含量计算
python3 quantitative_analysis.py --recovery rec.csv        # 加标回收率
python3 quantitative_analysis.py --precision prec.csv      # 精密度 RSD
  • 标准曲线:输入 CSV 两列 [浓度, 峰面积](内标法传峰面积比);输出回归方程 y=ax+b、r、R²、斜率/截距标准误、各浓度点相对偏差(异常点标识)、残差;线性判定 r≥0.999
  • 含量计算浓度=(峰面积-b)/a;支持 mg/g、%、ug/mL 单位换算(含量 = 浓度×定容体积×稀释倍数/取样量);输出各批次均值、SD、RSD%。
  • QAMS:RCF f=(A_s/C_s)/(A_x/C_x),多点校正取均值;RCF 的 RSD% 要求≤5%;QAMS 含量 = (A_x×C_s)/(A_s×f);与外标法结果比对(偏差一般≤5%)。
  • LOD/LOQ:曲线法 LOD=3.3σ/S、LOQ=10σ/S(σ 默认回归标准误,也可传空白响应 SD);信噪比法 S/N=3/10。
  • 方法学验证:分离度 Rs≥1.5;回收率 98%–102%、RSD≤2%(中药复杂基质可按品种放宽至 95%–105%);重复性/中间精密度/重现性 RSD 评价;耐用性不同条件下结果 RSD。
  • 一致性核对:回归系数、r、含量数值、RSD 与 Waters Empower / Agilent OpenLAB 输出比对(同输入差异应 <0.1%),核对要点见 references/quantitative-analysis.md 第六节。

模块二:指纹图谱/特征图谱分析

脚本scripts/fingerprint_analysis.py

python3 fingerprint_analysis.py --demo                               # 演示自测
python3 fingerprint_analysis.py --peaks peaks.csv --rt rts.csv       # 峰面积矩阵直接分析
python3 fingerprint_analysis.py --signals sig.csv --method both      # 时间-信号原始谱全流程
  • 数据输入:峰面积矩阵 CSV(首行 [样品名, 峰1, 峰2, ...])直接计算;"时间-信号"CSV(首列时间)自动完成基线校正(ALS 近似)→ 峰识别(一阶导数+信噪比阈值)→ 共有峰匹配(RT 窗口)。AIA/CDF 文件先在工作站导出为 CSV。
  • 相似度算法(报告必须标注所用算法)
    • 夹角余弦 cosθ=(Σxᵢyᵢ)/(√Σxᵢ²·√Σyᵢ²)
    • 相关系数(Pearson)
    • 总量统计矩:AUCT(零阶)、MCTT(一阶)、VCTT(二阶)
  • 共有峰分析:输出峰号、RRT 均值/RSD、RPA 均值/RSD 模式表(参照峰=参照物或 S 峰)。
  • 判定:指纹图谱相似度**≥0.90**(品种标准另有规定的从其规定);特征图谱按特征峰数及 RT/RRT 命中自动判定。
  • 一致性核对:相同峰面积矩阵输入时,夹角余弦/相关系数结果应与国家药典委**"中药色谱指纹图谱相似度评价系统"**一致(浮点误差内),核对要点见 references/fingerprint-analysis.md 第五节。
  • 可视化:叠加色谱图(PNG 300dpi,含对照图谱虚线)、共有峰标注图、相似度热图。

模块三:化学计量学与多元统计分析

脚本scripts/chemometrics_analysis.py(numpy + scipy + matplotlib)

python3 chemometrics_analysis.py --demo                                  # 演示自测
python3 chemometrics_analysis.py --data X.csv --group g.csv --method hca
python3 chemometrics_analysis.py --data X.csv --group g.csv --method pca
python3 chemometrics_analysis.py --data X.csv --group g.csv --method opls-da --permutations 200
python3 chemometrics_analysis.py --data X.csv --group g.csv --method plsr
  • HCA:距离(欧氏/马氏/Pearson)× 链接(Ward/平均/最短/最长);树状图;最佳聚类数=肘部 WSS 拐点 + 轮廓系数最大。
  • PCA:Z-Score 标准化;特征值、贡献率、累计贡献率;提取规则=累计≥85% 或特征值>1(取两者较大);输出载荷/得分矩阵;Hotelling T²(95%置信限,F 分布)与 SPE/Q 统计量(95%经验限)异常样本检测;得分图、载荷图、碎石图。
  • OPLS-DA:实现为正交信号校正(OSC,Wold)+ PLS-DA(等价近似,与 ropls/SIMCA 的完整 OPLS 在主要参数上一致);输出 R²X、R²Y、Q²(7 折交叉验证);置换检验默认 200 次(判据:真实 Q² 显著高于置换分布,置换 Q² 截距<0.05);VIP>1 为重要变量;输出得分图、置换检验直方图、VIP 图、S-Plot(协方差×相关载荷)。
  • PLSR:多响应偏最小二乘回归;最佳成分数按交叉验证 Q² 最大选择;输出 R²、Q²、RMSE、VIP;观测 vs 预测图。
  • 一致性核对:同数据同预处理时,R²X/R²Y/Q²、VIP 排序应与 SIMCA(Sartorius)/ Mev™ 一致(R²/Q² 差异通常<0.02),核对要点见 references/chemometrics.md 第六节。完整 OPLS 的逐位一致建议以 ropls/SIMCA 复核。

报告输出与数据完整性

  • 每个计算模块输出**"数据表 + 统计量 + 判定结论 + 标准依据"**四要素;含量测定附带完整方法学验证数据;相似度标注算法与对照图谱生成方式;化学计量学给出模型质量指标。
  • 报告按 CTD 结构组织:模块3(药学)→ S.4 质量标准(S.4.2 分析方法 / S.4.3 分析方法验证 / S.4.4 标准制定依据),模板与章节说明见 references/data-integrity-ctd.md
  • 所有计算自动生成 ALCOA+ 计算日志(时间戳、输入文件 SHA256、参数、逐步计算、结果),保存于输出目录 *_audit.log
  • 数值保留位数:含量 3–4 位有效数字、RSD 2 位小数、相似度 3–4 位小数。

环境依赖

  • Python ≥3.9;numpy(必需)、scipy(化学计量学聚类/统计必需)、matplotlib(绘图,可选)。环境通常无需 pandas——所有 CSV 用内置 csv 模块读取;Excel(.xlsx)导入时先用 openpyxl 转换为 CSV。
  • 脚本均为独立可执行文件,含 --demo 自测模式;执行前确认 Python 环境已安装所需依赖(pip install numpy scipy matplotlib)。

Resources 索引

| 文件 | 内容 | 何时加载 | |------|------|---------| | references/regulatory-basis.md | 5 部法规/指导原则适用条款速查(CDE 2021 质量研究指导原则、2024 特征图谱指导原则、药典 9101、药典委相似度系统、2024 中药标准管理规定) | 需要引用法规依据或核对判定标准时 | | references/quantitative-analysis.md | 含量测定全部公式、判定标准、与 Empower/OpenLAB 一致性核对清单 | 执行模块一时 | | references/fingerprint-analysis.md | 预处理/相似度三法/共有峰/判定标准、与药典委系统一致性核对 | 执行模块二时 | | references/chemometrics.md | HCA/PCA/OPLS-DA/PLSR 算法与参数、模型质控指标表、SIMCA/Mev 交叉验证 | 执行模块三时 | | references/data-integrity-ctd.md | ALCOA+ 落地方式、CTD 3.2.S.4/P.5 章节适配、报告模板 | 汇总报告时 | | scripts/quantitative_analysis.py | 模块一计算引擎 | 含量测定任务 | | scripts/fingerprint_analysis.py | 模块二计算引擎 | 指纹图谱任务 | | scripts/chemometrics_analysis.py | 模块三计算引擎 | 化学计量学任务 |