生物医学与交叉学科(AI4Science)实验设计与统计推断手册
本手册专为具有计算机科学(CS)与机器学习(ML)背景的研究者编写,旨在将生物医学论文中的实验设计、统计推断与临床评估术语归纳映射为熟悉的 CS/ML 概念,帮助快速建立交叉学科科研的严密思维模式。
一、核心思维转换(CS → AI4Science)
在从纯 CS 领域向 AI4Science / 计算生物学 / 医学 AI 转型时,需确立三个核心思维转换:
- 从“单点 Metric”到“不确定性区间”
CS 论文常直接对比单一数值(如 Accuracy $85.2\%$ vs $84.8\%$)。生物医学顶刊要求所有核心指标必须附带 $95\%$ 置信区间($95\%$ CI) 与假设检验 $p$ 值。 - 从“特征重要性”到“因果归因”
Grad-CAM 或 SHAP 等权重归因在生物医学领域仅属于“提出假设”(Hypothesis Generation),必须配合干预/敲除实验(In-silico / In-vitro Perturbation) 才能被认定为“验证假设”。 - 从“随机划分”到“实体隔离”
简单交叉验证(Random K-Fold)极易导致隐蔽的数据泄漏(Data Leakage)。数据划分必须基于患者(Patient-level)、中心(Center-level)或测序批次进行严格隔离。
二、核心术语六大模块速查
1. 研究设计与队列构建 (Study Design & Cohort Selection)
| 生物医学/临床术语 | 核心含义 | CS / ML 映射概念 |
|---|---|---|
| 前瞻性 vs. 回顾性 (Prospective vs. Retrospective) | 事先制定方案并收集未来新数据 vs. 利用既有历史病历/数据库 | 在线交互/动态数据收集 vs. 离线静态 Dataset |
| 随机对照试验 (RCT) (Randomized Controlled Trial) | 临床研究金标准:通过随机双盲将样本分入实验组与对照组 | A/B Testing(带严格变量控制的绝对对照) |
| 队列研究 vs. 病例对照 (Cohort vs. Case-Control) | 追溯暴露因素看未来结局 (队列) vs. 选定结局反查历史暴露 (病例对照) | Longitudinal Dataset(长序列数据) vs. Sub-sampling Balanced Dataset |
| 纳入/排除标准 (Inclusion/Exclusion Criteria) | 严格限定哪些样本可以进入研究、哪些必须剔除的规则 | Data Cleaning Pipeline (df.filter()) |
| 盲法 (单盲/双盲/三盲) (Blinding / Masked Evaluation) | 患者、医生、分析师不知晓具体分组,防止主观偏见 | Masked Benchmark Evaluation / 冻结标签测试 |
| 患者/中心互斥划分 (Patient/Center-level Split) | 同一患者或同一医院的数据绝不同时出现在训练集和测试集 | GroupKFold / Split by User_ID / Domain Split |
2. 偏倚控制与混杂处理 (Bias, Confounding & Domain Shift)
| 生物医学/临床术语 | 核心含义 | CS / ML 映射概念 |
|---|---|---|
| 混杂因素 / 协变量 (Confounder / Covariate) | 同时影响输入(如治疗)和输出(如痊愈)的第三方干扰变量 | Spurious Features / Shortcut Learning (虚假相关) |
| 批次效应 (Batch Effect) | 不同测序仪、试剂批次、染色设备引入的系统性技术噪音 | Covariate Shift / Hardware Domain Shift |
| 倾向性得分匹配 (PSM) (Propensity Score Matching) | 在非随机研究中,根据协变量拟合得分,匹配条件相似的对照组 | Downsampling to Balance Covariate Distributions |
| 选择性偏倚 (Selection Bias) | 入组样本无法代表真实总体(如仅招募了重症患者) | Non-i.i.d Sampling / Dataset Distribution Shift |
3. 假说声明与预注册 (Hypothesis Formulation & Protocol)
| 生物医学/临床术语 | 核心含义 | CS / ML 映射概念 |
|---|---|---|
| 预注册 / 协议冻结 (Preregistration / Protocol Freeze) | 查看数据前,提前公开并固定实验方案、对照模型及评估指标 | 评估脚本 (eval.py) 与超参数提前 Commit 冻结,防止刷分 |
| 主要/次要/探索性终点 (Primary / Secondary Endpoints) | 主结论依据的主要指标 vs. 辅助结论指标 vs. 启发性探索指标 | Primary Metric (如 mAP) vs. Auxiliary Loss / Ablation Metrics |
| 优越性检验 (Superiority Test) | 检验新方法是否显著优于标准对照组($H_1: \mu_{\text{new}} - \mu_{\text{base}} > 0$) | SOTA Baseline 突破检验 |
| 非劣效性检验 (Non-inferiority Test) | 检验新方法性能是否不差于对照组超过设定界值 $\Delta$ | 性能无损压缩/轻量化验证(Performance >= Baseline - Margin) |
| 联合门槛 / 交并门槛 (Intersection / Union Endpoints) | 判定成功必须同时满足多个条件(如精度上升 AND 耗时不变) | AND 条件门槛 / 多目标约束评价 |
| 护栏指标 (Guardrail Metric) | 防止“主指标赢了但副效应崩塌”的限制性指标 | Auxiliary Constraint Metric (如保证不爆显存/推理延迟不翻倍) |
4. 统计推断与假设检验 (Statistical Inference & Testing)
| 生物医学/临床术语 | 核心含义 | CS / ML 映射概念 |
|---|---|---|
| $p$ 值与显著性水平 ($\alpha$) (p-value & Alpha) | 假定零假设成立时,观察到当前或更极端结果的概率(通常以 $0.05$ 为限) | Hypothesis Significance Threshold |
| 统计功效 ($1-\beta$) (Statistical Power) | 当真实存在差异时,实验能够成功检测出来的概率(通常要求 $\ge 80\%$) | 避免 Type-II Error (False Negative) 的样本量充足度 |
| 95% 置信区间 (95% CI) (95% Confidence Interval) | 真实总体参数有 $95\%$ 的概率落在该区间内(常用 BCa Bootstrap 估计) | Metric Uncertainty Bound (如 $85.2\% \pm 1.4\%$) |
| 效应量 (Effect Size: Cohen’s d, HR, OR) | 变化的实际物理幅度大小,排除样本量大小对 $p$ 值的干扰 | Absolute Performance Delta ($\Delta\text{mAP} = +0.03$) |
| 多重检验校正 (Bonferroni / Holm / FDR) | 同时检验成千上万个假设(如 20000 个基因)时收紧 $\alpha$ 门槛,控制假阳性 | Multiple Hypothesis Correction (防止因多次采样“碰巧”显著) |
| 参数 vs. 非参数检验 (Parametric vs. Non-parametric) | 假设数据服从正态分布 (t-test, ANOVA) vs. 不假设分布 (Mann-Whitney, Permutation) | Gaussian Distribution Assumption vs. Distribution-Free Model |
5. 诊断/预后评估与临床效能 (Diagnostic & Clinical Utility)
| 生物医学/临床术语 | 核心含义 | CS / ML 映射概念 |
|---|---|---|
| 敏感性 / 特异性 (Sensitivity / Specificity) | 患病者被正确诊断的比例 (Recall) vs. 健康者被正确排除的比例 ($1 - \text{FPR}$) | True Positive Rate (Recall) / True Negative Rate |
| 阳性/阴性预测值 (PPV/NPV) (Positive / Negative Predictive Value) | 诊断为阳性的人中真正患病的概率 (Precision);极度受患病率影响 | Class-Imbalance Sensitive Precision / Negative Accuracy |
| 校准度与布里尔得分 (Calibration & Brier Score) | 模型预测的概率(如 $80\%$ 患病)与实际发生概率的吻合程度 | Probability Calibration (Temperature Scaling Logits) |
| 决策曲线分析 (DCA) (Decision Curve Analysis) | 计算不同临床风险阈值下,模型给患者带来的“净收益” (Net Benefit) | Cost-Sensitive Utility / Risk-Weighted Payoff Curve |
6. 因果推断与机制归因 (Causal Inference & Attribution)
| 生物医学/临床术语 | 核心含义 | CS / ML 映射概念 |
|---|---|---|
| 孟德尔随机化 (MR) (Mendelian Randomization) | 利用基因变异作为天然“工具变量”,推导暴露因素与疾病的因果关系 | Instrumental Variable Causal Inference |
| 反事实推断 (Counterfactual Inference) | 评估“如果当初没有给该患者施加此治疗,结局会如何” | Counterfactual Generation / What-if Analysis |
| 原位/计算敲除 (In-silico Perturbation) | 在模型中将某个基因表达量设为 0,观察系统输出的变化 | Node Ablation / Feature Zeroing Intervention |
三、论文写作与实验评估规范 Checklist
在撰写或审核 AI4Science 论文的 Method 与 Result 章节时,请确认以下规范是否完全符合:
- 数据划分原则:测试集划分是否按照
Patient_ID/Center_ID分组?(严禁同源样本跨训练/测试集) - Baseline 强度:对照方法是否包含该领域公认最强且最近 2 年内的 SOTA(强基线),而非仅仅与未优化的基线模型对比?
- 统计指标完整度:所有核心表格与图表中,数值后是否均标注了 $95\%$ CI(如 $0.85$ [$0.81$–$0.89$])以及具体的检验 $p$ 值?
- 多重比较控制:如果在同一个实验中比较了多个指标或数千个变量(如差异表达基因),是否应用了 FDR (Benjamini-Hochberg) 或 Holm-Bonferroni 校正?
- 护栏与限制性指标:是否同时汇报了主指标与约束指标(例如:提高了局部边缘对比度的同时,全局相关性 PCC 是否发生滑坡)?
- 代码与协议冻结:数据预处理管道、特征挑选步骤及评估逻辑是否事先写定且在看测试集结果前已彻底锁定(Protocol Freeze)?
CC BY-NC-SA 4.0
版权声明
本文由 Xiang CHEN 陈向 创作,采用 CC BY-NC-SA 4.0 协议,首发于 https://chenxofhit.xyz 个人网站。
您可以自由地:
- 分享 — 在任何媒介以任何形式复制、发行本作品
- 演绎 — 修改、转换或以本作品为基础进行创作
惟须遵守下列条件:
- 署名 — 您必须给出适当的署名,提供指向本许可协议的链接,同时标明是否(对原始作品)作了修改。您可以用任何合理的方式来署名,但是不得以任何方式暗示许可人为您或您的使用背书。
- 非商业性使用 — 您不得将本作品用于商业目的。
- 相同方式共享 — 如果您再混合、转换或者基于本作品进行创作,您必须基于与原先许可协议相同的许可协议分发您贡献的作品。
商业使用请联系:[email protected]