主题
本轮方案答疑 · 复制验证、R13 定稿、AMD 分家
这一篇把定稿方案里几个容易被问倒、也容易做错的方法学概念讲清楚。都是真实决策里冒出来的问题,用本课题的真实数字回答。 📌 本方案已执行完毕,结果见 → 分家重跑定稿 · AMD 独立家族 × 外部复制结果 配套阅读:R9→R13 并发症差异说明 · 方法学审计与已知限制 · 阶段七 · 靶点验证框架
1. Discovery vs Replication:主分析和复制到底谁是谁
这是最关键、也最容易混的一对概念。
| 主分析(Discovery) | 复制(Replication) | |
|---|---|---|
| 用什么数据 | FinnGen R13 | 独立队列(MVP、IAMDGC) |
| 干什么 | 跑 MR 筛查、算 FDR、跑全部下游 | 把主分析的显著命中拿去独立队列里"再验一次" |
| 看什么 | 谁显著(FDR<0.05) | 命中的方向是否一致、是否仍显著 |
| 进不进多重校正 | 进(FDR 就在这里算) | 不进,只在结果表加一列 replicated: yes/no |
主分析永远是 FinnGen。 复制队列不是用来"扩大样本"或"合并算"的,它是一道独立的确认闸门:一个信号如果只在 FinnGen 里成立、换个国家换套定义就消失,那它很可能是 FinnGen 数据的伪影;如果在 MVP(美国退伍军人)里也成立,才算"真"。
一句话
主分析回答"谁显著",复制回答"换个独立人群还成立吗"。两者数据、样本、目的都不同,绝不能混算。
2. 是不是"有好结果"才需要复制?
准确说:复制针对的是你的阳性命中,但"是否搭复制队列"必须提前定,不能看到好结果才去找。
- 操作上确实是"有命中才有东西可复制":主分析筛出的显著"蛋白→并发症"(比如本课题的 TNFRSF10A),才拿去复制;没显著的阴性结果一般不逐个搬去复制——没有结论需要确认。
- 但设计上要 pre-specified(提前声明):高分论文的规矩是"看结果之前就写好用哪个复制队列"。看到结果好看、才去挑一个"刚好能对上"的队列——这叫 cherry-picking,是审稿人最忌讳的。
- 不复制也要如实报:命中在复制队列里没对上,照样写"未复制"。不复制不是失败,是信息(可能假阳性、可能功效不足、可能人群差异),绝不能藏。
结论:复制不是"锦上添花才做",是"提前铺好、专门用来确认那几个阳性命中是不是真的"。
3. 每个并发症的复制数据够不够?
不是每个结局都有可用的外部复制。判定标准很硬:欧洲人 + 全量 summary stats + 与暴露(UKB-PPP)无重叠,三条缺一不可。
| 并发症 | 有没有可用外部复制 | 数据 |
|---|---|---|
| 糖网 DR | ✅ 很强 | MVP GCST90475689(29,668 病例 / 402,541 对照,欧洲) |
| 糖尿病神经病变 | ✅ 很强 | MVP GCST90475676(59,205 / 375,439,欧洲) |
| 糖尿病肾病 | ⚠️ 二档 | 无 MVP;欧洲 DKD meta 中等规模(~5–8k 病例),功效有限 |
| 黄斑病变 / 黄斑水肿 | ❌ 没有 | 现有研究全是"仅显著位点"、样本小,做不了 MR 复制 |
| 新生血管青光眼 | ❌ 没有 | GWAS Catalog 无独立数据 |
| 增殖性 DR | ❌ 没有 | 全是"仅显著位点"、样本极小;R13 也删了这个端点 |
| AMD | ✅ 已有 | IAMDGC(Fritsche 2016) |
补不上的(黄斑/青光眼/增殖DR)不是失误,是客观没有——FinnGen 单源 + 在 Limitations 里披露即可。
base 糖尿病(T2D/T1D)要不要复制?
不要。 base 在设计里是参照(判断"蛋白是打中并发症本身,还是只是打中糖尿病"),不是论文的新发现。而且 base 已经用的是金标准大队列(Mahajan T2D noUKBB、MVP T1D),没有"更权威的复制"可加。复制的火力全压在并发症(novel finding)上。
4. EXMORE vs STRICT:不是换阈值,是两个表型
DM_RETINOPATHY_EXMORE 和 DM_RETINOPATHY_STRICT 是两个不同的病例定义:
| Retinopathy EXMORE | Retinopathy STRICT | |
|---|---|---|
| 病例 | 广义:10 个眼并发症端点的并集(含黄斑病变、新生血管青光眼、增殖DR、玻璃体积血…),须有糖尿病 | 狭义:仅特定编码 ICD‑10 H36.0*、ICD‑9 3620 的糖网,须有糖尿病 |
| 对照 | 糖尿病人 且排除 DM_COMPLICATIONS | 糖尿病人 且排除 视网膜病变+黄斑病变 |
| 病例数(R13) | 15,353 | 6,970 |
| 特点 | 功效高、异质性大 | 特异、干净、功效低 |
两个的对照都是"糖尿病人"(不是全人群)——这是严格设计,是本课题数据的一大加分项。
一个必须知道的坑
EXMORE 的病例包含了黄斑病变和新生血管青光眼。如果你又把 Maculopathy、NeovascGlaucoma 单独当结局报告,三者病例重叠、不独立,网络图/热图会被污染。 所以主 DR 端点用 STRICT(与那两个不重叠),EXMORE 退为敏感性分析并披露重叠。
5. 为什么只用 R13,不把 R9 当"复制"
R9 和 R13 都是 FinnGen,R13 是 R9 的样本超集(同一批人、更新的随访)。两者不是独立队列,把它们并列当"复制验证"会被审稿人一眼看穿(样本重叠 → 虚高置信度)。
- 用 R13(更大、最新),R9 退役。
- R9→R13 的一致性只能作为"稳定性说明"写一句,不能当独立复制。
- 附带事实:R9 那些细分并发症(增殖性DR、多神经病变、酮症酸中毒…)在 R13 里被 FinnGen 官方合并删除了,不是我们没下——所以"保留 R13"不只是偏好,是 R13 能提供的天花板。详见 R9→R13 并发症差异说明。
6. AMD 为什么必须和糖尿病分开
AMD(老年黄斑变性)不是糖尿病并发症——它是补体/drusen 机制驱动的独立疾病,和高血糖导致的微血管并发症是两回事。把它归进"糖尿病并发症"是科学硬伤。
落地做法(物理隔离):
- 糖尿病组 →
screen_R13_dm/:自己的热图/森林/网络 + 自己的下游 + 自己的多重校正家族。 - AMD 组 →
screen_R13_amd/:独立的图、独立的 FDR 家族、独立的下游。AMD 绝不和糖尿病共用任何一张图或一个校正家族。 - 反而可以把 AMD 当"非糖尿病视网膜病对照":某蛋白打中糖网却不打中 AMD = 并发症特异性,是加分点。
7. 附:删结局要不要重算?——不用
主分析的 **FDR 是"每个结局单独校正"**的(每个结局各自对 ~1659 个蛋白做 BH 校正)。所以:
- 删掉某个结局(R9 整套、或某个宽松 base)→ 其它结局的 p/FDR/显著性一个都不变。
- 减结局只是"抽走几列",不触发任何重算;下游只需按保留的显著蛋白重新取子集,不用重跑计算。
(唯一要真重跑的情形:新增结局,或换了暴露/引擎。删只需重出图表。)
只记三件事
- 主分析永远是 FinnGen R13;MVP/IAMDGC 只做复制确认,不进 FDR。
- 复制针对阳性命中,但要提前声明;不复制也如实报。
- AMD 和糖尿病彻底分家:分开跑、分开校正、分开作图。